Скопировать текст из PDF можно тремя принципиально разными способами: обычным выделением, преобразованием документа в редактируемый формат или распознаванием OCR. Выбор зависит не от расширения файла, а от его внутренней структуры. В одном PDF действительно хранятся символы, в другом каждая страница представляет собой изображение, а в третьем текстовый слой есть, но порядок символов, шрифты или ограничения документа мешают корректной вставке. Ниже сначала определяется причина проблемы, а затем даются отдельные инструкции для Windows, macOS, браузера, iPhone, Android и Linux.
Если нужен один абзац, не стоит сразу конвертировать весь документ: достаточно инструмента выделения. Если требуется перенести десятки страниц в Word, удобнее преобразовать весь PDF. Для скана нужен OCR. Если после Ctrl+C появляются квадраты, иероглифы или перемешанные строки, повторное копирование тем же способом проблему не исправит — нужно менять метод извлечения. Для документов с ограничениями важно сначала проверить разрешения и работать только с файлом, к которому у вас есть законный доступ и, при необходимости, пароль владельца.
Почему текст из PDF не копируется: быстрая диагностика
Самая полезная проверка занимает меньше минуты. Откройте PDF, попробуйте выделить одно короткое слово, затем выполните поиск по этому же слову через Ctrl+F или Command+F. Если выделение и поиск работают, в документе есть текстовый слой. Если страница выглядит как фотография и курсор не цепляет отдельные буквы, это скан. Если текст выделяется, но команда копирования недоступна, проверьте ограничения документа. Если выделение есть и команда работает, но после вставки получаются другие символы, проблема связана с кодировкой, картой символов шрифта или порядком хранения текста.
| Симптом | Что это обычно означает | Что делать первым |
|---|---|---|
| Выделяются отдельные слова и строки | Нормальный текстовый слой | Скопировать фрагмент в PDF Commander или другом просмотрщике |
| Выделяется только вся страница как картинка | Скан или изображение внутри PDF | Запустить OCR и создать текстовый слой |
| Копирование недоступно | В документе могут быть ограничения на Content Copying | Проверить свойства и разрешения, при наличии прав снять ограничение известным паролем |
| После вставки появляются «кракозябры» | Проблемный ToUnicode/шрифт или повреждённый текстовый слой | Сравнить другой просмотрщик; если ошибка сохраняется — распознать страницу заново |
| Строки из двух колонок перемешиваются | Внутренний порядок символов не совпадает с визуальным | Копировать меньшими блоками или конвертировать с сохранением структуры |
| Таблица превращается в сплошной текст | Буфер обмена не восстанавливает табличную разметку | Использовать экспорт в DOCX/XLSX или OCR с распознаванием таблиц |
Почему PDF может выглядеть как текст, но оставаться картинкой
PDF — контейнер с фиксированной разметкой страницы. В нём могут одновременно находиться текстовые объекты, векторная графика и растровые изображения. Сканер нередко сохраняет страницу как одну большую картинку. Человек видит буквы, но для программы это пиксели. OCR анализирует изображение и добавляет распознанные символы: после этого становится доступен поиск и копирование. Именно поэтому «видно текст» и «в файле есть текстовый слой» — разные состояния.
Почему появляются неправильные символы
PDF хранит не только сами глифы, но и сведения о шрифте и сопоставлении кодов символам Unicode. Если сопоставление отсутствует или создано нестандартно, просмотрщик способен нарисовать правильную букву, но в буфер обмена отправляет другой символ. В такой ситуации смена шрифта уже после вставки обычно не помогает: ошибка возникла раньше, на этапе извлечения. Практичный выход — открыть файл в другом движке PDF; если результат тот же, заново получить текст через OCR.
Почему колонки, переносы и абзацы ломаются
В PDF текст может храниться набором отдельных фрагментов с координатами, а не последовательностью абзацев. Поэтому две визуальные колонки иногда копируются по строкам попеременно. Мягкие переносы превращаются в реальные разрывы строк, а отдельные слова могут получить лишние пробелы. Чем сложнее верстка, тем выгоднее конвертация в DOCX или специализированное извлечение, а не Ctrl+A и Ctrl+C.
Windows: как скопировать текст из PDF
Для Windows рационально начинать с локального редактора: так файл не отправляется на сторонний сервер, а при проблеме со сканом можно сразу перейти к OCR. Первый практический способ — PDF Commander: он закрывает прямое копирование, перенос всего документа в редактируемый формат и OCR сканов. Затем рассмотрены Adobe Acrobat Reader, Word, ABBYY FineReader, Foxit PDF Reader, Icecream PDF Editor и другие варианты для разных сценариев.
PDF Commander — основной способ для обычного PDF и скана
PDF Commander подходит для трёх сценариев в одном рабочем процессе: выделить готовый текст, преобразовать многостраничный документ в редактируемый формат и распознать PDF-скан. Для обычного файла не нужно запускать OCR: лишнее распознавание может внести ошибки в символы, которые уже были корректными. Сначала проверьте прямое выделение.
Как скопировать отдельный фрагмент
- Откройте документ и перейдите в режим «Редактировать». Этот режим нужен, чтобы программа работала с текстовыми объектами страницы, а не только показывала PDF.
- Протяните курсор по нужным словам или абзацу. Если выделение идёт по символам, текстовый слой уже существует и OCR не требуется.
- Щёлкните по выделению правой кнопкой и выберите «Копировать». Для стандартного буфера обмена также используется Ctrl+C.
- Перейдите в Word, Блокнот, почтовый редактор или другое приложение и вставьте фрагмент через Ctrl+V. Сразу сравните начало и конец выделения, цифры, дефисы и спецсимволы с оригиналом.


Как перенести большой документ, а не копировать по странице
Для десятков страниц ручное выделение неудобно. В этом случае используйте преобразование PDF. Текстовый формат TXT удобен, когда важны только символы; DOCX лучше подходит для заголовков, абзацев, списков и таблиц. Если исходник содержит сложную структуру, после экспорта всё равно нужно проверить порядок блоков: фиксированная PDF-верстка не всегда однозначно превращается в потоковый документ Word.
- Откройте инструмент «Конвертировать PDF» и добавьте исходный файл.
- Выберите выходной формат. Для продолжения редактирования используйте DOCX; для чистого текста — TXT.
- Если в окне доступны параметры сохранения структуры, изображений и распознавания, выбирайте их по типу исходника: нормальному текстовому PDF OCR не нужен, а скану нужен.
- Запустите конвертацию, откройте результат и уже в текстовом редакторе используйте Ctrl+A, Ctrl+C и Ctrl+V.


Как скопировать текст со скана через OCR
Если курсор не выделяет слова, запустите распознавание. OCR должен применяться к исходному изображению страницы, а результат нужно проверять особенно внимательно в датах, номерах договоров, формулах и фамилиях. Низкое качество скана, перекос, тени и слишком мелкий шрифт увеличивают число ошибок.
- Откройте сканированный PDF и перейдите на вкладку «Распознавание». Нажмите «Распознать текст».
- Укажите объём обработки: «Текущая страница», все страницы или нужный диапазон. Для чёткого скана используйте быстрый режим; для сложной страницы с низким контрастом и повреждениями предусмотрен интеллектуальный режим.
- Если нужен отдельный текстовый результат, включите «Извлечь текст» и «Сохранять в новый файл». Если требуется сохранить исходный вид PDF и сделать его доступным для поиска и копирования, выберите «Добавить невидимый слой текста».
- Выберите язык документа. Для двуязычного материала отмечайте только реально присутствующие языки: например, русский и английский.
- Нажмите «Распознать» и дождитесь обработки. После этого проверьте поиск по одному характерному слову и возможность выделить отдельный фрагмент.
- Скопируйте нужный текст обычным способом. Для таблицы или сложной страницы используйте разметку областей: в разделе распознавания можно выделять, например, область типа «Колонка», чтобы OCR точнее определял порядок данных.
- Перед использованием результата сверяйте цифры, фамилии, даты, знаки препинания и специальные символы со сканом.

Плюсы:
- локальная работа с документом без обязательной загрузки в браузерный сервис;
- в одном рабочем процессе доступны прямое копирование, конвертация и OCR;
- удобен, когда сначала неизвестно, обычный PDF перед вами или скан.
Минусы:
- для простого одноразового копирования одного предложения возможностей редактора больше, чем требуется;
- OCR нельзя считать безошибочным: распознанный результат нужно сверять с исходником;
- при сложной многоколоночной верстке после экспорта возможна ручная правка порядка текста.
Adobe Acrobat Reader — копирование без конвертации
Adobe Acrobat Reader удобен для обычного PDF, где текстовый слой уже существует. Сначала проверьте разрешение на копирование: щёлкните документ правой кнопкой, откройте Document Properties, перейдите на вкладку Security и посмотрите Document Restrictions Summary. Для копирования фрагмента используется Select Tool, затем выделение и команда Copy.


- Откройте PDF в настольном Reader.
- Если текст не копируется, откройте Document Properties → Security и проверьте строку, связанную с Content Copying. Это позволяет отличить защиту от скана.
- Для обычного текста включите Select Tool, выделите фрагмент, щёлкните правой кнопкой и выберите Copy.
- Если выделить текст невозможно, в бесплатном Reader не следует искать «секретную» комбинацию клавиш: документ может быть изображением. Для такого файла нужен OCR-инструмент, например в полном Acrobat или другой программе.
Копирование всего содержимого одним действием в этом сценарии относится к настольному Acrobat Reader для Windows, а не к браузерному просмотрщику. Инструмент Snapshot копирует прямоугольную область как изображение, поэтому он не решает задачу получения редактируемого текста.
Плюсы:
- точная проверка разрешений документа;
- подходит для быстрого копирования из обычного PDF;
- не требует промежуточной конвертации, если текст уже выделяется.
Минусы:
- бесплатный Reader не заменяет полноценный OCR для сканов;
- Snapshot даёт картинку, а не текст;
- в PDF с нестандартными шрифтами вставленный текст может отличаться от видимого.
Adobe Acrobat Pro — OCR скана и проверка разрешений

Adobe Acrobat Pro нужен не для простого Ctrl+C, а для случаев, когда Reader уже показал, что документ является сканом или требует работы с распознаванием. Для сканированного PDF откройте All tools → Scan & OCR, затем выберите In this file. В диалоге укажите диапазон страниц и язык, при необходимости откройте Settings, после чего нажмите Recognize Text. Acrobat создаёт searchable text layer, поэтому текст можно искать и выделять без преобразования страницы в отдельную картинку.
- Проверьте, что обычное выделение действительно не работает или страница является изображением.
- Откройте All tools → Scan & OCR → In this file.
- Выберите страницы и язык распознавания, затем нажмите Recognize Text.
- После OCR найдите контрольное слово через поиск, выделите его и скопируйте.
- Если Copy заблокирован настройками документа, сначала проверьте свойства безопасности и используйте пароль разрешений только для документа, которым вы вправе управлять.
Плюсы:
- OCR создаёт текстовый слой прямо в PDF;
- можно задать диапазон страниц и язык;
- удобно совмещать распознавание с проверкой настроек безопасности документа.
Минусы:
- для обычного текстового PDF этот путь избыточен;
- OCR не освобождает от вычитки результата;
- сложная разметка и таблицы требуют отдельной проверки reading order.
Microsoft Word — когда нужно забрать почти весь документ
Word полезен не как PDF-просмотрщик, а как конвертер. В настольной версии откройте File → Open и выберите PDF. Word создаёт копию и преобразует её в редактируемый документ; исходный PDF не изменяется. Такой подход лучше всего работает с документами, где большую часть страницы занимает обычный текст. На сложных страницах результат может визуально отличаться от оригинала, а страница, состоящая преимущественно из графики, иногда остаётся изображением.
- Откройте File → Open и выберите PDF.
- Подтвердите создание редактируемой копии.
- После преобразования выделяйте текст уже как в обычном документе Word. Для всего содержимого используйте Ctrl+A только после проверки, что конвертация не превратила важные страницы в картинки.
- Если нужны цитаты с точной нумерацией страниц, сверяйте их с исходным PDF: после PDF Reflow переносы и количество страниц могут измениться.

После преобразования сохраните рабочую копию как DOCX, если планируете редактировать текст. При выборе формата в поле Save as проверяйте, что сохраняете именно редактируемый документ, а не снова PDF.

Word стоит выбирать для договоров, статей и инструкций с последовательным текстом. Для каталогов, бланков, сложных таблиц, формул и журнальной верстки лучше сначала проверить одну-две характерные страницы, иначе исправление структуры займёт больше времени, чем копирование нужных фрагментов вручную.
Плюсы:
- удобно сразу редактировать большой объём;
- исходный PDF остаётся неизменным;
- после преобразования доступны обычные инструменты Word.
Минусы:
- макет может отличаться от исходника;
- скан без распознавания может остаться изображением;
- не лучший способ для одного короткого фрагмента.
ABBYY FineReader PDF — для сканов, таблиц и проблемного текстового слоя
ABBYY FineReader PDF полезен, когда исходный PDF уже содержит плохой текстовый слой или состоит из сканов. В PDF Editor можно выделить строки и выбрать Copy Text. Для прямоугольной области доступна команда Copy as Text и сочетание Ctrl+Shift+C; такой режим позволяет получить текст даже из области страницы, где обычное посимвольное выделение неудобно. Фоновое распознавание создаёт текстовый слой для сканов.

- Откройте PDF в PDF Editor и сначала попробуйте обычное выделение.
- Если нужен фрагмент сложной страницы, обведите область и выберите Copy as Text. Для таблицы у FineReader предусмотрен отдельный режим копирования области как таблицы.
- Если существующий слой выдаёт неправильные символы, переключитесь на OCR вместо использования плохого текста PDF. В настройках распознавания FineReader различает использование текста из PDF и OCR.
- После OCR проверьте язык документа и сомнительные слова. Для ответственных материалов исправляйте ошибки до переноса в конечный документ.
Сильная сторона этого подхода — не только распознавание символов, но и работа с типами областей страницы. Если программа неверно определила таблицу как обычный текст, порядок ячеек можно получить неправильным, поэтому область стоит корректировать до повторного распознавания.

Плюсы:
- подходит для сканов и плохого текстового слоя;
- есть копирование прямоугольной области как текста и таблицы;
- можно проверить и исправить результаты OCR до экспорта.
Минусы:
- для обычного PDF с нормальным слоем OCR избыточен;
- результат зависит от качества изображения и правильно выбранного языка;
- сложные схемы и рукописные фрагменты требуют ручной проверки.
Foxit PDF Reader — лёгкий просмотрщик с проверкой ограничений

Foxit PDF Reader подходит для обычного текста. Если выделение есть, но копирование недоступно, откройте File → Properties → Security и посмотрите Document Restrictions Summary. Это полезнее, чем сразу считать файл «сломавшимся»: одинаковый симптом возникает и при запрете Content Copying, и при отсутствии текстового слоя.
- Откройте PDF и активируйте инструмент выбора текста.
- Выделите нужные строки и скопируйте их через Ctrl+C или контекстную команду.
- При неактивном Copy проверьте Security в свойствах документа.
- Если текст не выделяется вообще, переходите к OCR; функция Snapshot копирует область как изображение и не превращает её в редактируемые символы.
Плюсы:
- подходит для быстрого просмотра и копирования;
- есть явная проверка разрешений документа;
- можно отделить проблему защиты от проблемы текстового слоя.
Минусы:
- снимок области — это изображение, не OCR;
- нестандартные шрифты могут давать ошибки при вставке;
- для скана требуется отдельный распознающий инструмент или функция OCR соответствующей редакции продукта.
Icecream PDF Editor — простой сценарий Select → Copy
В Icecream PDF Editor последовательность короткая: откройте файл, перейдите на вкладку Edit, на левой панели выберите Select, выделите текст и затем используйте Edit → Copy или Ctrl+C. Этот способ хорош, когда PDF уже текстовый и не требуется конвертация всего документа.


Если курсор не может выделить отдельные символы, не нужно многократно менять режим Select: сначала определите, является ли страница сканом. Для OCR используйте инструмент, который явно распознаёт изображение и создаёт текстовый слой.
Плюсы:
- понятная последовательность действий для обычного PDF;
- копирование доступно через стандартную горячую клавишу;
- интерфейс показывает выделение до отправки в буфер обмена.
Минусы:
- не следует рассматривать простой Select как замену OCR;
- при больших документах быстрее конвертировать весь файл;
- сложную таблицу обычное копирование может превратить в строки без структуры.
PDFelement — прямое копирование и OCR в одном редакторе
PDFelement покрывает два разных режима. В текстовом PDF можно выделить фрагмент и выбрать Copy Text. Для изображения или скана используется OCR: откройте Tools → OCR либо запустите распознавание через уведомление Perform OCR, после чего распознанные символы становятся выделяемыми.


- Откройте файл и проверьте, выделяется ли текст.
- Для обычного слоя выделите нужный фрагмент и используйте Copy Text.
- Для скана откройте OCR, выполните распознавание нужных страниц и только после этого копируйте текст.
- Если нужен весь документ, конвертация в Word практичнее многократного копирования по странице.
Плюсы:
- обычные и сканированные PDF обрабатываются в одном приложении;
- после OCR текст становится доступен для поиска и копирования;
- можно перейти от фрагмента к экспорту всего документа.
Минусы:
- OCR добавляет отдельный этап;
- после распознавания всё равно требуется контроль результата;
- точное сохранение сложной верстки при конвертации не гарантируется самим форматом PDF.
Дополнительные программы Windows для отдельных сценариев
Дополнительный PDF-редактор имеет смысл выбирать под конкретную задачу, а не устанавливать несколько программ только ради Ctrl+C. Одни инструменты полезны для OCR, другие — для преобразования всего документа, третьи — как запасной просмотрщик, когда один PDF-движок извлекает символы неправильно.
| Инструмент | Что делает | Когда уместен | Ограничение |
|---|---|---|---|
| WPS Office | Открытие PDF и перенос в Word в рамках офисного пакета | Когда документ всё равно будет редактироваться как офисный файл | Конвертация может менять разметку; функции PDF зависят от редакции |
| Nitro PDF Pro | Работа с текстовыми PDF и преобразование | Регулярная офисная работа с PDF | Для одного фрагмента избыточен; перед OCR проверяйте тип файла |
| Nitro PDF Reader | Просмотр и копирование текста | Нужен простой просмотрщик | Скан без текстового слоя обычным Copy не решить |
| ONLYOFFICE | Открытие/редактирование документов и работа с PDF | Пользователь уже работает в ONLYOFFICE | Не подменять OCR обычным открытием: скан остаётся изображением без распознавания |
| UniPDF | Конвертация PDF в Word, изображения, HTML и обычный текст | Нужен локальный Windows-конвертер для всего документа | Это конвертер, а не OCR-инструмент для восстановления текста со скана |
| PDF Agile | OCR и извлечение текста, включая сохранение в TXT | Нужно распознать скан и затем скопировать весь извлечённый текст | После OCR обязательно сверять цифры, имена и сложную разметку |
| UPDF | Копирование текста и OCR сканированных документов | Нужен PDF-редактор с отдельным режимом распознавания | Не путать UPDF с MuPDF: это разные продукты |
| Sumatra PDF | Быстрый просмотр текстовых PDF | Слабый ПК, простой документ | Нет смысла выбирать для OCR или сложного восстановления структуры |
| PDFgear | Копирование текста и OCR выбранной области или страницы | Нужно быстро получить текст из обычного PDF или скана | Для скана сначала требуется OCR; обычное Copy работает только с доступным текстовым слоем |
| PDF-XChange Editor | Копирование и OCR страниц | Нужен Windows-редактор с распознаванием | Команды OCR зависят от редакции; проверяйте доступность функции в установленной лицензии |
| CuneiForm | OCR печатных документов | Нужен отдельный классический OCR-инструмент | Интерфейс и возможности заметно старее современных редакторов |
| OneNote | OCR изображения или распечатки файла | PDF уже используется как printout в заметках, либо нужна одна страница со скана | Это не PDF-редактор: OneNote извлекает текст из изображений страниц |
| LibreOffice | Открытие текстового PDF в Draw и копирование текстовых объектов | LibreOffice уже установлен и PDF содержит настоящий текст | Скан сам по себе не превращается в текст без OCR |
| STDU Viewer | Просмотр и выделение текста в обычных PDF | Нужен простой viewer для старого рабочего процесса | Не решает отсутствие текстового слоя |
| ABBYY PDF Transformer | Класс специализированных PDF→Word-конвертеров | Нужно перенести весь документ в редактируемый формат | Для новой работы рациональнее выбирать поддерживаемый OCR/конвертер и перепроверять разметку |


OneNote — OCR одной картинки или многостраничной распечатки PDF

OneNote полезен, если страница PDF уже вставлена в заметку как изображение или файл добавлен как printout. OCR здесь работает не с внутренней структурой PDF, а с изображениями страниц. Для одной картинки щёлкните её правой кнопкой и выберите Copy Text from Picture. Для распечатки многостраничного файла доступны Copy Text from this Page of the Printout и Copy Text from All the Pages of the Printout.
- Вставьте нужную страницу как изображение или добавьте PDF как распечатку файла в OneNote.
- Для одной картинки щёлкните её правой кнопкой и выберите Copy Text from Picture.
- Для printout щёлкните изображение страницы правой кнопкой и выберите копирование только этой страницы либо всех страниц распечатки.
- Перейдите в Word, заметку или другой редактор и нажмите Ctrl+V.
- Сверьте распознанный текст с изображением. Качество OCR зависит от читаемости и качества исходной страницы.
Этот способ особенно удобен для единичных сканов, которые уже находятся в рабочем блокноте. Для сотен страниц лучше использовать полноценный OCR-процесс: перенос всего PDF в OneNote создаёт лишний промежуточный слой изображений и усложняет контроль структуры.
macOS: как скопировать текст без установки стороннего PDF-редактора
Preview — основной встроенный способ
В macOS сначала используйте Preview. Для обычного PDF выберите Tools → Text Selection, затем выделите текст и скопируйте его. Если курсор ведёт себя как инструмент перемещения или прямоугольного выделения, причина может быть просто в неверно выбранном инструменте.


Обычный PDF
- Откройте документ в Preview.
- Выберите Tools → Text Selection.
- Протяните курсор по нужному фрагменту и нажмите Command+C.
- Вставьте текст через Command+V и проверьте порядок строк.
Скан без текстового слоя
В Preview есть отдельный системный путь для изображения PDF: File → Export → Embed Text. Preview распознаёт текст и встраивает его в PDF, после чего он становится выделяемым в PDF-просмотрщиках. Пункт отображается для документов, где текст ещё не был распознан. Это полезнее, чем сохранять каждую страницу как картинку и распознавать её по отдельности.
Если текст не выделяется
Проверьте выбранный инструмент и ограничения PDF. Если документ требует пароль или имеет запрет на копирование, работайте с доступом владельца. Не воспринимайте невозможность выделения как доказательство защиты: та же ситуация возникает у обычного скана.
Плюсы:
- встроен в macOS;
- для обычного текста не требуется конвертация;
- Embed Text создаёт текстовый слой в сканированном PDF.
Минусы:
- сложный порядок чтения PDF всё равно может нарушиться при копировании;
- OCR требует проверки;
- в старых системах набор доступных функций отличается.
Safari и браузерный просмотр PDF на Mac
Safari годится для простого текстового PDF: откройте документ, выделите фрагмент и нажмите Command+C. Браузер удобен, если файл уже открыт по ссылке и нужно забрать пару строк. Для скана рациональнее перейти в Preview и выполнить Embed Text или использовать OCR-инструмент: браузерное отображение само по себе не превращает изображение в корректный редактируемый текст во всех случаях.
WidsMob PDFEdit и ConvertPDF — копирование и полная конвертация
WidsMob PDFEdit иллюстрирует прямой подход copy/paste, а ConvertPDF — преобразование всего PDF в Word. На macOS для базового копирования сначала рациональнее использовать встроенный Preview: сторонний конвертер нужен, когда требуется перенести большой документ в редактируемый формат, а не забрать несколько строк.


Онлайн: как извлечь текст без установки программы
Онлайн-инструменты полезны для разовой задачи, но вводят дополнительный фактор: документ загружается на чужой сервер. Для публичной статьи или учебного файла это может быть приемлемо; для договоров, медицинских документов, паспортных данных, закрытой отчётности и внутренних документов компании предпочтительнее локальная обработка. Перед загрузкой изучите политику конкретного сервиса и не передавайте файл, если у вас нет права раскрывать его содержимое.
Google Drive и Google Docs — OCR и преобразование в документ
На компьютере загрузите PDF в Google Drive, щёлкните файл правой кнопкой и выберите Open with → Google Docs. Документ преобразуется, после чего текст можно копировать. Форматирование переносится не полностью: особенно проблемны таблицы, колонки, списки, сноски и концевые сноски. На телефоне этот способ не заменяет отдельное OCR-приложение: для преобразования PDF в текст через Google Drive используйте компьютерный интерфейс.


- Загрузите PDF в Google Drive.
- Щёлкните файл правой кнопкой и выберите Open with → Google Docs.
- Дождитесь создания документа Google.
- Проверьте первые и последние строки каждого важного блока, затем копируйте текст. Для таблиц и колонок обязательно сравните порядок с исходной страницей.
Плюсы:
- не требуется настольный PDF-редактор;
- способ умеет извлекать текст из изображений;
- результат сразу доступен в текстовом документе.
Минусы:
- файл загружается в облако;
- сложная верстка может измениться;
- преобразование PDF через Google Drive в Google Docs выполняйте в компьютерном интерфейсе.
Google Chrome — когда PDF уже открыт в браузере

Google Chrome удобен для обычного PDF, где текст уже выделяется. Встроенный PDF viewer также применяет OCR к сканированным документам, чтобы сделать текст searchable/selectable; распознавание выполняется на устройстве. Сначала попробуйте обычное выделение непосредственно в просмотрщике Chrome; если текст стал доступен после распознавания, скопируйте нужный фрагмент и обязательно проверьте OCR-ошибки.
Не используйте старый трюк «распечатать защищённый PDF в новый PDF» как универсальный способ снять ограничения. Он зависит от разрешений исходного документа, реализации просмотра и может нарушать условия доступа. Для документа с запретом Content Copying сначала проверяйте разрешения и получайте доступ у владельца.
Mozilla Firefox и Microsoft Edge
Mozilla Firefox и Edge подходят для обычного PDF в браузере: если можно выделить символы, используйте стандартное копирование. Их ценность — отсутствие отдельной установки PDF-редактора для короткой цитаты. Но браузер не стоит выбирать как единственный способ диагностики: если один viewer копирует «кракозябры», откройте тот же фрагмент в другом движке. Если ошибка повторяется, проблема, скорее всего, внутри текстового слоя PDF и нужен OCR.
PDF Candy — Extract Text и OCR
PDF Candy имеет два полезных сценария. Инструмент Extract Text вытаскивает текст из PDF; если текст не обнаружен, сервис сообщает о применении OCR. Отдельный PDF OCR позволяет загрузить документ, выбрать язык распознавания, запустить обработку и получить редактируемый текстовый результат. Для скана язык нужно указывать правильно: это влияет на распознавание кириллицы и похожих символов.

- Откройте Extract Text для обычного PDF или PDF OCR для явно сканированного документа.
- Добавьте файл и, для OCR, выберите язык.
- Запустите обработку.
- Скачайте текстовый результат и сравните несколько участков с оригиналом перед дальнейшим использованием.
Плюсы:
- есть отдельные инструменты для обычного текста и OCR;
- работает в браузере;
- подходит для разовой задачи.
Минусы:
- документ передаётся онлайн-сервису;
- структура сложной страницы может упрощаться;
- OCR требует ручной проверки.
PDF24 — PDF to TXT и PDF OCR

PDF24 разделяет две задачи. PDF to Text превращает PDF в TXT, что удобно для большого количества обычного текста. PDF OCR создаёт searchable PDF из скана; в настройках OCR доступны параметры вроде PDF/A, удаления артефактов и выравнивания перекошенных страниц. После OCR новый PDF можно открыть в любом просмотрщике и копировать уже распознанный текст.
- Для PDF с нормальным текстовым слоем используйте PDF to Text.
- Для скана выберите PDF OCR, добавьте файл и задайте параметры распознавания.
- После обработки сохраните результат и проверьте поиском одно характерное слово.
- Только после этой проверки копируйте большой объём текста.
Плюсы:
- отдельные инструменты для TXT и OCR;
- OCR возвращает searchable PDF;
- веб-интерфейс работает на разных ОС.
Минусы:
- обработка выполняется на сервере;
- TXT теряет визуальную разметку;
- таблицы и формулы требуют отдельного контроля.
Smallpdf — OCR, когда текст в скане не выделяется

Smallpdf предлагает PDF OCR: загрузите файл, дождитесь распознавания и получите searchable PDF. OCR превращает изображение текста в selectable text; после этого документ можно конвертировать в Word. Для дословного извлечения не нужно использовать AI-ответ о содержании документа как замену исходному тексту: генеративное резюме и копирование распознанных символов — разные операции.
- Добавьте скан в PDF OCR.
- Дождитесь создания searchable PDF.
- Откройте результат и убедитесь, что отдельные слова выделяются и находятся через поиск.
- Для дальнейшего форматирования при необходимости преобразуйте результат в Word.
Плюсы:
- очевидный OCR-процесс;
- можно получить searchable PDF и затем Word;
- подходит для разовой работы без установки.
Минусы:
- онлайн-загрузка документа;
- AI-инструменты сервиса не следует считать дословным экстрактором;
- сложные таблицы и слабые сканы требуют проверки.
iLovePDF — сделать скан searchable и selectable

iLovePDF имеет отдельный OCR PDF. Рабочая логика: загрузить PDF, выбрать основные языки, запустить OCR и открыть полученный searchable PDF; после этого текст можно выделять и копировать. При преобразовании PDF в Word OCR применяется к невыделяемому тексту сканов. Это удобный путь, когда нужен не TXT, а редактируемый офисный документ.
- Загрузите скан в OCR PDF.
- Выберите языки документа.
- Запустите OCR.
- Откройте результат, выделите тестовый фрагмент и сравните его с оригиналом. Для дальнейшей правки используйте PDF to Word с OCR, если этот формат действительно нужен.
Плюсы:
- отдельный инструмент OCR PDF;
- результат становится searchable/selectable;
- можно продолжить в Word.
Минусы:
- онлайн-обработка;
- параметры и доступность расширенных функций зависят от режима сервиса;
- OCR не отменяет проверку имён, цифр и специальных символов.
PDF2Go — PDF to Text с OCR
PDF2Go предлагает отдельный PDF to Text: сервис использует OCR и сохраняет результат как TXT. Это практичный вариант, когда оформление не нужно и требуется получить поток символов из скана, статьи или книги. TXT не сохраняет колонки, размеры шрифта и расположение объектов, поэтому для верстки или таблиц выбирайте другой формат.
- Добавьте PDF в инструмент PDF to Text.
- Для скана включите OCR и укажите язык, если интерфейс предлагает выбор.
- Запустите обработку и сохраните TXT.
- Проверьте абзацы и переносы: текстовый файл специально упрощает форматирование.
Плюсы:
- ориентирован именно на извлечение текста;
- поддерживает OCR для сканов;
- TXT легко обрабатывать и искать.
Минусы:
- теряется визуальная разметка;
- файл загружается на внешний сервер;
- табличные данные после TXT часто требуют ручной сборки.
Sejda — отдельно Extract Text и OCR
Sejda имеет два разных инструмента: PDF to Text копирует весь существующий текст в отдельный текстовый файл, а OCR Recognize Text предназначен для PDF-сканов и создаёт searchable text/PDF. Это правильное разделение: обычный текст не нужно распознавать повторно, а скан нельзя корректно обработать простым extractor без OCR.

- Если PDF текстовый, выберите Extract Text/PDF to Text.
- Если страницы являются изображениями, выберите OCR Recognize Text.
- После обработки проверьте порядок абзацев и несколько контрольных символов.
- Если документ конфиденциальный, используйте локальный инструмент вместо браузерной загрузки.
Плюсы:
- не смешивает extractor и OCR;
- есть отдельные инструменты для разных типов PDF;
- не требуется установка для браузерного режима.
Минусы:
- онлайн-обработка;
- сервисные ограничения зависят от режима обработки и учётной записи; перед большой загрузкой проверьте условия выбранного инструмента;
- сложная верстка не гарантирует идеальный порядок текста.
Soda PDF и другие онлайн-инструменты
Soda PDF, Convertio OCR, OCR2Edit, GroupDocs, Aspose, AllInPDF, PDFCreator Online, Image-to-Text и FlipHTML5 решают разные задачи, поэтому их нельзя оценивать как взаимозаменяемые сервисы. OCR нужен для сканов, PDF→TXT — когда требуется чистый текст, PDF→Word — для последующего редактирования. FlipHTML5 ориентирован также на публикацию PDF, поэтому для одноразового извлечения текста специализированный OCR или конвертер обычно требует меньше действий.
| Сервис | Основная задача в контексте этой статьи | Что проверить перед использованием |
|---|---|---|
| Soda PDF | Онлайн-работа с PDF и преобразование | Нужен ли OCR именно для вашего типа файла и какие данные уйдут в облако |
| Convertio OCR | Распознавание сканов/изображений | Правильный язык и выходной формат |
| OCR2Edit | Преобразование сканированного PDF в текст | Качество OCR на кириллице и сложной верстке |
| GroupDocs | Онлайн-просмотр/конвертация документов | Соответствие выбранного инструмента задаче извлечения текста |
| Aspose | Онлайн-инструменты для документов | Не путать конвертацию формата и OCR |
| AllInPDF | Набор PDF-конвертеров | Формат результата и сохранение структуры |
| PDFCreator Online | OCR с добавлением текстового слоя в PDF | После обработки проверить, что текст действительно выделяется и копируется |
| Image-to-Text | OCR изображения страницы | Не подходит для сохранения структуры большого PDF без дополнительных шагов |
| FlipHTML5 | Публикация/работа с PDF в веб-среде | Для простого извлечения текста специализированный converter короче по шагам |


iPhone и iPad: как скопировать текст из PDF
На iPhone сначала разделяйте обычный PDF и скан. В документе с готовым текстовым слоем достаточно мобильного PDF-просмотрщика. Для скана требуется приложение, которое действительно распознаёт существующий PDF и добавляет текстовый слой. Веб-сайт, открытый в Safari, остаётся онлайн-сервисом: это отдельный вариант, при котором файл передаётся внешнему обработчику.
PDF Expert — копирование из PDF с готовым текстовым слоем
PDF Expert на iPhone и iPad подходит для PDF, в котором текст уже searchable/selectable. Удерживайте нужный фрагмент, а в появившемся меню выберите Share. При отправке в мессенджер или почтовое приложение выбранный текст вставляется в сообщение; при сохранении в Files или передаче через AirDrop он передаётся как TXT. Для сканированного PDF без текстового слоя этот мобильный сценарий не работает: OCR в PDF Expert доступен на Mac, а не в iOS-версии.
- Откройте PDF в PDF Expert и убедитесь, что отдельные слова выделяются.
- Нажмите и удерживайте фрагмент, затем скорректируйте границы выделения.
- В появившемся меню нажмите Share и выберите приложение назначения.
- Если нужно получить отдельный текстовый файл, сохраните выбранный фрагмент в Files; для сообщения или письма текст будет вставлен непосредственно в содержимое.
- Если слова не выделяются, не ищите OCR внутри iOS-версии PDF Expert: используйте приложение для распознавания существующего PDF.

Плюсы:
- быстрое выделение и передача текста из обычного PDF;
- можно отправить выбранный фрагмент в другое приложение без конвертации всего документа;
- для Files и AirDrop доступен отдельный TXT с выбранным текстом.
Минусы:
- на iPhone и iPad этот способ требует готового текстового слоя;
- не распознаёт скан внутри iOS-версии приложения;
- на маленьком экране неудобно контролировать длинные таблицы и многоколоночные страницы.
QuickScan: PDF OCR Text Scanner — OCR существующего PDF на iPhone
QuickScan — отдельное iOS/iPadOS-приложение для сканирования и OCR. Оно умеет импортировать уже существующие PDF, распознавать текст на их страницах и экспортировать новый PDF с интегрированным текстовым слоем. В таком результате текст можно искать, выделять, копировать и вставлять. Распознанный текст также можно экспортировать в TXT. OCR выполняется на устройстве; передача данных начинается только тогда, когда пользователь сам экспортирует документ во внешнее хранилище или приложение.

- Импортируйте существующий PDF в QuickScan. Для одного листа можно также создать новый скан камерой.
- Выполните распознавание текста для документа. Если дальнейшая цель — снова работать с PDF, выберите экспорт PDF с OCR-текстом; если нужен только текст, используйте экспорт распознанного содержимого в TXT.
- При регулярном использовании можно настроить Export Favorites с вариантом PDF + OCR, чтобы не выбирать одни и те же параметры заново.
- Откройте экспортированный PDF и проверьте поиск по характерному слову, затем выделите и скопируйте контрольный фрагмент.
- Для цифр, фамилий, артикулов и таблиц выполните визуальную сверку с исходным сканом: наличие text layer не гарантирует безошибочного OCR.

Плюсы:
- импортирует существующие PDF, а не только новые фотографии;
- создаёт PDF с searchable/selectable текстовым слоем;
- может вывести распознанный текст отдельным TXT;
- OCR выполняется локально на iPhone или iPad.
Минусы:
- результат OCR всё равно нужно проверять на сложной разметке и плохих сканах;
- мобильный экран неудобен для постраничной проверки больших таблиц;
- при необходимости сохранить сложную структуру всего документа настольный OCR-редактор даёт больше пространства для контроля областей.
Android: как скопировать текст из PDF
Xodo PDF Reader — мобильный PDF и OCR
Xodo PDF Reader доступен как Android-приложение и включает Text Recognition (OCR), который превращает изображения и документы в searchable text. Для обычного PDF сначала используйте стандартное выделение; OCR нужен только тогда, когда текстового слоя нет. Такой порядок уменьшает риск испортить корректные символы повторным распознаванием.
- Откройте PDF в Xodo PDF Reader.
- Попробуйте выделить одно слово. Если текстовый слой есть, используйте Copy и проверьте вставку.
- Для скана запустите Text Recognition (OCR) и создайте searchable текстовый результат.
- После распознавания снова выделите фрагмент и скопируйте его в нужное приложение.

Плюсы:
- реальное Android-приложение, а не веб-страница;
- есть OCR для сканов;
- подходит для задачи без компьютера.
Минусы:
- многостраничную верстку сложнее контролировать на телефоне;
- OCR может ошибаться на слабых фотографиях;
- для таблиц удобнее настольный экран и экспорт в структурированный формат.
Google Lens — OCR фрагмента страницы по скриншоту
Google Lens полезен как резервный способ, когда нужен короткий фрагмент со скана, а не весь многостраничный PDF. Сделайте скриншот нужной области страницы, откройте изображение в Google Photos, запустите Lens, выберите распознанные слова и нажмите Copy. Это OCR изображения: структура PDF, ссылки, таблицы и разметка документа в результат не переносятся.
- Откройте нужную страницу PDF и сделайте чёткий скриншот без лишних панелей поверх текста.
- Откройте снимок в Google Photos и запустите Google Lens.
- Перейдите к распознанному тексту, выделите нужные слова и скопируйте их.
- Вставьте результат и сравните с исходным фрагментом, особенно цифры и похожие символы.
Метод удобен для нескольких предложений, но не подходит для книги, отчёта на десятки страниц или таблицы, которую требуется сохранить как структуру. В таких случаях используйте OCR всего PDF.
Linux: GUI и командная строка
Evince — простой графический просмотрщик

Evince подходит для текстовых PDF в Linux. Выделите нужный фрагмент и скопируйте его стандартной командой. Форматирование при вставке может измениться, а в PDF с несколькими колонками возможны неправильный порядок строк и ошибки символов. Для сложной страницы копируйте меньшие участки или сначала вставляйте их в простой текстовый редактор, чтобы отделить содержимое от форматирования.
Плюсы:
- прямое копирование без конвертации для обычного PDF;
- легко проверить короткий фрагмент;
- естественный вариант для рабочего стола GNOME.
Минусы:
- не исправляет плохой текстовый слой;
- колонки могут копироваться в неверном порядке;
- для скана нужен OCR.
Okular — другой GUI-вариант Linux

Okular полезен как альтернативный просмотрщик: если один PDF-движок копирует символы неправильно, открытие того же фрагмента в другом viewer-е помогает понять, проблема локальна для программы или заложена в самом PDF. Если оба просмотрщика возвращают одинаковый мусор, повторные попытки копирования не нужны — переходите к OCR.
pdftotext из Poppler — когда нужен весь текст
Командная утилита pdftotext удобна для больших текстовых PDF и сценариев, где нужен TXT без ручного выделения. Базовая команда имеет вид pdftotext input.pdf output.txt. Для сохранения приблизительного визуального расположения текста существует режим layout, но он не превращает PDF в семантически правильный документ: сложные колонки и таблицы всё равно нужно проверять.
pdftotext input.pdf output.txt
pdftotext -layout input.pdf output.txtЕсли входной PDF — чистый скан без text layer, pdftotext не является OCR. Сначала создайте слой распознавания, например OCRmyPDF, и только затем извлекайте текст.
Автоматизация: как извлечь текст из десятков и сотен PDF
Для одного файла Python чаще сложнее обычного Ctrl+C. Но при пакетной обработке архивов, отчётов или исследовательских коллекций программное извлечение экономит ручные операции. Ключевая развилка остаётся прежней: text extraction и OCR — разные задачи. Библиотека, читающая текстовые объекты PDF, не обязана распознавать буквы на картинке.
pypdf — извлечение существующего текстового слоя
Пакет pypdf использует PdfReader и extract_text() и различает digitally-born, scanned и OCRed PDF. pypdf не является OCR: он извлекает существующий текстовый слой, в том числе слой, уже добавленный OCR-программой, но сам не распознаёт буквы из пикселей. Поэтому этот способ предназначен прежде всего для PDF, где текст уже существует как текст.
В старых примерах и обсуждениях встречается название PyPDF2. Для нового кода используйте актуальный пакет pypdf и проверяйте его текущий API вместо механического копирования примеров для прежних выпусков PyPDF2.
from pypdf import PdfReader
reader = PdfReader("input.pdf")
text = "\n".join(page.extract_text() or "" for page in reader.pages)
with open("output.txt", "w", encoding="utf-8") as f:
f.write(text)Если extract_text() возвращает пустые строки на странице, сначала проверьте, не является ли она изображением. Не добавляйте циклы и регулярные выражения для «исправления» отсутствующего текста — это задача OCR.
PyMuPDF — извлечение текста и работа с областями
PyMuPDF полезен, когда нужен не только полный текст страницы, но и блоки, координаты или анализ порядка. Это позволяет отдельно обрабатывать прямоугольные области, например одну колонку. Для сложных PDF такой подход точнее, чем глобальный Ctrl+A, потому что код может явно ограничить область страницы. OCR применяется отдельно, когда на странице нет нормальных текстовых объектов.
import pymupdf
doc = pymupdf.open("input.pdf")
with open("output.txt", "w", encoding="utf-8") as f:
for page in doc:
f.write(page.get_text())
f.write("\n")pdfminer.six и Apache Tika
pdfminer.six используется для детального анализа текстовых объектов и разметки PDF. Apache Tika подходит, когда в одном pipeline обрабатываются разные типы документов и нужен единый слой извлечения метаданных и текста. Эти инструменты не стоит добавлять в бытовую инструкцию ради количества, но они полезны разработчику, который уже строит систему обработки файлов. Для Tika обычно требуется Java-среда, потому что основная экосистема Tika работает на JVM.
OCRmyPDF — создать текстовый слой для всего сканированного PDF
OCRmyPDF решает именно проблему скана: добавляет OCR text layer к страницам, сохраняя PDF как документ, а не превращая его в голый TXT. После этого файл можно открыть в Evince, Preview, Adobe Acrobat Reader или обработать pypdf/pdftotext. Такой двухэтапный pipeline особенно удобен для архивов сканов: сначала OCR, затем извлечение.
ocrmypdf input-scan.pdf searchable.pdf
pdftotext searchable.pdf output.txtOCRmyPDF использует OCR-движок Tesseract в типичном workflow. Язык распознавания нужно задавать в соответствии с документом, а не выбирать «все языки на всякий случай»: лишние языковые модели усложняют распознавание похожих символов. После массовой обработки полезно автоматически проверять, что каждая страница получила ненулевой текст, а затем вручную просматривать выборку страниц.
Parser — интеграционный сценарий PDF → текст → Excel
Parser представляет интеграционный подход: путь к PDF передаётся в PDF-to-text обработку, а полученный текст используется дальше в сценарии автоматизации Excel. Это не универсальный PDF-viewer. Такой путь оправдан, когда извлечение является промежуточным этапом большого процесса; для одного документа локальный просмотрщик или OCR проще.
Как скопировать весь текст из PDF, а не один абзац
Глобальное Ctrl+A не всегда означает «выделить смысловой текст всех страниц». В PDF оно может выбрать объекты текущей страницы, аннотации или текст в порядке, который отличается от чтения. Чем больше документ, тем важнее выбрать формат результата заранее.
| Цель | Лучший тип метода | Почему |
|---|---|---|
| Забрать 2–3 абзаца | Прямое выделение в PDF Commander или Adobe Acrobat Reader | Минимум преобразований и меньше риска изменить текст |
| Редактировать десятки страниц | PDF → DOCX в редакторе или Word | Потоковый формат удобнее для больших правок |
| Получить чистый корпус текста | PDF → TXT, pdftotext или pypdf | Нет лишней визуальной разметки |
| Обработать скан | OCR → searchable PDF/TXT | Без OCR у изображения нет символов для копирования |
| Сохранить таблицы | DOCX/XLSX или OCR с распознаванием областей | Обычный буфер обмена часто теряет строки и столбцы |
| Обработать сотни файлов | pypdf/PyMuPDF для text PDF; OCRmyPDF для scans | Процесс можно автоматизировать и логировать ошибки |
Перед массовым экспортом проверьте 3–5 характерных страниц: первую, страницу с таблицей, страницу с двумя колонками, страницу с примечаниями и последнюю. Если эти случаи проходят корректно, можно обрабатывать весь документ. Такой тест дешевле, чем исправлять сотни страниц после неверно выбранного формата.
Как сохранить форматирование при копировании
Абсолютно сохранить оформление через буфер обмена нельзя гарантировать. PDF описывает расположение объектов на странице, а Word строит поток абзацев, таблиц и секций. Поэтому правильный вопрос — какие элементы важно сохранить. Для цитаты важны символы и абзацы; для отчёта — ещё заголовки и списки; для прайс-листа — таблица; для научной статьи — колонки, формулы и сноски.
Абзацы и переносы строк
Если после вставки каждая визуальная строка становится отдельным абзацем, сначала попробуйте конвертацию в DOCX вместо TXT. В TXT все визуальные элементы упрощаются, поэтому переносы могут сохраниться буквально. Для небольшого фрагмента полезно вставить текст без форматирования, затем вручную восстановить только реальные границы абзацев. Автоматически удалять все переводы строк опасно: можно склеить заголовок с абзацем или пункты списка.
Две и более колонки
Колонки — один из самых проблемных случаев. Внутренний порядок PDF иногда идёт «слева направо по строке» через обе колонки, хотя читатель сначала проходит левую колонку сверху вниз. Если копирование перемешивает фразы, выделяйте каждую колонку отдельно. В автоматизации ограничивайте прямоугольную область страницы. При массовой конвертации проверяйте reading order после экспорта.
Таблицы
Таблица визуально состоит из строк и столбцов, но в PDF ячейки могут быть просто текстом в координатах. Поэтому вставка через Ctrl+V иногда даёт набор значений, разделённых пробелами. Если данные нужно считать или сортировать, используйте экспорт в XLSX или инструмент OCR, который различает область типа Table. После переноса проверяйте, не съехали ли значения в соседний столбец и не объединились ли многострочные ячейки.
Формулы и специальные символы
Формулы часто собраны из нескольких шрифтов, отдельных символов и позиционированных индексов. Простой copy/paste может превратить дробь, верхний индекс или знак интеграла в линейный набор знаков. Для единичной формулы иногда надёжнее сохранить её как изображение, если редактирование не требуется. Если нужна редактируемая математика, нужен специализированный OCR/Math workflow, а не обычный PDF-to-text.
Сноски и номера страниц
При конвертации сноски могут попасть внутрь основного текста, а колонтитулы повторяться на каждой странице. Для большого документа стоит заранее решить, нужны ли номера страниц в извлечённом тексте. При подготовке корпуса для поиска их обычно удаляют после извлечения, но только по явному шаблону, чтобы не потерять настоящие номера внутри документа.
Что делать, если вместо русского текста вставляются иероглифы, квадраты или другие буквы
- Скопируйте одно короткое слово в простой текстовый редактор. Так вы исключите влияние форматирования Word.
- Откройте тот же PDF в другом viewer-е. Например, сравните Adobe Acrobat Reader, Foxit PDF Reader или системный Preview.
- Если второй просмотрщик копирует правильно, используйте его для этого файла: проблема связана с интерпретацией PDF конкретным движком.
- Если оба возвращают одинаковый неправильный текст, не пытайтесь исправить результат заменой шрифта после вставки. Запустите OCR исходной страницы и получите новый text layer.
- После OCR сравните контрольные символы: кириллицу, латиницу, цифры 0/1, тире, кавычки, знак №, валюты и математические знаки.
Особенно осторожно работайте с документами, где одна и та же визуальная буква может кодироваться разными глифами. PDF способен выглядеть идеально на экране и при печати, но при извлечении выдавать неверный Unicode. Это объясняет, почему «переустановить шрифт в Word» часто не исправляет копию: Word уже получил неправильные символы.
Как работать с PDF, где запрещено копирование
Ограничения PDF бывают разными: пароль на открытие и пароль/permissions на изменение, печать или копирование. Сначала определите, что именно запрещено. В Adobe Acrobat Reader это видно в Document Properties → Security → Document Restrictions Summary; в Foxit PDF Reader используется похожая проверка через File → Properties → Security.
Если вы владелец документа или получили пароль владельца, измените разрешения штатными средствами редактора и сохраните новую копию. Если пароль неизвестен и файл чужой, правильный путь — запросить версию с разрешённым копированием или исходный DOCX/TXT. Password-remover, DRM-remover и «печать в новый PDF» не относятся к нормальному сценарию копирования текста: они не должны использоваться для обхода чужих ограничений.
OCR также не должен использоваться как универсальная лазейка вокруг чужих прав доступа. Он предназначен прежде всего для изображений и сканов, к которым у пользователя есть законный доступ. Для собственных файлов с потерянным текстовым слоем OCR оправдан; для чужого защищённого материала сначала решите вопрос разрешения на использование содержимого.
Как подготовить скан, чтобы OCR ошибался меньше
Качество распознавания определяется не только выбранной программой. Если исходник плохо сфотографирован, все OCR-сервисы получают одинаково слабый материал. Перед распознаванием улучшите саму страницу.
- Выравнивание. Текстовые строки должны быть горизонтальными. Для перекошенной страницы используйте deskew.
- Разрешение. Для обычного печатного текста ориентир порядка 300 DPI даёт OCR больше деталей, чем маленький размытый снимок.
- Контраст. Серый текст на сером фоне и тени от сгиба книги снижают читаемость символов.
- Кадрирование. Уберите стол, пальцы, соседнюю страницу и большие поля, если они мешают определению области документа.
- Язык. Выберите фактический язык текста. Для русско-английского документа нужны соответствующие языковые модели.
- Поворот страниц. Исправьте страницы, сохранённые боком или вверх ногами, до OCR.
- Проверка после OCR. Наиболее опасны не очевидные ошибки, а правдоподобные замены: 0/O, 1/l/I, 5/S, дефис/тире, точки и запятые в числах.
Рукописный текст, печати поверх букв, очень мелкий шрифт, декоративные гарнитуры и повреждённые страницы остаются сложными случаями. Даже если OCR визуально «почти всё понял», не используйте результат без сверки в юридически, финансово или технически значимых данных.
Как проверить результат после копирования или OCR
Факт того, что текст вставился, ещё не означает, что он точный. Для небольшого фрагмента проверка занимает секунды; для большого документа нужен системный чек-лист.
- Сравните начало и конец. Убедитесь, что выделение не захватило соседний блок и не оборвалось посередине слова.
- Проверьте числа. Даты, суммы, номера счетов, проценты, артикулы и телефоны чувствительны к одной ошибке OCR.
- Проверьте имена. Фамилии, названия организаций и редкие термины хуже исправляются автоматическим словарём.
- Проверьте знаки. №, %, валюты, тире, кавычки, математические символы и верхние индексы часто теряются при конвертации.
- Проверьте порядок чтения. На двух колонках прочтите переход между абзацами: он должен идти вниз по колонке, а не перескакивать вправо.
- Проверьте таблицу. Сопоставьте минимум одну строку целиком: каждое значение должно остаться в своём столбце.
- Проверьте сноски. Номер сноски и её текст не должны вклиниться в основной абзац.
- Проверьте поиск. В searchable PDF найдите характерное слово через Ctrl+F/Command+F. Это быстро подтверждает наличие рабочего текстового слоя.
Минимальная выборочная проверка для длинного документа
Для сотни страниц нет смысла вручную вычитывать всё, если задача — создать поисковый индекс. Но выборка всё равно нужна: проверьте первую страницу, 2–3 случайные страницы из середины, страницу с таблицей, страницу с самым мелким шрифтом и последнюю. Если документ важен для публикации или расчётов, уровень контроля должен быть выше: OCR-ошибка в одной цифре может изменить смысл данных.
Какой способ выбрать в конкретной ситуации
| Ситуация | Первый выбор | Почему | Что проверить |
|---|---|---|---|
| Один абзац на Windows | PDF Commander | Прямое выделение без лишней конвертации | Совпадают ли символы после вставки |
| Обычный PDF и уже установлен Reader | Adobe Acrobat Reader | Select Tool → Copy | Document Restrictions Summary при проблеме |
| Нужно редактировать весь документ | Microsoft Word | Открывает PDF как редактируемую копию | Разметку, колонки и страницы |
| Скан или фотография документа | ABBYY FineReader PDF / OCR в PDF-редакторе | Создаётся текстовый слой | Язык OCR и сомнительные символы |
| macOS без стороннего ПО | Preview | Text Selection; для скана Embed Text | Доступность Embed Text и порядок строк |
| Разовая онлайн-задача | PDF Candy / PDF24 | Есть extraction и OCR | Приватность и структуру результата |
| iPhone/iPad | PDF Expert для готового текста; QuickScan для скана | Мобильное выделение или локальный OCR | У сканов проверить точность распознавания |
| Android | Xodo PDF Reader | Мобильный viewer с OCR | Качество скана и порядок текста |
| Linux GUI | Evince | Быстрое копирование текстового PDF | Колонки и символы |
| Linux/сервер, весь текст | pdftotext | Сразу создаёт TXT | Наличие text layer |
| Сотни цифровых PDF | pypdf / PyMuPDF | Автоматизация извлечения | Пустые страницы и reading order |
| Сотни сканов | OCRmyPDF → pdftotext/pypdf | Сначала создаётся OCR layer | Качество OCR на выборке |
Не существует одного метода, который одинаково хорошо работает со всеми PDF. Прямое копирование лучше всего сохраняет исходные символы, когда текстовый слой исправен. Конвертация удобнее для большого объёма. OCR нужен только для изображения или повреждённого слоя. Онлайн-сервис выигрывает отсутствием установки, а локальная программа — контролем над файлами и предсказуемым workflow.
Резервный способ: скриншот страницы → обрезка → OCR
Скриншот — не способ извлечения текста сам по себе, а подготовка изображения для OCR. Он полезен, когда копирование нужно только из небольшой области, а весь PDF обрабатывать нецелесообразно. На Windows снимок можно обрезать в Microsoft Paint или системном инструменте захвата, а затем распознать изображение в OneNote либо другом OCR-инструменте.
- Увеличьте PDF так, чтобы буквы были чёткими, и сделайте снимок только нужной области.
- Обрежьте лишние панели, поля и соседние колонки. Microsoft Paint здесь используется только для подготовки изображения, а не для OCR.
- Передайте полученную картинку в распознавание: например, OneNote → Copy Text from Picture.
- После вставки обязательно сравните результат с исходной областью.
Для длинного документа этот путь неэффективен: десятки скриншотов сложнее контролировать, чем один запуск OCR по диапазону страниц.
Частые ошибки
Сразу запускать OCR на любом PDF
Если исходный текстовый слой корректен, повторное распознавание добавляет ненужный риск ошибок. Сначала попробуйте обычное выделение и копирование. OCR — средство для скана или явно плохого слоя, а не обязательный этап.
Использовать Ctrl+A для сложного многостраничного PDF
Ctrl+A удобно в Word и TXT, но в PDF визуальная структура и внутренний порядок объектов могут различаться. Для длинного документа лучше выполнить экспорт, а затем выделять всё уже в потоковом формате.
Считать Snapshot копированием текста
Snapshot в PDF-просмотрщике помещает в буфер изображение области. Его можно вставить в презентацию или документ как картинку, но текст внутри не становится редактируемым. Для редактируемых символов нужен OCR.
Удалять все переносы строк одной заменой
Так можно случайно склеить разные абзацы, пункты списка и заголовки. Сначала определите, какие переносы являются визуальными, а какие смысловыми. Для массовой очистки используйте правила, которые учитывают пустые строки, пунктуацию и начало следующего предложения.
Загружать конфиденциальный PDF в первый попавшийся сервис
Онлайн OCR технически удобен, но файл покидает устройство. Для персональных, договорных и внутренних данных используйте сервис только тогда, когда политика организации допускает такую передачу. В противном случае выбирайте локальный редактор или локальный OCR.
Не проверять OCR после успешного поиска
Searchable PDF доказывает наличие текстового слоя, но не его точность. OCR может распознать слово так, что оно находится поиском, и одновременно ошибиться в соседней цифре. Для важных данных требуется визуальная сверка.
Дополнительные инструменты: когда они действительно нужны
Узкоспециализированные инструменты полезны только в своём классе задач. OCR области экрана, пакетная конвертация, серверный парсер и работа с паролями — разные операции; смешивать их в один список «способов скопировать текст» неудобно для выбора.
| Инструмент | Класс задачи | Практический вывод |
|---|---|---|
| PDNob Image Translator | OCR области экрана/изображения | Уместен для короткого визуального фрагмента, но не заменяет полноценную обработку многостраничного PDF |
| TalkHelper PDF Converter | Конвертация PDF | Рационален только если нужен массовый перевод в другой формат; для одного абзаца проще viewer |
| WidsMob PDFEdit / ConvertPDF | Копирование и PDF→Word | Показывает разницу между локальным Copy и полной конвертацией, но на Mac сначала стоит использовать встроенный Preview |
| PDFtoText.com | Онлайн PDF→TXT | Полезен, когда форматирование не нужно; кириллицу и нестандартные шрифты следует проверять |
| OnlineOCR.net | Онлайн OCR | Преобразует сканированные PDF и изображения в редактируемые форматы; после распознавания проверяйте кириллицу и таблицы |
| Tesseract OCR | OCR-движок | Подходит для автоматизации и лежит в основе многих OCR-workflow; требует настройки языка и качества изображения |
| Apache Tika | Универсальный extractor | Полезен в серверных системах с разными форматами, а не как ручной PDF viewer |
| pdfminer.six | Извлечение текста и layout | Подходит разработчику для анализа структуры PDF |
| Parser | Интеграция PDF→text в автоматизированный Excel workflow | Нишевый инструмент, когда извлечённый текст сразу идёт в дальнейший сценарий |
| Passcovery / Cisdem PDF Password Remover / SysTools PDF Unlocker | Управление паролями и ограничениями | Не используются в этой инструкции как способ обхода чужой защиты; для собственного документа применяйте известный пароль и штатные настройки |
| All DRM Removal | Снятие DRM | Не относится к обычному копированию текста и не включается в практические шаги |
Ответы на вопросы, которые остаются после выбора метода
Почему PDF открывается, но ни одно слово не выделяется?
Чаще всего страница является изображением. Проверьте поиск по заведомо видимому слову. Если поиск ничего не находит и курсор не выделяет символы, запустите OCR. Второй вариант — неверно выбран инструмент в viewer-е, поэтому в Preview проверьте Tools → Text Selection, а в Reader — Select Tool.
Можно ли скопировать текст со сканированного PDF без преобразования в Word?
Да. OCR может добавить text layer прямо в PDF. После этого документ остаётся PDF, но текст становится searchable/selectable. Такой подход поддерживают, например, Preview через Embed Text, PDF24 через PDF OCR и OCRmyPDF в командной строке. Word нужен только если дальнейшая цель — редактировать документ как DOCX.
Почему после OCR абзацы идут в неправильном порядке?
OCR распознаёт символы, но дополнительно должен определить структуру страницы. На двух колонках, таблицах и боковых врезках layout analysis может ошибиться. Выберите режим распознавания структуры, если он доступен, либо обрабатывайте области отдельно. Для автоматизации извлекайте текст по координатам.
Что лучше для книги: TXT или DOCX?
TXT удобен для поиска, анализа и хранения чистого корпуса текста, но теряет оформление. DOCX удобнее, если нужны заголовки, абзацы, курсив, списки и дальнейшая редактура. Для отсканированной книги сначала выполните OCR; выбор TXT/DOCX — уже следующий этап.
Можно ли гарантировать копирование «без потери форматирования»?
Нет. После открытия PDF в Word макет может отличаться от исходника: строки и страницы способны переноситься в других местах. Реалистичная цель — сохранить именно те элементы, которые нужны: текст и абзацы, либо дополнительно таблицы, списки и изображения. Чем сложнее страница, тем больше требуется проверки.
Почему в одном PDF часть страниц копируется, а часть нет?
Так бывает в смешанных документах: одни страницы созданы из Word, другие добавлены как сканы. Проверяйте страницу отдельно. Для текстовых страниц используйте direct extraction, а OCR применяйте только к сканам. Некоторые OCR-инструменты позволяют выбирать диапазон страниц, чтобы не распознавать весь документ заново.
Как понять, что после OCR создан настоящий текстовый слой?
Попробуйте выделить одно слово, найти его через Ctrl+F/Command+F и скопировать в простой текстовый редактор. Если все три действия работают, слой присутствует. Затем остаётся проверить точность распознавания, а не сам факт наличия текста.
Как копировать текст из PDF с двух колонок?
Выделяйте колонки отдельно сверху вниз. Если viewer постоянно перескакивает между колонками, преобразуйте страницу в DOCX с анализом структуры или используйте инструмент, который извлекает текст из заданной прямоугольной области. В Python эту задачу удобно решать через координаты блоков PyMuPDF.
Нужно ли сохранять новый PDF после OCR?
Да, если вы хотите использовать распознанный слой повторно. Иначе при следующем открытии исходного скана придётся распознавать его снова. Сохраняйте результат отдельным файлом, чтобы исходное изображение оставалось нетронутым и можно было сравнить OCR с оригиналом.
Что выбрать для конфиденциального документа?
Локальную программу или локальный OCR, если правила вашей организации не разрешают отправлять файл сторонним веб-сервисам. Сам факт HTTPS не означает, что документ разрешено загружать внешнему обработчику: здесь важны политика хранения, договорные условия и внутренние правила обращения с данными.
Итоговый алгоритм без лишних действий
- Попробуйте выделить одно слово и выполнить поиск по нему.
- Если текстовый слой нормальный — скопируйте фрагмент напрямую. На Windows первым способом используйте PDF Commander, на macOS — Preview, на Linux — Evince.
- Если нужен весь документ — вместо постраничного Ctrl+C преобразуйте PDF в DOCX или TXT.
- Если страница является изображением — запустите OCR и создайте новый текстовый слой.
- Если копирование запрещено — проверьте Document Restrictions Summary/свойства безопасности и работайте только с разрешённой копией или известным паролем владельца.
- Если вставляются неправильные символы — сравните другой PDF viewer; при повторении ошибки создайте новый слой OCR.
- Для таблиц, колонок и формул не доверяйте глобальному копированию: проверяйте структуру или извлекайте области отдельно.
- После любого OCR или массовой конвертации проверяйте контрольные страницы, цифры, имена и специальные символы.
Для короткой цитаты нужен самый простой путь с минимумом преобразований. Для длинного редактируемого документа важнее корректный экспорт. Для скана главным становится OCR, а для сотен файлов — автоматизация. Такая последовательность позволяет не тратить время на неподходящие программы и одновременно снижает риск получить визуально правдоподобный, но фактически неправильный текст.