Если текст в PDF не удаётся выделить или после копирования в буфере появляются квадраты, бессвязные символы и перепутанные строки, сначала нужно определить тип проблемы. У одинакового внешнего симптома есть разные причины: страница может быть обычной картинкой без текстового слоя, автор документа мог запретить копирование, в файле может отсутствовать корректное сопоставление глифов с Unicode, а у многоколоночного макета текстовые фрагменты могут храниться в порядке, который не совпадает с визуальным чтением. Поэтому универсальный совет «откройте PDF в другой программе» или «сразу запустите OCR» иногда помогает, но не объясняет, почему именно сработал.
Ниже разобраны практические способы для Windows, macOS, браузера, iPhone, Android и Linux. Первый метод — через PDF Commander: он подходит для отсканированных страниц, добавляет распознаваемый слой и позволяет работать с настройками доступа в собственных или разрешённых документах. Для сложных случаев рассмотрены ABBYY FineReader, Adobe Acrobat, Microsoft Word, PDFelement, Foxit PDF Editor, Google Drive, PDF24, Xodo, Okular, OCRmyPDF, pdftotext, Tesseract и Tabula. Для защищённых файлов действует одно условие: известный пароль и право владельца либо полученное разрешение на обработку документа.
Сначала определите, почему PDF не даёт скопировать текст
Перед конвертацией проверьте один короткий фрагмент. Откройте страницу в привычном просмотрщике, проведите курсором по одному предложению и нажмите Ctrl+C в Windows/Linux или Command+C в macOS. Затем вставьте результат в простой текстовый редактор. Такой тест отделяет отсутствие текстового слоя от проблем с разрешениями, кодировкой и порядком чтения.
| Что происходит | Типичная техническая причина | Что делать первым |
|---|---|---|
| Курсор не выделяет отдельные слова, страница ведёт себя как одна картинка | Скан или изображение без текстового слоя | Запустить OCR: PDF Commander, Chrome, FineReader, Acrobat, Preview, OCRmyPDF или мобильное распознавание |
| Текст выделяется, но команда копирования недоступна | Ограничение разрешений PDF | Проверить параметры безопасности; при наличии права и известного пароля изменить разрешение на копирование |
| Текст выделяется, но после вставки появляются квадраты, «кракозябры», чужие буквы | Проблема карты символов, встроенного шрифта или ToUnicode | Проверить файл в другом движке; если результат одинаковый, распознать визуальное изображение OCR |
| Слова копируются, но строки и колонки идут в неправильном порядке | PDF хранит фрагменты по координатам, а не как линейный абзац | Использовать инструмент с анализом макета или выделением таблицы/области |
| Одни страницы копируются нормально, другие — нет | Смешанный PDF: часть страниц имеет текстовый слой, часть является сканом | Обрабатывать OCR только проблемные страницы или использовать средство, рассчитанное на смешанные документы |
Как отличить скан от обычного PDF
Самый быстрый признак — поведение курсора. В текстовом PDF выделение обычно проходит по символам и словам. У чистого скана курсор либо вообще не выбирает текст, либо работает только как инструмент прямоугольного выделения изображения. Дополнительная проверка — поиск по заведомо видимому слову через Ctrl+F или Command+F. Если слово не находится, это сильный практический сигнал, что на странице нет пригодного текстового слоя.
Но отсутствие результата поиска ещё не доказывает, что страница целиком изображение. Текстовый слой может быть повреждён или содержать неправильные символы. Поэтому при сомнениях сравните одну и ту же страницу в двух просмотрщиках: например, в PDF Commander и Chrome, либо в Preview и Chrome. Если оба приложения видят страницу как картинку, переходите к OCR. Если выделение есть, а вставка повреждена, переходите к разделу про глифы и ToUnicode.
Почему визуально нормальный текст может копироваться неправильно
PDF — формат фиксированной разметки. Он обязан точно воспроизвести внешний вид страницы, но не обязан хранить текст как непрерывную последовательность символов, аналогичную DOCX. На странице могут лежать отдельные текстовые объекты с координатами, а символы могут ссылаться на глифы встроенного шрифта. Для корректного копирования просмотрщик должен сопоставить внутренний код символа с Unicode. В PDF для этого, в частности, используется таблица ToUnicode. Если корректного сопоставления нет, на экране буква выглядит нормально, потому что программа рисует нужный глиф, но в буфер обмена попадает другой код или непонятный знак.
Это объясняет типичный парадокс: документ выглядит идеально, поиск не работает, а вставка выдаёт «ch a i r m a n» с лишними пробелами либо набор символов. Простая смена кодировки в Блокноте редко исправляет такой PDF, потому что ошибка появилась раньше — на этапе преобразования внутренних кодов PDF в текст. Практичный выход для отдельной проблемной страницы — распознать именно её визуальное представление. OCR заново смотрит на пиксели и создаёт новый текстовый слой, поэтому не зависит от исходной ошибочной карты символов.
Когда не нужно запускать OCR
Если обычное выделение работает и вставленный текст совпадает с оригиналом, OCR только добавит лишний этап и потенциальные ошибки распознавания. Для такого PDF достаточно копирования, экспорта в текст или открытия в Word. OCR нужен, когда текстового слоя нет, он непригоден для извлечения или вы сознательно создаёте новый корректный слой для сканированных страниц.
Не стоит также применять OCR ко всему многостраничному файлу, если проблема есть на двух страницах из сотни. Выберите конкретный диапазон: это сокращает обработку и упрощает проверку результата. Особенно важно ограничивать диапазон для договоров и отчётов, где текстовая часть уже корректна, а приложенные сканы актов или подписных листов являются изображениями.
Windows: основной способ через PDF Commander
Для инструкции первым практическим вариантом используется PDF Commander. Он подходит к двум главным сценариям: распознавание сканированной страницы и работа с разрешениями собственного PDF, когда пароль известен. Для обычного PDF сначала попробуйте выделение. Для скана создайте текстовый слой, а для файла с запретом копирования меняйте права только тогда, когда документ ваш или вы получили разрешение владельца.
PDF Commander : как скопировать текст со сканированной страницы
Когда подходит. Страница выглядит как текст, но слова не выделяются, поиск по видимой фразе ничего не находит или PDF собран из сканов. В этом случае нужен OCR. В PDF Commander соответствующая группа инструментов находится на вкладке «Распознавание».
- Откройте PDF. Загрузите документ в редактор и перейдите на страницу, где текст не выделяется. Для многостраничного файла заранее запомните номера проблемных страниц.
- Откройте вкладку «Распознавание». На ленте нажмите «Распознать текст». На скриншоте ниже показано расположение вкладки и команды.

- Выберите страницы. В окне распознавания доступны текущая страница, все страницы и диапазон. Если проблема только в приложении к договору, не обрабатывайте весь документ — задайте конкретный диапазон.
- Выберите модуль распознавания и результат. В диалоге есть варианты вывода. Для последующего выделения в исходном PDF особенно полезен режим «Добавить невидимый слой текста»: визуальная страница остаётся изображением, но поверх неё появляется распознаваемый текст. Если нужен отдельный текст для дальнейшего редактирования, используйте вариант извлечения текста.
- Укажите язык. Правильный язык снижает количество ошибок в похожих символах и словах. В более новом диалоге программы также предусмотрено автоматическое определение языка.
- Нажмите «Распознать». После завершения снова попробуйте выделить нужное предложение и скопировать его.

В другом варианте окна OCR можно выбрать больше языков, указать способ добавления текста и обработать конкретные страницы. Для скана, внешний вид которого нужно сохранить, полезен именно невидимый слой: он не заменяет изображение распознанными буквами и не перестраивает исходный макет.

Как проверить результат в PDF Commander
- выделите фрагмент курсором, а не прямоугольной областью;
- скопируйте его в простой текстовый редактор и сравните с оригиналом;
- проверьте числа, даты, номера счетов, ИНН, артикулы и фамилии — OCR чаще всего опасно принимать «на глаз» именно в критичных реквизитах;
- в многоколоночной странице проверьте порядок предложений после вставки;
- найдите через поиск слово из середины страницы — это подтверждает, что текстовый слой действительно появился.
Плюсы: PDF Commander
- OCR встроен в PDF-редактор: не требуется сначала переводить страницу в отдельное изображение;
- можно обрабатывать текущую страницу, весь документ или диапазон;
- режим невидимого текстового слоя сохраняет визуальную страницу и одновременно делает текст доступным для поиска и копирования;
- файл остаётся в локальном рабочем процессе, что удобнее для документов, которые нежелательно передавать веб-сервисам.
Минусы: PDF Commander
- как у любого OCR, результат требует проверки на плохо отсканированных, перекошенных и многоязычных страницах;
- распознавание не превращает сложную таблицу автоматически в безошибочную электронную таблицу — для табличных данных нужна отдельная проверка структуры;
- если проблема вызвана запретом копирования, OCR не заменяет законного доступа к документу.
PDF Commander : что делать, если копирование запрещено правами документа
У PDF могут быть отдельно настроены разрешения на открытие, редактирование, печать и копирование. Если документ принадлежит вам или владелец дал пароль и разрешил изменить права, в PDF Commander используйте вкладку «Безопасность». В интерфейсе предусмотрены команды управления паролем и «Настройка прав доступа». Для разрешённого сценария снимите ограничение с помощью известного пароля либо включите разрешение на копирование.
- Откройте документ и перейдите на вкладку «Безопасность».
- Нажмите «Задать пароль». Если требуется полностью убрать известную защиту, выберите «Снять защиту» и подтвердите действие паролем.
- Если пароль нужно сохранить, откройте «Настройка прав доступа».
- В разрешениях включите «Разрешить копирование» и подтвердите настройки кнопкой «ОК».
- Сохраните PDF, откройте сохранённую копию заново и проверьте выделение одного предложения.
Неизвестный пароль — другой сценарий. Если пароль вам не принадлежит и разрешения на изменение защиты нет, корректное действие — запросить у владельца незапрещённую копию, редактируемый исходный файл или пароль. Ниже не приводятся инструкции по подбору паролей и обходу DRM.
ABBYY FineReader : OCR с контролем областей и таблиц
Когда подходит. FineReader полезен, когда нужно не просто получить пару предложений, а контролировать структуру страницы: текстовые блоки, картинки и таблицы. В OCR Editor видны исходное изображение и распознанный текст, поэтому можно обнаружить неверно размеченную область до экспорта.
Для PDF без текстового слоя FineReader выполняет фоновое распознавание; после этого текст можно выбирать и копировать. Если нужно исправить сложный фрагмент, откройте документ в OCR Editor, проверьте области и повторно распознайте страницу. Для выделенной прямоугольной области используйте Copy as Text или Ctrl+Shift+C; для уже существующего текста — Copy Text или Ctrl+C.

- Откройте PDF в OCR Editor.
- Проверьте, правильно ли программа определила текст, картинки и таблицы. Если фрагмент таблицы размечен как обычный текст, поправьте тип области.
- Запустите распознавание для исправленной страницы.
- Сверьте распознанный текст в текстовой панели.
- Скопируйте нужный фрагмент либо сохраните результат в подходящем редактируемом формате.
Плюсы: ABBYY FineReader
- можно корректировать области страницы перед повторным OCR;
- есть отдельная работа с таблицами и проверкой распознанного текста;
- подходит для документов, где важно восстановить структуру, а не только получить набор символов.
Минусы: ABBYY FineReader
- для одного короткого абзаца такой рабочий процесс избыточен;
- качество таблиц, мелкого текста и нестандартных шрифтов всё равно требует ручной сверки;
- не следует использовать распознавание как способ обойти неизвестные ограничения доступа.
Microsoft Word: открыть PDF как редактируемый документ
Когда подходит. Если PDF в основном состоит из обычного текста и вам нужно не только скопировать фрагмент, но и получить редактируемое представление, Word может создать копию PDF и преобразовать её в документ, который можно редактировать. Исходный PDF при этом не изменяется.
- В Word выберите File → Open.
- Укажите PDF-файл.
- Word предупредит, что создаст редактируемую копию и что внешний вид может отличаться от оригинала. Подтвердите преобразование кнопкой OK.
- После открытия найдите нужный абзац и скопируйте его обычным способом.

Word лучше справляется с PDF, где преобладает текст. Если PDF похож на журнальную полосу, содержит сложные диаграммы, плавающие подписи и несколько колонок, редактируемая копия может заметно отличаться от исходной страницы. Поэтому Word — удобный конвертационный путь, но не инструмент точного восстановления макета.
Плюсы: Microsoft Word
- после преобразования можно редактировать и копировать текст в привычной среде;
- исходный PDF остаётся без изменений;
- подходит для документов, где главная ценность — содержание, а не точная верстка.
Минусы: Microsoft Word
- сложный макет может перестроиться;
- неправильный текстовый слой PDF может перейти в Word с теми же ошибками;
- для сканов качество зависит от распознавания и исходного изображения.
Adobe Acrobat Pro : Scan & OCR и проверка сомнительных символов
Когда подходит. Acrobat полезен для сканированного PDF, когда нужно создать searchable/selectable text layer и затем проверить результат. В актуальном рабочем процессе OCR открывается через All tools → Scan & OCR.
- Откройте сканированный PDF.
- Выберите All tools → Scan & OCR.
- Нажмите In this file в группе распознавания текста.
- Укажите диапазон страниц и язык.
- Нажмите Recognize text.
- После OCR воспользуйтесь Correct recognized text, если нужно пройти по сомнительным местам.

Функция корректировки результата важна для документов с высокой ценой ошибки. Если вы копируете реквизиты договора, счёт, номер документа или таблицу с суммами, не ограничивайтесь тем, что текст теперь выделяется. Сверьте критичные места с изображением страницы.
Плюсы: Adobe Acrobat Pro
- OCR встроен в полноценную работу с PDF;
- можно ограничить обработку диапазоном страниц и указать язык;
- есть отдельный этап проверки распознанного текста.
Минусы: Adobe Acrobat Pro
- функции OCR и редактирования относятся к расширенному рабочему процессу Acrobat, поэтому простой Reader не следует путать с Acrobat Pro;
- распознавание не гарантирует сохранение логики сложной таблицы при копировании;
- ограничения безопасности нужно решать через права документа, а не пытаться маскировать их OCR.
PDFelement Pro : OCR всего документа или выбранной области
Когда подходит. PDFelement позволяет распознавать весь PDF и отдельную область. Это удобно, когда на большой странице нужен только один блок, а запускать OCR по всему документу не требуется.
- Откройте PDF и в боковой панели Tools выберите OCR.
- В окне OCR задайте язык и диапазон страниц.
- Через расширенные настройки выберите результат: редактируемый текст либо searchable text поверх изображения — в зависимости от задачи.
- Нажмите Apply.
- Если нужен только фрагмент, используйте OCR Area, обведите область и запустите распознавание для неё.


Плюсы: PDFelement Pro
- можно распознавать конкретную область, не трогая остальную страницу;
- есть выбор между редактируемым результатом и searchable text;
- диапазон страниц помогает не обрабатывать исправные части mixed PDF.
Минусы: PDFelement Pro
- неправильный язык ухудшает распознавание похожих символов;
- при сложной верстке после OCR всё равно нужно проверять порядок чтения;
- для единичной короткой цитаты браузерное или системное распознавание может быть проще.
Foxit PDF Editor : Recognize Text для сканов
Когда подходит. Если PDF открыт в Foxit PDF Editor и страница является сканом, используйте встроенное распознавание вместо попытки выделять изображение как текст. Команда находится в Convert → Recognize Text; для всего документа выбирают распознавание текущего файла, затем задают диапазон страниц, язык и тип результата.
- Откройте документ.
- Перейдите в Convert → Recognize Text и выберите распознавание текущего файла.
- Задайте страницы и язык документа.
- Выберите подходящий результат OCR и запустите обработку.
- После завершения выделите контрольное предложение и сравните вставленный текст с изображением.

Плюсы: Foxit PDF Editor
- OCR запускается непосредственно внутри PDF-редактора;
- можно задать язык и диапазон;
- подходит для создания searchable image text, когда внешний вид скана нужно оставить.
Минусы: Foxit PDF Editor
- Foxit Reader и Foxit PDF Editor — разные продукты, поэтому нельзя переносить шаги редактора в бесплатный просмотрщик без проверки;
- после распознавания таблицы и колонки требуют отдельной проверки;
- при повреждённом текстовом слое иногда полезнее OCR исходного визуального слоя, чем повторное обычное копирование.
PDF-XChange Editor : OCR всей страницы и выбранной области
В PDF-XChange Editor обычный текст копируется инструментом выбора текста, а image-only страницы распознаются через Convert → OCR Page(s). В окне OCR можно указать все страницы, текущую страницу или собственный диапазон, выбрать язык и параметры распознавания. Режим searchable image сохраняет изображение страницы и добавляет невидимый текстовый слой, поэтому после обработки слова становятся доступны для поиска и выделения.

Для одного небольшого участка не обязательно распознавать всю страницу. Откройте Organize → Other Tools → Snapshot Tool, выделите прямоугольником нужную область, щёлкните по ней правой кнопкой мыши и выберите OCR Selected Region. Такой путь удобен для подписи, одной строки таблицы или отдельного абзаца.

Плюсы: PDF-XChange Editor
- есть OCR всей страницы и отдельной выделенной области;
- можно создавать searchable image с невидимым текстовым слоем;
- удобно задавать диапазон и язык, не обрабатывая исправные страницы.
Минусы: PDF-XChange Editor
- качество распознавания всё равно зависит от исходного скана;
- сложные таблицы после OCR требуют проверки структуры;
- PDF-XChange Viewer имеет другой интерфейс, поэтому его старые пункты меню нельзя переносить в Editor.
Nitro PDF Pro , WPS Office и Foxit Reader : когда достаточно другого просмотрщика
Открытие одного и того же PDF в другом приложении — диагностический тест. Если Nitro PDF Pro, WPS Office или Foxit Reader копируют строку корректно, а первый просмотрщик — нет, причина находится в обработке PDF конкретным приложением. Если несколько независимых просмотрщиков вставляют одинаковые неправильные символы, неисправность относится к самому PDF: текстовому слою, карте символов или порядку текстовых объектов.
Для скана простой Viewer не создаёт текст там, где его нет. В этом случае переходите к OCR. Для защищённого файла не используйте смену приложения как способ игнорировать ограничения: проверьте разрешения и работайте только в рамках имеющихся прав.
Снимок экрана + OCR: быстрый способ для одного абзаца
Если нужно получить две-три строки из проблемной страницы, нет смысла конвертировать сотню страниц. В Windows сделайте снимок нужной области системным инструментом «Ножницы», затем распознайте изображение средством, которому доверяете: PDF Commander, FineReader, Capture2Text или другим OCR. Этот подход особенно полезен при сломанной карте символов: распознаётся изображение букв, а не проблемный внутренний текст.
Слабое место метода — масштаб. Скриншот должен быть достаточно чётким; мелкий серый шрифт на уменьшенной странице увеличивает число ошибок. Перед снимком увеличьте масштаб PDF так, чтобы буквы были хорошо различимы, и не захватывайте лишние колонки. Для договора, таблицы или десятков страниц используйте полноценный OCR вместо серии снимков.
macOS: копирование и OCR без установки стороннего редактора
На Mac сначала используйте встроенное приложение Preview («Просмотр»). Оно закрывает три разных сценария: обычное выделение текста, проверку защищённого PDF с известным паролем и добавление распознанного текста в image-based PDF. Если нужен более сложный OCR с ручной разметкой областей, затем имеет смысл переходить к специализированным инструментам.
Preview («Просмотр») : обычное выделение текста
Если курсор работает как прямоугольное выделение, а не выбирает символы, сначала убедитесь, что включён именно режим текста. В Preview откройте Tools → Text Selection, затем проведите по фрагменту и скопируйте его сочетанием Command+C.
- Откройте PDF в Preview.
- Выберите Tools → Text Selection.
- Выделите одно контрольное предложение.
- Нажмите Command+C и вставьте текст в TextEdit.
- Если выделения по словам всё равно нет, проверьте, является ли страница сканом.

Preview («Просмотр») : добавить текстовый слой в скан через Embed Text
Для PDF, который состоит из изображений и ещё не содержит распознанного текста, Preview предлагает встроить текст при экспорте. Откройте File → Export и используйте Embed Text. Preview распознаёт страницы и добавляет текстовый слой, после чего текст можно выбирать и искать в PDF-просмотрщиках.
- Откройте image-based PDF в Preview.
- Выберите File → Export.
- Включите Embed Text, если эта опция доступна для документа.
- Сохраните отдельную копию.
- Откройте экспортированный PDF и проверьте поиск по фразе из середины страницы.
Опция появляется именно в подходящем сценарии — когда в PDF нет ранее распознанного текста. Если документ уже содержит текстовый слой, проблема может быть не в отсутствии OCR, а в его качестве или в карте символов.
Плюсы: Preview («Просмотр»)
- не нужно загружать документ в веб-сервис;
- исходное изображение страницы сохраняется, а поверх него появляется распознаваемый слой;
- подходит для нескольких сканированных страниц и последующего поиска по PDF.
Минусы: Preview («Просмотр»)
- для сложных таблиц и повреждённых сканов контроль областей слабее, чем в специализированном OCR-редакторе;
- после распознавания всё равно нужно проверять цифры, имена и порядок колонок;
- если PDF уже содержит плохой текстовый слой, простое Embed Text не является универсальным исправлением.
Preview («Просмотр») : защищённый PDF
Если файл защищён и у вас есть разрешение владельца и известный пароль, откройте Tools → Show Inspector, перейдите к сведениям о шифровании и введите пароль, когда это требуется. Цель этого шага — получить законный доступ к разрешённому содержимому, а не обойти неизвестный пароль.
Если команда копирования остаётся недоступной после корректного открытия документа, запросите у владельца версию с разрешённым копированием или редактируемый файл. Утилиты снятия ограничений не подменяют права доступа и не решают проблему image-only страницы.
Calibre : почему это не первый выбор для проблемного PDF

Calibre предназначен прежде всего для управления электронными книгами и преобразования форматов, а не для точного OCR сканированных страниц. Если в PDF уже есть нормальный текстовый слой, конвертация может дать содержимое в другом формате. Если страница состоит из пикселей, сначала нужен OCR.
Плюсы: Calibre
- полезен, когда задача шире простого копирования и документ нужно преобразовать для чтения;
- может служить альтернативным маршрутом для PDF с существующим текстовым содержимым.
Минусы: Calibre
- не заменяет OCR image-only PDF;
- сложная PDF-верстка при конвертации может перестраиваться;
- для одной цитаты использование Calibre избыточно.
В браузере и онлайн: когда установка программы не нужна
Браузерные способы делятся на два типа. Первый работает локально в просмотрщике: современный Chrome способен распознавать сканированные PDF и делать текст выбираемым. Второй отправляет документ в облачный сервис — Google Drive/Docs, Smallpdf, iLovePDF, PDF24 и подобные. Для публичного учебного материала это удобно; для договора, медицинской справки, паспорта, кадрового или финансового документа сначала оцените, допустима ли передача файла третьей стороне.
Google Chrome : встроенное распознавание сканированного PDF
PDF Viewer в Chrome автоматически применяет OCR к отсканированным PDF и делает распознанный текст доступным для поиска и выделения. Распознавание выполняется на устройстве, поэтому для простой разовой задачи не требуется предварительно загружать документ в сторонний OCR-сервис. Схему Print → Save as PDF не следует считать универсальным способом восстановления копирования: печать создаёт новый PDF, но не гарантирует корректный текстовый слой.
- Перетащите PDF в окно Chrome или откройте его через браузер.
- Дождитесь отображения страницы.
- Попробуйте выделить предложение на скане.
- Скопируйте его и вставьте в простой редактор.
- Проверьте несколько критичных слов и цифр: автоматическое OCR не освобождает от контроля результата.

Плюсы: Google Chrome
- не нужен отдельный OCR-редактор для разового копирования;
- распознавание выполняется на устройстве;
- после OCR доступны выделение, поиск и копирование текста.
Минусы: Google Chrome
- автоматическое распознавание даёт меньше ручного контроля над областями, чем FineReader или специализированный редактор;
- сложные таблицы и многоколоночные страницы могут потребовать отдельного инструмента;
- не следует путать OCR Chrome с обходом ограничений защищённого PDF.
Google Drive + Google Docs: преобразовать скан в редактируемый текст
Когда подходит. Нужно получить текст из PDF без установки OCR-программы, а загрузка документа в облако допустима. В браузере на компьютере загрузите PDF в Google Drive, нажмите правой кнопкой мыши и выберите Open with → Google Docs. Docs создаст документ с распознанным содержимым.
- Загрузите PDF в Google Drive.
- Нажмите по файлу правой кнопкой мыши.
- Выберите Open with → Google Docs.
- Дождитесь открытия преобразованного документа.
- Скопируйте нужный текст и сравните абзац с оригиналом PDF.

При преобразовании PDF в Google Docs сложное форматирование переносится не полностью. Поэтому этот путь удобен для получения редактируемого текста, но не гарантирует точного воспроизведения таблиц, колонок, сносок и журнальной верстки. Используйте этот маршрут в браузере на компьютере; для мобильного OCR ниже приведены отдельные способы iPhone и Android.
Плюсы: Google Drive + Google Docs
- работает в браузере;
- результат сразу доступен как редактируемый документ;
- подходит для разового распознавания обычных текстовых страниц.
Минусы: Google Drive + Google Docs
- файл загружается в облако;
- сложное форматирование может измениться;
- табличные значения и критичные реквизиты нужно сверять вручную.
Smallpdf : онлайн OCR с получением searchable PDF
Smallpdf подходит, когда нужен браузерный OCR и можно передать файл веб-сервису. Логика работы проста: добавить скан в OCR-инструмент, дождаться распознавания и получить PDF, в котором текст можно искать и выделять. Для результата важнее качество исходного скана, чем количество «улучшателей»: ровная страница, читаемый контраст и отсутствие сильных теней дают OCR более ясный вход.
- В OCR-инструменте Smallpdf нажмите Choose Files и выберите сканированный PDF.
- Дождитесь завершения OCR.
- Откройте полученный searchable PDF или сохраните его.
- Найдите контрольное слово, затем выделите и скопируйте нужный фрагмент.
- Сверьте фамилии, даты, номера и знаки перед использованием результата.

Плюсы: Smallpdf
- не требует настольной установки;
- результатом может быть searchable/selectable PDF;
- подходит для разовой обработки с любого компьютера с браузером.
Минусы: Smallpdf
- документ передаётся онлайн-сервису;
- рукописный текст, сложные таблицы и слабые сканы требуют особенно тщательной проверки;
- безопасность и допустимость облачной обработки нужно оценить до загрузки файла.
iLovePDF : OCR сканированного PDF
iLovePDF также предоставляет OCR для сканов. В веб-инструменте загружается PDF, выбирается основной язык документа и запускается распознавание. После обработки текст можно искать и выбирать. Для многоязычной страницы задавайте язык осмысленно: цифры часто распознаются устойчивее букв, но похожие кириллические и латинские знаки, фамилии и аббревиатуры требуют сверки.

Плюсы: iLovePDF
- браузерный сценарий без настольной установки;
- ориентирован на превращение скана в searchable/selectable PDF;
- подходит для нескольких страниц, когда локальный OCR недоступен.
Минусы: iLovePDF
- облачная обработка не подходит для каждого конфиденциального документа;
- сложный макет и таблицы после OCR нельзя принимать без проверки;
- не нужно использовать веб-OCR для файла, который и так нормально копируется.
PDF24 Creator и онлайн OCR PDF24
Нужно различать настольный PDF24 Creator и онлайн-инструменты PDF24. Веб-OCR создаёт searchable PDF и предоставляет настройки распознавания; при обработке чувствительных данных локальный инструмент даёт больше контроля, чем отправка документа на сервер.
Для scanned PDF в PDF24 OCR добавьте файл кнопкой Add files, выберите модель распознавания, язык, DPI и выходную папку, при необходимости включите Deskew pages и Auto rotate pages, затем нажмите Start. Опция Skip pages with text полезна для смешанного PDF: страницы с уже существующим текстовым слоем можно не распознавать повторно.

Плюсы: PDF24 Creator и онлайн OCR PDF24
- есть отдельный OCR-сценарий для создания searchable PDF;
- можно корректировать типичные дефекты скана;
- подходит для браузерной работы на разных ОС.
Минусы: PDF24 Creator и онлайн OCR PDF24
- онлайн OCR подразумевает серверную обработку;
- настольный PDF24 Creator и веб-инструмент нельзя считать одним и тем же интерфейсом;
- автоматическое выравнивание и очистка не отменяют проверки мелкого текста.
OnlineOCR: когда нужен только текст, а не новый PDF
OnlineOCR решает узкую задачу преобразования изображения или PDF в редактируемый текст. Он уместен, когда важнее содержимое, чем сохранение внешнего вида страницы. Для финансовых форм, сложных таблиц и многостолбцовой верстки линейный текстовый результат нужно проверять особенно внимательно: пространственные связи между колонками могут потеряться.
Плюсы: OnlineOCR
- простая задача «изображение → текст» без установки программы;
- удобен для небольших несложных фрагментов.
Минусы: OnlineOCR
- облачный сервис требует передачи исходного файла;
- линейный результат не сохраняет всю семантику сложного макета;
- для большого конфиденциального документа разумнее локальный OCR.
PDF Candy , LightPDF и Sejda PDF Editor
Эти сервисы уместно рассматривать как дополнительные веб-инструменты, а не как первый шаг. Проверяйте, есть ли в выбранной операции именно OCR или извлечение текста, а не только конвертация уже существующего текстового слоя. Если сервис просто меняет PDF на DOCX без распознавания, скан останется изображением и копируемого текста не появится.
Правило выбора одинаковое: для публичной одноразовой страницы веб-сервис экономит установку; для регулярной работы с договорами и персональными данными локальная обработка даёт больше контроля над тем, куда попадает файл.
iPhone и iPad: быстро скопировать текст с проблемной страницы
На телефоне нет смысла превращать весь PDF в Word, если требуется одна цитата. Для короткого фрагмента самый прямой путь — сделать снимок страницы и распознать его через Live Text. Для многостраничных документов лучше использовать приложение с OCR по PDF, чтобы не создавать десятки отдельных скриншотов.
Live Text: снимок страницы → «Фото» → Copy
- Откройте нужную страницу PDF и увеличьте её так, чтобы буквы были резкими.
- Сделайте скриншот и откройте его в приложении «Фото».
- Нажмите и удерживайте слово либо активируйте распознавание текста.
- Переместите маркеры выделения.
- Нажмите Copy / «Скопировать» и вставьте результат в заметку или другой документ.

Live Text распознаёт текст на изображениях, поэтому метод работает даже тогда, когда исходный PDF не содержит текстового слоя. Для документа на десятки страниц он неудобен: каждый скриншот приходится проверять отдельно.
Плюсы: Live Text
- для одной страницы не требуется отдельный PDF-конвертер;
- распознаётся визуальное изображение, поэтому метод помогает при сломанном внутреннем текстовом слое;
- результат можно сразу вставить в другое приложение.
Минусы: Live Text
- не предназначен для массового OCR многостраничного PDF;
- качество зависит от масштаба и резкости скриншота;
- таблицы после простого копирования могут потерять структуру.
Xodo PDF Reader на iOS: OCR внутри PDF-приложения
Xodo на iPhone и iPad умеет запускать OCR для сканированных PDF. Откройте меню в верхней части приложения, выберите Text Recognition (OCR), укажите сканированный файл и нажмите APPLY OCR. После завершения откройте обработанный PDF, найдите контрольное слово через поиск и убедитесь, что оно подсвечивается. На iOS запуск OCR относится к платным мобильным возможностям, поэтому это ограничение нужно учитывать до обработки большого документа.



Плюсы: Xodo PDF Reader на iOS
- работа с PDF и OCR находятся в одном мобильном приложении;
- подходит для многостраничного документа лучше, чем серия скриншотов;
- результатом может быть searchable PDF.
Минусы: Xodo PDF Reader на iOS
- часть OCR-возможностей на iOS зависит от платного доступа;
- мобильный экран менее удобен для ручной проверки сложных таблиц;
- для одной короткой цитаты Live Text проще.
Android: Google Lens для фрагмента и Xodo PDF Reader для документа
Google Lens: распознать скриншот проблемной страницы
Для одного фрагмента сделайте скриншот PDF, откройте изображение в Google Photos/Lens, выберите режим текста, выделите нужные слова и нажмите Copy text. Это OCR изображения: наличие или отсутствие текстового слоя в исходном PDF не имеет значения.

Этот способ хорош для цитаты, номера или одного абзаца. Если PDF длинный, переходите к OCR документа: ручная серия скриншотов создаёт больше работы и повышает риск пропустить страницу.
Xodo PDF Reader на Android: Text Recognition (OCR)
В Android-приложении Xodo OCR можно применять к сканам и изображениям для создания searchable PDF. В текущем мобильном рабочем процессе скан можно обработать сразу: после съёмки сохранить страницу, включить Recognize text (OCR) и выполнить конвертацию. Для уже открытых PDF в мобильном приложении также используется действие Text Recognition (OCR).
- Откройте Xodo и выберите документ или создайте скан.
- Перейдите к Text Recognition (OCR).
- Добавьте нужные страницы либо включите OCR для создаваемого скана.
- Запустите обработку.
- Откройте полученный PDF и попробуйте поиск по слову, которого нет в имени файла или метаданных.
- Скопируйте контрольный абзац и проверьте числа и знаки.
Плюсы: Xodo PDF Reader на Android
- полноценный мобильный OCR, а не только распознавание одного скриншота;
- подходит для scanned PDF;
- после OCR документ становится пригодным для поиска и копирования.
Минусы: Xodo PDF Reader на Android
- на смартфоне труднее сверять большие таблицы и колонки;
- доступность отдельных функций зависит от режима приложения;
- OCR следует проверять до переноса важных реквизитов.
Linux: от обычного выделения до OCR и командной строки
В Linux задачи удобно разделить по типу файла: Okular подходит для выбора уже существующего текста и таблиц, pdftotext извлекает настоящий текст, OCRmyPDF создаёт OCR-слой для скана, Tesseract распознаёт изображения, а Tabula и Camelot ориентированы на таблицы. Ghostscript и qpdf решают другие задачи PDF и не заменяют OCR.
Okular : Text Selection, Area Selection и Table Selection

Если PDF уже содержит текст, Okular удобен тем, что разделяет способы выделения. Для обычного абзаца используйте Text Selection. Если нужно захватить область визуально — Area Selection. Для таблицы есть Table Selection: пользователь обводит таблицу, а затем может делить область на строки и столбцы перед копированием.
- Откройте PDF в Okular.
- Выберите режим выделения, соответствующий задаче.
- Для текста проведите по словам; для таблицы обведите её прямоугольником.
- При Table Selection уточните границы ячеек.
- Скопируйте результат и проверьте, совпадает ли число столбцов.
Плюсы: Okular
- отдельный режим для таблиц;
- не требуется OCR, если текст уже существует;
- удобен как диагностический просмотрщик на Linux.
Минусы: Okular
- не создаёт текст из чистой картинки без OCR;
- сложная таблица из множества независимо позиционированных объектов всё равно может потребовать правки;
- при неверной карте символов копирование может сохранять исходную ошибку.
OCRmyPDF: добавить OCR-слой в отсканированный PDF
OCRmyPDF предназначен именно для scanned PDF: он добавляет распознаваемый текстовый слой, сохраняя PDF как документ, а не превращая его в обычный TXT. Для базового случая используется команда:
ocrmypdf input.pdf output.pdfПосле завершения откройте output.pdf в любом просмотрщике и проверьте поиск и копирование. Для mixed PDF инструмент рассчитан на работу с документами, где встречаются и уже цифровые, и отсканированные страницы; не нужно заранее превращать каждую страницу в изображение вручную.
Плюсы: OCRmyPDF
- создаёт searchable PDF вместо отдельного набора картинок;
- подходит для автоматизированной обработки документов;
- удобен для многостраничных сканов.
Минусы: OCRmyPDF
- это командная строка, поэтому новичку графический OCR проще;
- качество зависит от Tesseract и исходного изображения;
- сложные таблицы после OCR всё равно требуют специализированного извлечения.
pdftotext: когда OCR вообще не нужен
pdftotext из Poppler извлекает существующий текст из PDF. Он не распознаёт пиксели. Базовый вызов выглядит так:
pdftotext input.pdf output.txtПо умолчанию утилита старается вывести текст в порядке чтения, а не просто повторить физические координаты на странице. Для документов с колонками результат всё равно нужно проверять. Если команда выдаёт пустой файл для страницы-скана, это ожидаемо: сначала создайте текстовый слой через OCRmyPDF или распознайте изображение другим OCR.
Полезная диагностическая пара — pdffonts и pdftotext. pdffonts показывает сведения о шрифтах и наличие явной ToUnicode-карты. Отсутствие ToUnicode само по себе не доказывает, что текст невозможно преобразовать в Unicode, но наличие проблемы помогает объяснить, почему визуально правильные глифы копируются неверно.
Плюсы: pdftotext
- быстрый способ получить текст из born-digital PDF;
- удобен для пакетной и автоматизированной обработки;
- не вносит OCR-ошибки, когда корректный текст уже есть.
Минусы: pdftotext
- не распознаёт сканы;
- при плохой карте символов извлекает неправильные данные;
- пространственная структура таблиц может потеряться.
Tesseract: распознавание изображения из терминала
Tesseract — OCR-движок командной строки. Его базовая задача — распознать изображение и вывести текст. Простейший вызов имеет форму:
tesseract scan.png resultПо умолчанию результат записывается как текстовый файл с указанной базой имени. Для конкретного языка используется параметр -l при наличии соответствующих языковых данных. Tesseract полезен как строительный блок, но для PDF удобнее OCRmyPDF: он сам организует обработку страниц и создание PDF с текстовым слоем.
Плюсы: Tesseract
- подходит для автоматизации OCR изображений;
- можно явно выбирать языковые модели;
- служит OCR-движком для других инструментов.
Минусы: Tesseract
- сам по себе не является полноценным PDF-редактором;
- для PDF требуется корректная цепочка преобразования или оболочка вроде OCRmyPDF;
- результат чувствителен к перекосу, шуму и неправильному языку.
Ghostscript: почему это не замена OCR
Ghostscript умеет обрабатывать и пересобирать PDF, а устройство txtwrite извлекает уже существующий текст как Unicode. Это не OCR: если страница состоит только из изображения, пересохранение не создаст осмысленный текстовый слой. Если проблема связана с разрешениями документа, нужно соблюдать эти права; если с неправильной картой символов, пересборка не гарантирует восстановления корректного текста.
Используйте Ghostscript для задач преобразования PDF, где он действительно нужен, а OCR — для распознавания изображения. Смешивать эти два класса инструментов в одной кнопке «исправить PDF» неправильно.
LibreOffice Draw: открыть PDF для ручного извлечения
LibreOffice Draw может открывать PDF как набор объектов. Это полезно, когда нужно вручную выбрать отдельный текстовый объект или посмотреть, как устроена страница. Но импорт PDF в Draw — не OCR. Если страница представляет собой одно большое изображение, редактируемых текстовых объектов не появится; сначала потребуется распознавание.
Плюсы: LibreOffice Draw
- можно исследовать структуру born-digital PDF;
- удобен для отдельных объектов и простых страниц;
- доступен как альтернативный путь без специализированного PDF-редактора.
Минусы: LibreOffice Draw
- не заменяет OCR;
- сложная страница импортируется как множество элементов, что неудобно для длинного текста;
- для точного сохранения верстки нужен контроль после экспорта.
Tabula: извлечь таблицу в CSV или Excel
Tabula создан специально для извлечения табличных данных из PDF. Он полезен, когда обычное копирование превращает таблицу в одну строку или смешивает столбцы. Рабочая идея: открыть PDF в Tabula, обвести таблицу, запустить извлечение и экспортировать результат в CSV или Excel.
Tabula не нужно использовать для обычного литературного текста. Его преимущество появляется именно там, где пространственная структура строк и столбцов важнее сохранения визуального вида страницы.
Плюсы: Tabula
- ориентирован на таблицы, а не на линейный текст;
- результат можно получить в табличном формате;
- позволяет работать с выбранной областью страницы.
Минусы: Tabula
- не является универсальным OCR всего документа;
- сложные объединённые ячейки и декоративная верстка требуют проверки;
- для image-only таблицы сначала нужен распознаваемый текстовый слой или другой OCR-процесс.
Camelot: программное извлечение таблиц из text-based PDF
Camelot подходит для автоматизации табличного извлечения из PDF. Ключевое ограничение: рабочий сценарий рассчитан на text-based PDF, где текст в таблице действительно существует. Если таблица — фотография или скан без текста, сначала выполните OCR. Поэтому Camelot нельзя считать универсальным инструментом для любой таблицы.
Используйте Camelot, когда нужно обработать серию однотипных отчётов и получить таблицы программно. Для одной простой таблицы графический Table Selection в Okular или Tabula может оказаться быстрее.
qpdf: инструмент структуры и шифрования, а не OCR
qpdf работает со структурой, преобразованием и параметрами шифрования PDF, но не распознаёт изображения и не исправляет ошибки OCR. Для собственного документа с известными данными доступа применяйте разрешённые настройки безопасности; неизвестный пароль не следует обходить техническими средствами. Для сканированного PDF используйте OCRmyPDF или другой OCR-инструмент.
Если после копирования появляются квадраты, кракозябры или лишние пробелы
Этот случай отличается от скана. Пользователь видит нормальные буквы и может провести по ним курсором, но после Ctrl+C получает «□», неизвестные символы, переставленные буквы или разреженное слово. Значит, графическое отображение страницы и извлекаемый текст не совпадают.
Что происходит внутри PDF
PDF может хранить символы как коды, связанные со встроенным шрифтом и глифами. Глиф описывает, что именно рисовать на странице; для копирования просмотрщику нужно понять, какой Unicode-символ соответствует этому рисунку. Один из механизмов — карта ToUnicode. Если сопоставление отсутствует или построено неправильно, визуальное отображение остаётся правильным, а текстовый вывод ломается.
Кроме того, PDF не обязан хранить предложение как один непрерывный абзац. Отдельные буквы или фрагменты могут располагаться по координатам. Поэтому даже корректные символы иногда извлекаются с лишними пробелами или в другом порядке. Это особенно заметно в отчётах, каталогах и документах, которые создавались из нестандартных издательских систем.
Порядок действий при неправильных символах
- Проверьте другой PDF-движок. Откройте одну страницу, например, в PDF Commander, Chrome или Adobe Acrobat Reader. Если один просмотрщик копирует правильно, проблема локальна для конкретного приложения.
- Если ошибка повторяется, не тратьте время на смену кодировки в текстовом редакторе. При повреждённом сопоставлении глифов неправильные символы уже попали в буфер обмена.
- Для одной страницы сделайте OCR визуального слоя. PDF Commander, FineReader, Acrobat, Chrome или системное распознавание телефона анализируют изображение букв и создают новое сопоставление.
- Для Linux проверьте шрифты.
pdffontsпомогает увидеть, какие шрифты используются и есть ли явная ToUnicode-карта. Это диагностический инструмент, а не средство автоматического ремонта. - После OCR сравните два результата. Если новый текст читается нормально, а старый продолжает давать мусор, используйте распознанный слой.
Почему повторный OCR иногда лучше «родного» текста PDF
Кажется нелогичным распознавать страницу, в которой текст уже существует. Но OCR работает с тем, что реально нарисовано на экране. Если внутренний слой содержит ошибочные коды, повторное распознавание может получить корректные буквы из изображения. Этот приём особенно полезен для старых отчётов, документов с нестандартными встроенными шрифтами и PDF, полученных через сложный издательский экспорт.
Цена такого решения — возможные OCR-ошибки. Поэтому для обычной статьи достаточно беглой сверки, а для реквизитов, формул, юридических пунктов и числовых таблиц необходима посимвольная проверка важных мест.
Как скопировать таблицу, колонки и сложную верстку из PDF
Таблица на экране не обязательно хранится в PDF как настоящая таблица. Она может быть набором отдельных строк текста, линий и чисел, которые визуально образуют ячейки. Поэтому обычное выделение сверху вниз часто смешивает соседние столбцы. Аналогичная проблема возникает в двух- и трёхколоночных статьях.
Если таблица уже содержит настоящий текст
Сначала попробуйте Okular с Table Selection или Tabula. В Okular обведите таблицу, уточните границы строк и столбцов, затем скопируйте результат. В Tabula выделите область таблицы и экспортируйте её в CSV или Excel. Эти способы лучше обычного Ctrl+C, потому что учитывают структуру области.
Если таблица является сканом
Сначала нужен OCR. Для ручного контроля областей удобен ABBYY FineReader: проверьте, что область определена как таблица, а не как обычный текст. После распознавания сравните число строк и столбцов с оригиналом. На Linux можно сначала создать текстовый слой через OCRmyPDF, а затем использовать табличный инструмент, но результат всё равно зависит от того, насколько точно OCR восстановил символы и позиции.
Когда использовать Camelot
Camelot полезен при программной обработке серии text-based PDF. Он анализирует текстовые элементы и геометрию страницы. Для чистого скана без текстового содержимого классический сценарий Camelot не подходит: сначала создайте OCR-слой. Если требуется вытащить одну таблицу вручную, Tabula или Table Selection обычно проще; если нужно регулярно обрабатывать однотипные отчёты, программный подход масштабируется лучше.
Контроль таблицы после извлечения
- сравните количество строк и столбцов;
- проверьте, не сдвинулись ли значения на одну ячейку вправо или влево;
- сверьте десятичные разделители, знаки минус, проценты и валюты;
- проверьте объединённые ячейки и многострочные заголовки;
- сравните итоги по столбцам, если они есть;
- не доверяйте автоматическому распознаванию пустых ячеек: отсутствие символа может означать и пустоту, и нераспознанное значение.
Как работать с защищённым PDF без обхода чужих ограничений
Защита PDF — отдельная проблема от OCR. Документ может требовать пароль уже при открытии либо открываться свободно, но запрещать копирование, изменение и некоторые другие действия. Эти режимы не следует смешивать со сканированными страницами.
Пароль на открытие и ограничения permissions — не одно и то же
Пароль на открытие нужен, чтобы прочитать содержимое. Права доступа могут разрешать чтение, но ограничивать копирование, печать или редактирование. Если вы владелец документа, знаете пароль или получили его от владельца, изменяйте настройки безопасности документированными средствами PDF-редактора. В PDF Commander для этого используется вкладка «Безопасность» и настройка прав доступа; в Preview на Mac сведения о шифровании проверяются через Inspector.
Что делать, если пароль неизвестен
Не пытайтесь заменять право доступа техническим обходом. Запросите у отправителя:
- пароль;
- копию без запрета копирования;
- исходный DOCX, ODT или другой редактируемый файл;
- текстовую выписку нужного фрагмента.
Такой подход особенно важен для учебных материалов с лицензией, корпоративных документов и файлов с персональными данными. OCR не превращает отсутствие разрешения в разрешение на использование содержимого.
Почему «распечатать в новый PDF» больше не универсальный совет
Схема Print → Save as PDF иногда меняет внутреннюю структуру документа, потому что просмотрщик заново формирует вывод для виртуального PDF-принтера. Но результат зависит от разрешения на печать и состава исходной страницы: image-only PDF остаётся изображением, неправильный порядок текста может сохраниться, а сложные таблицы — потерять структуру. Поэтому виртуальную печать нельзя использовать как гарантированный способ вернуть корректное копирование.
Поэтому сейчас метод не должен быть первым. Для скана используйте OCR, для known-password permissions — нормальную настройку прав, для повреждённого текстового слоя — повторное распознавание. Виртуальная печать остаётся способом создать новую визуальную копию, но не гарантирует появление качественного текста.
Повреждённый PDF: когда проблема не в OCR и не в защите
Невозможность копирования иногда сопровождает повреждённую структуру PDF. Практический тест — открыть файл в нескольких независимых просмотрщиках. Если одна и та же страница не открывается, пропадает, отображается пустой или вызывает ошибки в разных программах, сначала получите новую копию документа от отправителя или заново экспортируйте его из исходного приложения. Это надёжнее, чем извлекать критичные данные из частично повреждённого файла.
Если страница визуально отображается полностью, но внутренний текст испорчен, можно сохранить визуальное содержимое и применить OCR. Однако после такой операции полученный текст нужно считать распознанной копией, а не гарантированно идентичным цифровым оригиналом.
Дополнительные инструменты: какую задачу они решают
Просмотрщик, OCR, конвертер, PDF-принтер и средство управления безопасностью решают разные задачи. В таблице ниже инструменты распределены по реальной роли: это помогает не запускать конвертацию там, где нужен OCR, и не путать проверку прав доступа с восстановлением текстового слоя.
| Программа или сервис | Роль в задаче | Практическое применение |
|---|---|---|
| PDF Commander | OCR, текстовый слой, права доступа | Основной первый способ: распознавание сканов и разрешённая настройка security |
| Adobe Acrobat Pro | OCR и проверка распознанного текста | Scan & OCR → Recognize text; затем Correct recognized text |
| Adobe Acrobat Reader | Просмотр и обычное копирование | Использовать как диагностический просмотрщик; не приписывать ему инструменты Acrobat Pro |
| ABBYY FineReader | OCR с разметкой областей | Выбирать для сложной структуры, таблиц и ручной проверки распознавания |
| ABBYY PDF Transformer | Конвертация PDF в редактируемый формат | Для image-only PDF использовать OCR в FineReader; обычная конвертация сама по себе не создаёт текстовый слой |
| PDFelement Pro | OCR документа и области | Tools → OCR или OCR Area |
| Foxit PDF Editor | OCR и редактирование PDF | Convert → Recognize Text для scanned PDF |
| Foxit Reader | Альтернативный просмотрщик | Проверить, одинаково ли копируется уже существующий текст |
| PDF-XChange Editor | Выделение, OCR и работа с PDF | OCR всей страницы или выбранной области, а также обычное выделение текста |
| PDF-XChange Viewer | Просмотр и инструменты старого Viewer | Не смешивать интерфейс Viewer с PDF-XChange Editor |
| Google Chrome | Просмотр, современный OCR scanned PDF | Пробовать выделение прямо в PDF Viewer; Print→PDF не считать гарантированным восстановлением текста |
| Mozilla Firefox | Альтернативный PDF-просмотрщик | Полезен для диагностики уже существующего текстового слоя |
| Google Drive + Google Docs | Облачное распознавание и редактируемый результат | На компьютере: Open with → Google Docs |
| Smallpdf | Онлайн OCR | Использовать для несекретных документов, если удобна облачная обработка |
| iLovePDF | Онлайн OCR | Указать язык и проверить полученный searchable PDF |
| OnlineOCR | Изображение/PDF → текст | Для небольших простых страниц, когда не нужно сохранять макет PDF |
| PDF24 Creator / PDF24 Tools | Настольные PDF-инструменты и отдельный веб-OCR | Не смешивать интерфейс Creator с онлайн OCR |
| WPS Office | Офисный/просмотровый путь | Использовать как дополнительную проверку текста, не как универсальный OCR |
| Calibre | Конвертация электронных документов | Для PDF с реальным текстом; не вместо OCR скана |
| Okular | Text/Area/Table Selection | Один из лучших Linux-вариантов для уже существующего текста и таблиц |
| Ghostscript | Пересборка/преобразование PDF | Не считать OCR и не использовать как универсальное средство снятия ограничений |
| pdftotext | Извлечение настоящего текста | Для born-digital PDF; сканы сначала распознавать |
| Tesseract | OCR-движок | Для изображений и автоматизации; для PDF удобнее через OCRmyPDF |
| OCRmyPDF | OCR-слой для PDF | Для многостраничных сканов и автоматизации |
| Tabula | Извлечение таблиц | Для табличных данных, а не для обычного текста |
| Camelot | Программное извлечение таблиц | Прежде всего text-based PDF; для скана сначала OCR |
| qpdf | Структура и безопасность PDF | Не OCR; не использовать здесь для обхода неизвестных паролей |
Как выбрать способ под конкретную ситуацию
| Способ | Лучший сценарий | Где работает | Главное ограничение |
|---|---|---|---|
| PDF Commander | Сканированный PDF, локальный OCR, известные права доступа | Windows, Linux | OCR нужно проверять на сложных страницах |
| ABBYY FineReader | Сложный OCR, таблицы, ручной контроль областей | Настольный компьютер | Избыточен для одной короткой цитаты |
| Microsoft Word | Текстовый PDF, который нужно получить в редактируемом виде | Компьютер | Макет может измениться |
| Adobe Acrobat Pro | OCR PDF с проверкой распознанного текста | Настольный компьютер | Не путать с Reader |
| Chrome | Разово выделить текст со скана без отдельного OCR-редактора | Компьютер | Меньше ручного контроля областей |
| Google Drive + Docs | Получить редактируемый текст онлайн | Браузер на компьютере | Файл уходит в облако, верстка меняется |
| Preview | Mac: обычное выделение или Embed Text | macOS | Меньше контроля над сложным OCR |
| Live Text | Один фрагмент на iPhone/iPad | iOS/iPadOS | Не подходит для массовой обработки страниц |
| Xodo PDF Reader | Мобильный OCR PDF | Android, iOS | Часть функций может зависеть от доступа в приложении |
| Okular | Linux, обычный текст и таблицы | Linux и поддерживаемые настольные ОС | Для image-only страницы нужен OCR |
| OCRmyPDF | Многостраничный scanned PDF и автоматизация | Командная строка | Нужен контроль OCR |
| pdftotext | Быстро извлечь уже существующий текст | Командная строка | Не распознаёт изображения |
| Tabula / Camelot | Табличные данные | Компьютер | Не универсальны для обычного текста; скан требует OCR |
Практические сценарии
Нужно скопировать один абзац из отсканированного договора на Windows
Откройте файл в PDF Commander, обработайте только нужную страницу и выберите невидимый текстовый слой. После OCR скопируйте абзац и сверяйте даты, номера и фамилии. Если установка отдельного редактора не нужна, можно попробовать локальный OCR Chrome.
Нужно перенести двадцать страниц текста в Word
Для текстового PDF сначала попробуйте Microsoft Word через File → Open. Если документ — скан, сначала выполните OCR в PDF Commander, FineReader или Acrobat. Не делайте двадцать скриншотов: массовая ручная работа увеличивает риск пропуска строк и ухудшает качество.
Нужно скопировать таблицу из отчёта на Linux
Если текст выделяется, начните с Okular Table Selection или Tabula. Если таблица — изображение, сначала OCR. Для серии однотипных text-based отчётов рассмотрите Camelot. Во всех случаях сверяйте число колонок, заголовки и суммы.
Нужно получить пару строк на телефоне
Сделайте скриншот страницы и используйте Live Text на iPhone/iPad или Google Lens на Android. Это быстрее, чем конвертировать весь файл. Для многостраничного PDF используйте Xodo или обработайте документ на компьютере.
PDF выделяется, но вместо букв вставляются символы
Откройте страницу во втором просмотрщике. Если ошибка повторяется, не перебирайте кодировки в текстовом редакторе: сделайте OCR визуального слоя. Для Linux дополнительно можно посмотреть информацию о ToUnicode через pdffonts.
Документ конфиденциальный
Выберите локальный путь: PDF Commander, FineReader, Acrobat, Preview, Chrome с локальным OCR или Linux-инструменты. Не загружайте файл в случайный веб-сервис только ради удобства. Если организационные правила запрещают передачу документа внешним сервисам, соблюдайте их даже при наличии технической возможности онлайн-OCR.
Как повысить точность OCR до копирования
Распознавание начинается не с кнопки, а с качества изображения. Большинство ошибок можно предсказать по странице ещё до OCR.
- Выпрямите страницу. Сильный наклон меняет геометрию строк и мешает разделять символы.
- Уберите тени от корешка и пальцев. Тёмные области рядом с текстом воспринимаются как дополнительные элементы.
- Не уменьшайте скан перед OCR без необходимости. Мелкие точки, запятые и элементы букв исчезают первыми.
- Укажите правильный язык. Это особенно важно для кириллицы, латиницы и смешанных документов.
- Обрабатывайте нужный диапазон. Смешанный PDF не нужно распознавать целиком, если большая часть страниц уже содержит текст.
- Для таблиц используйте табличную область. Обычный текстовый OCR может прочитать все цифры, но потерять связь со столбцами.
- Для одной цитаты увеличьте масштаб. Чёткий скриншот на 150–200% часто распознаётся лучше, чем мелкая страница целиком.
Как проверить результат: контрольный чек-лист
Успешное выделение после OCR — только первый признак. Перед использованием результата проведите короткую проверку. Она занимает меньше времени, чем исправление уже перенесённой ошибки.
- Поиск. Найдите в PDF редкое слово из середины проблемной страницы. Если оно находится, текстовый слой работает.
- Буфер обмена. Скопируйте два предложения в простой редактор без форматирования. Так проще увидеть лишние переносы и невидимые символы.
- Цифры. Сверьте 0/O, 1/I/l, 5/S, 8/B, десятичные разделители и знак минус.
- Имена. Проверьте фамилии, названия компаний, адреса и аббревиатуры: словарь OCR не всегда помогает с редкими словами.
- Пунктуация. Смотрите на кавычки, тире, дефисы и скобки, особенно в юридических формулировках.
- Колонки. Убедитесь, что конец первой колонки не склеился с началом второй.
- Таблицы. Сравните количество ячеек и контрольные суммы.
- Смешанные страницы. Пролистайте документ и убедитесь, что OCR применён ко всем сканам, а не только к первой странице.
Частые ошибки и как их избежать
Ошибка: сразу конвертировать PDF в Word
Если текстовый слой повреждён, Word может перенести те же неправильные символы. Сначала скопируйте одно предложение. Если оно уже испорчено, лучше распознать страницу заново.
Ошибка: запускать OCR для нормального текстового PDF
Когда текст копируется правильно, дополнительное распознавание создаёт ненужный риск ошибок. Используйте исходный слой.
Ошибка: распознавать весь файл из-за одной страницы
Выберите текущую страницу или диапазон. Это быстрее и сохраняет исправные части документа без лишней обработки.
Ошибка: считать любую таблицу обычным текстом
Для таблиц нужен структурный инструмент: FineReader с областями, Okular Table Selection, Tabula или Camelot для подходящего text-based PDF.
Ошибка: доверять онлайн-сервису любой документ
Сначала определите уровень конфиденциальности. Если файл содержит персональные, коммерческие или иные чувствительные сведения, локальный OCR даёт более контролируемый процесс.
Ошибка: пытаться «исправить кодировку» после вставки кракозябр
Если PDF отдаёт неправильные коды символов, смена UTF-8/ANSI в текстовом редакторе не восстанавливает отсутствующее сопоставление глифов. Перепроверьте в другом viewer и при необходимости выполните OCR.
Ошибка: использовать Print → Save as PDF как гарантированный способ
Виртуальная печать может изменить структуру, но не создаёт гарантированно правильный текст и не заменяет OCR. Старые инструкции давали противоречивые результаты.
Ошибка: обходить неизвестный пароль
Если нет пароля или разрешения владельца, запросите доступ. Техническая возможность не заменяет право на копирование содержимого.
Ответы на практические вопросы
Почему текст видно, но его нельзя выделить?
Чаще всего страница является изображением. В PDF сохранены пиксели, а не символы. Создайте текстовый слой через OCR — например, в PDF Commander, Chrome, Preview, FineReader, Acrobat, Xodo или OCRmyPDF.
Как понять, нужен ли OCR?
Попробуйте выделить одно слово и найти видимую фразу через поиск. Если выделения и поиска нет, OCR — следующий логичный шаг. Если выделение есть, но текст вставляется неправильно, сначала проверьте проблему карты символов.
Можно ли распознать только одну страницу?
Да. В PDF Commander, Acrobat, PDFelement и других OCR-редакторах можно задавать текущую страницу или диапазон. Это предпочтительнее обработки всего mixed PDF.
Почему после OCR цифры всё равно ошибочные?
OCR сравнивает изображение с моделями символов. На слабом скане похожие формы — 0/O, 1/I/l, 5/S — могут смешиваться. Укажите правильный язык, используйте более чёткий скан и обязательно сверяйте критичные числа.
Что делать, если текст копируется без пробелов?
Причина находится в структуре PDF и позиционировании символов. Проверьте другой движок. Если несколько независимых просмотрщиков дают одинаковый результат, OCR визуального слоя создаёт новый текстовый слой и часто восстанавливает обычное разделение слов лучше, чем повторное извлечение повреждённого текста.
Почему абзацы копируются в неправильном порядке?
На странице текстовые блоки могут храниться по координатам, а не в логическом порядке чтения. Используйте инструмент, который анализирует макет, либо копируйте отдельные области. Для таблиц применяйте Table Selection или специализированное извлечение.
Можно ли скопировать текст без установки программы?
Да. На компьютере попробуйте Chrome, Google Drive/Docs, Smallpdf, iLovePDF или онлайн OCR PDF24. На iPhone для одной страницы подходит Live Text, на Android — Google Lens. Для конфиденциального файла предпочтительнее локальная обработка.
Что лучше для многостраничного скана?
Используйте OCR, который создаёт текстовый слой для всего PDF: PDF Commander, FineReader, Acrobat, Preview на Mac, Xodo на мобильном устройстве или OCRmyPDF в командной строке. Скриншоты каждой страницы — запасной, а не основной путь.
Можно ли сохранить исходный вид страницы?
Да. Выбирайте режим, который добавляет невидимый/searchable текстовый слой поверх исходного изображения, а не заменяет скан новым наборным текстом. В PDF Commander для этого есть «Добавить невидимый слой текста»; аналогичная идея используется в searchable PDF у других OCR-инструментов.
Как перенести таблицу в Excel?
Если таблица text-based, используйте Tabula или Table Selection в Okular и затем проверьте CSV/табличный результат. Если таблица — скан, сначала OCR с корректным определением табличной области. Нельзя судить о точности только по тому, что числа «похожи» на оригинал.
Почему Google Docs испортил форматирование?
Маршрут Drive → Open with Google Docs ориентирован на получение редактируемого содержания, а не на точное воспроизведение фиксированной PDF-верстки. Для сохранения вида страницы лучше создать searchable PDF с невидимым слоем.
Нужно ли менять кодировку TXT после копирования?
Только если проблема действительно возникла при сохранении текстового файла. Если неправильные символы появляются уже сразу после вставки из PDF, причина обычно находится в извлечении текста из PDF, и смена кодировки TXT не восстанавливает правильные символы.
Что делать со смешанным PDF, где часть страниц нормальная, а часть — сканы?
Не распознавайте исправные страницы без необходимости. Выберите диапазон сканов или используйте инструмент, который корректно работает со смешанными документами. После обработки проверьте поиск на одной цифровой и одной отсканированной странице.
Можно ли использовать OCR для защищённого PDF?
Техническая возможность распознавать изображение не отменяет ограничений доступа. Для собственного или разрешённого документа с известным паролем сначала приведите права в нужное состояние. Для чужого файла с неизвестным паролем запросите разрешение или доступную копию.
Что выбрать для разовой задачи?
На Windows начните с PDF Commander, если нужен управляемый OCR внутри PDF; для быстрого скана без отдельной обработки попробуйте Chrome. На Mac сначала Preview. На телефоне для одного фрагмента используйте Live Text или Google Lens. Если задача повторяется регулярно, удобнее полноценный OCR-инструмент или автоматизированный процесс.
Что выбрать, если важна конфиденциальность?
Предпочитайте локальные методы: PDF Commander, FineReader, Acrobat, Preview, локальный OCR Chrome, Okular/OCRmyPDF. Онлайн-сервисы полезны, но предполагают передачу файла на сервер, поэтому их пригодность определяется требованиями к данным.
Итог: какой маршрут использовать
Если текст не выделяется, сначала определите, является ли страница сканом. На Windows основной маршрут — PDF Commander с OCR и невидимым текстовым слоем; на Mac — Preview с Text Selection или Embed Text; для быстрой разовой задачи на компьютере — Chrome; на телефоне — Live Text, Google Lens или Xodo. Если символы выделяются, но вставляются неверно, проверяйте карту символов и при необходимости распознавайте визуальную страницу заново. Для таблиц используйте инструменты, которые понимают строки и столбцы, а не обычное линейное копирование.
Главная проверка одинакова для любого способа: после обработки найдите фразу в PDF, скопируйте контрольный абзац без форматирования и сверяйте критичные символы с оригиналом. Возможность нажать Copy означает только то, что текстовый слой появился; точность результата подтверждает лишь сравнение с исходной страницей.