Если страница PDF является сканом, в ней нет обычных символов: программа видит изображение целиком, поэтому слово нельзя выделить курсором и скопировать. OCR — оптическое распознавание текста — анализирует такую страницу, находит строки и символы и добавляет текстовое представление. После обработки можно получить отдельный текст, редактируемый документ или PDF с поисковым слоем. В этой инструкции первым разобран PDF Commander, затем способы для других настольных систем, браузера, iPhone, Android и Linux.
Перед запуском OCR определите конечную задачу. Для цитаты или заметки достаточно получить обычный текст. Для правки содержания удобнее DOCX. Для договора, книги, инструкции или папки сканов, где важен внешний вид страниц, нужен searchable PDF: изображение остается визуальной основой, а распознанный слой позволяет искать и копировать слова. Если требуется перенос таблиц в расчеты, оценивают не только качество букв, но и структуру строк и столбцов.
Сначала проверьте, действительно ли PDF требует OCR
Откройте документ и попробуйте выделить одно слово. Затем скопируйте его в простой текстовый редактор. Если вставляется нормальная строка, текстовый слой уже существует и повторное распознавание не нужно. Если курсор выделяет страницу как единую картинку, не цепляется за символы или после копирования получается пустота, перед вами скан.
В одном файле могут сочетаться разные страницы. Например, титульный лист создан из текста, а приложения к нему отсканированы. В такой ситуации OCR запускают только для страниц без текстового слоя. Это сокращает время обработки и снижает риск наложить второй, ошибочный слой поверх уже распознанного текста.
| Проверка | Что означает результат | Действие |
|---|---|---|
| Слово выделяется по символам | Текстовый слой есть | Копировать, экспортировать или редактировать без OCR |
| Выделяется вся страница или прямоугольник | Страница состоит из изображения | Запустить OCR |
| Одни страницы выделяются, другие нет | Смешанный PDF | Распознать только страницы-сканы |
| Текст выделяется, но копирование запрещено | Действуют права доступа PDF | Работать с разрешениями, а не распознавать документ заново |
Пароль или запрет копирования — другая задача. OCR не должен использоваться для обхода ограничений чужого документа. Если защита установлена вами, измените права доступа штатными средствами и только после этого выполняйте необходимые операции.
Как подготовить скан, чтобы OCR сделал меньше ошибок
Качество распознавания сильно зависит от изображения. Поверните страницу в правильную ориентацию, устраните заметный перекос, обрежьте темные поля и убедитесь, что строки не размыты. Для обычной печатной страницы практичным ориентиром служит около 300 dpi: этого достаточно, чтобы сохранялись тонкие элементы шрифта, но файл не разрастался без необходимости. Простое увеличение маленького размытого изображения не возвращает потерянные детали, поэтому плохой скан лучше переснять или пересканировать.
- Язык. Если OCR предлагает выбор языков, включайте языки, которые реально присутствуют на странице. Для русско-английского документа полезно активировать оба, иначе похожие кириллические и латинские буквы будут путаться чаще.
- Перекос. Строка должна идти горизонтально. На фото с телефона исправьте перспективу, чтобы верхний и нижний край страницы не сходились трапецией.
- Контраст. Серый фон, тени от переплета и просвечивание обратной стороны создают ложные штрихи. Очистка фона и перевод в более контрастный режим помогают до OCR.
- Колонки. На газетной или журнальной странице заранее определите порядок чтения. Если программа поддерживает области, размечайте колонки отдельно.
- Таблицы. Приоритет — не только распознать цифры, но и сохранить принадлежность значения к строке и столбцу.
- Печати и подписи. Они могут перекрывать напечатанные строки. В ответственных документах перекрытые места сверяют по изображению вручную.
- Мелкий шрифт. Если буквы при увеличении выглядят как размытые пятна, OCR не восстановит их надежно; нужен более четкий снимок.
Быстрый тест перед обработкой большой папки.
Не запускайте сотни страниц сразу. Возьмите три характерные страницы: обычный текст, самую плохую по качеству и страницу с таблицей или двумя колонками. Выполните OCR на них, проверьте фамилии, числа, переносы и порядок чтения. Только после этого применяйте те же параметры ко всему документу. Такой тест быстрее, чем исправлять неправильно распознанную книгу после пакетной обработки.
Как выбрать результат распознавания
Одинаковое слово может быть распознано правильно, но итоговые файлы у разных программ будут различаться. Поэтому выбор режима делают до запуска OCR. Главный вопрос — нужно ли сохранить изображение страницы, редактировать текст как документ или забрать только данные.
| Результат | Что остается в файле | Когда выбирать | Что проверить |
|---|---|---|---|
| TXT | Только символы без сложной верстки | Цитата, заметка, дальнейшая обработка текста | Порядок строк и переносы |
| DOCX | Текст и часть структуры страницы | Нужно переписать, отредактировать или оформить документ заново | Абзацы, колонки, сноски и таблицы |
| XLSX | Табличные данные | Ведомости, счета, прайсы и другие таблицы | Числа, десятичные разделители, объединенные ячейки |
| Searchable PDF | Изображение страницы плюс поисковый текстовый слой | Архив, договор, книга, техническая документация | Поиск, копирование и совпадение выделения со строками |
| Редактируемый PDF | Распознанные текстовые объекты внутри PDF | Нужно исправлять надписи непосредственно в PDF | Шрифты, интервалы и положение текстовых блоков |
| JSON или набор полей | Текст, координаты и структурированные значения | API, счета, формы, автоматизация | Связь каждого поля с нужной областью документа |
Для большинства отсканированных договоров и книг безопаснее начинать с searchable PDF: внешний вид страницы не пересобирается из новых шрифтов и блоков. Для дальнейшего редактирования содержания лучше DOCX. Если задача — получить значения из таблицы, экспорт в XLSX проверяют по строкам, а не только визуально.
Как распознать текст PDF в Windows
PDF Commander
PDF Commander — основной первый способ. Программа работает непосредственно с PDF: можно выбрать диапазон страниц, язык распознавания и вариант результата. Для скана, внешний вид которого нужно сохранить, подходит режим с невидимым текстовым слоем. Если нужен только текст, его можно извлечь отдельно.

- Откройте документ. В стартовом окне нажмите «Открыть файл» и выберите PDF со сканированными страницами.
- Перейдите к распознаванию. Откройте вкладку «Распознавание» и нажмите «Распознать текст».
- Задайте страницы. В окне «Распознавание PDF» выберите текущую страницу, весь документ или нужный диапазон. Для большого файла сначала обработайте несколько тестовых страниц.
- Выберите модуль. «Быстрый» режим рассчитан на качественный печатный скан. Для более сложной страницы используйте более точный доступный режим распознавания.
- Определите результат. «Извлечь текст» нужен для получения отдельного текста. «Добавить невидимый слой текста» делает скан доступным для поиска и копирования без заметного изменения его внешнего вида.
- Укажите языки. Отметьте русский, английский или другие установленные языки. На двуязычной странице включите оба.
- Сохраните копию. Для первой обработки удобнее сохранить результат в новый файл, чтобы оригинальный PDF остался нетронутым.
- Проверьте OCR. Найдите поиском редкое слово, скопируйте абзац и отдельно сверьте числа, даты и таблицы.


Если PDF содержит таблицу, сначала распознайте одну страницу и проверьте, в каком порядке копируются ячейки. Для таблиц с нестандартной сеткой полезнее обработать конкретную область, чем сразу полагаться на автоматическое чтение всей страницы.

Плюсы:
- работает с многостраничным PDF без промежуточного экспорта каждой страницы в изображение
- позволяет ограничить OCR нужным диапазоном страниц
- есть отдельное извлечение текста и вариант с невидимым поисковым слоем
- после распознавания можно продолжить работу с PDF в том же приложении
Минусы:
- сложные таблицы, печати и поврежденные сканы требуют ручной сверки
- для разового копирования одной строки системный OCR Windows может быть быстрее
ABBYY FineReader PDF
ABBYY FineReader PDF полезен там, где одного автоматического OCR недостаточно. В OCR Editor можно сравнивать изображение страницы с распознанным текстом, корректировать области и отдельно работать с таблицами. Такой подход удобен для книг, старых сканов, многоязычных документов и страниц со сложной версткой.

- Откройте PDF в редакторе OCR.
- Проверьте области на странице: текст, таблицы и изображения должны быть определены правильно.
- Выберите языки документа и запустите распознавание.
- Сверьте сомнительные фрагменты с изображением, особенно собственные имена, числа и сокращения.
- Для таблиц проверьте границы ячеек и порядок строк.
- Экспортируйте результат в PDF, DOCX, XLSX, TXT или другой формат, который нужен для дальнейшей работы.
Плюсы:
- ручная коррекция областей помогает на сложной верстке
- можно проверять распознанный текст рядом с изображением страницы
- есть отдельные сценарии для таблиц и экспорта в редактируемые форматы
Минусы:
- для одной простой страницы функциональность избыточна
- коммерческий пакет рассчитан на регулярную работу, а не только на единичное копирование фрагмента
Adobe Acrobat Pro
В Adobe Acrobat Pro OCR находится в наборе «Сканирование и OCR». Для уже открытого сканированного файла команда «В этом файле» позволяет выбрать страницы и язык, а «Распознать текст» добавляет поисковый слой. После обработки можно отдельно просмотреть сомнительно распознанные места.

- Откройте сканированный PDF.
- Перейдите в «Все инструменты» → «Сканирование и OCR».
- Выберите «В этом файле».
- Укажите нужный диапазон страниц и язык.
- Нажмите «Распознать текст».
- После OCR проверьте подозрительные слова и сохраните документ.
Плюсы:
- создает поисковый текстовый слой внутри PDF
- позволяет распознавать выбранный диапазон страниц
- есть отдельная проверка сомнительных результатов OCR
Минусы:
- полноценный OCR относится к Acrobat Pro, а не к простому режиму просмотра
- плохой скан приходится предварительно выравнивать и очищать
PDFelement
PDFelement умеет превращать image-based PDF в searchable или редактируемый документ. При открытии скана программа может предложить Perform OCR; в настройках выбирают языки и тип результата. Есть распознавание всего документа, выбранной области и пакетный OCR.


- Откройте сканированный PDF.
- Нажмите Perform OCR либо откройте инструмент OCR Text Recognition.
- Выберите весь файл или нужную область.
- Задайте язык распознавания.
- Выберите searchable-режим, если нужно сохранить вид скана, либо editable-режим, если текст требуется менять.
- После обработки проверьте документ и при необходимости экспортируйте его в Word, Excel или текстовый формат.
Плюсы:
- можно выбирать между поисковым и редактируемым результатом
- есть распознавание отдельных областей и пакетная обработка
- OCR совмещен с дальнейшим редактированием и конвертацией PDF
Минусы:
- для одной строки интерфейс и набор функций избыточны
- редактируемый режим требует более внимательной проверки верстки, чем простой searchable PDF
PDF-XChange Editor

В PDF-XChange Editor основной путь — вкладка Convert → OCR Pages. В диалоге задают диапазон страниц и параметры распознавания. Для отдельного фрагмента можно сначала создать область инструментом Snapshot Tool или Crop Page Tool, затем вызвать команду OCR Selected Region из контекстного меню.
- Откройте PDF и перейдите на вкладку Convert.
- Нажмите OCR Pages.
- Задайте страницы и язык.
- Для обычного скана выберите поисковый вариант результата. Расширенный OCR также предлагает режимы Editable Text and Images и Fine Page Content.
- Если нужен один фрагмент, выделите область, щелкните ее правой кнопкой и выберите OCR Selected Region.
- Сохраните PDF и проверьте поиск по словам внутри обработанной области.
Плюсы:
- есть OCR всей страницы и отдельной выделенной области
- расширенный модуль позволяет выбирать способ построения результата
- удобен для пользователей, которые уже редактируют PDF в PDF-XChange Editor
Минусы:
- расширенные режимы OCR относятся к лицензируемым возможностям
- пакетная обработка множества отдельных файлов удобнее в PDF-Tools
Master PDF Editor
Master PDF Editor доступен в Windows, macOS и Linux. Для скана используется «Документ» → «Распознавание текста». OCR добавляет распознанный слой, после чего слова можно искать и копировать; в параметрах выбираются страницы, языки и обработка изображения.


- Откройте сканированный PDF.
- Выберите «Документ» → «Распознавание текста».
- Задайте страницы и языки.
- При необходимости включите выравнивание и параметры обработки изображения.
- Запустите OCR.
- Проверьте поиск и копирование, затем сохраните файл.
Плюсы:
- один редактор работает на трех настольных системах
- OCR встроен непосредственно в PDF-редактор
- есть настройки языков и подготовки изображения
Минусы:
- сложные страницы требуют ручной проверки после автоматического распознавания
- демонстрационный режим редактора имеет ограничения вывода
PDF Candy
PDF Candy подходит для более простого сценария: открыть скан, выбрать OCR и получить поисковый или преобразованный результат без ручной разметки каждой области. Это удобно для обычных страниц, где структура несложная и важнее скорость, чем детальный контроль зон.

- Добавьте сканированный PDF.
- Откройте инструмент OCR.
- Выберите язык документа.
- Запустите распознавание.
- Сохраните результат и проверьте несколько абзацев и числовых значений.
Плюсы:
- короткий рабочий процесс без ручной разметки областей
- есть настольные и браузерные инструменты для работы с PDF
- подходит для обычных одноколоночных документов
Минусы:
- контроль сложных таблиц и нестандартной верстки слабее, чем в специализированном OCR-редакторе
- на больших файлах условия бесплатного режима могут ограничивать удобство работы
Microsoft OneNote
Microsoft OneNote полезен, когда нужно извлечь текст из одной картинки или файловой распечатки, а не сформировать качественный searchable PDF. Изображение вставляют в заметку, затем вызывают OCR через контекстное меню.

- Вставьте изображение страницы или файловую распечатку в заметку.
- Щелкните изображение правой кнопкой мыши.
- Выберите «Копировать текст с рисунка»; для распечатки используйте команду копирования текста со страницы распечатки.
- Вставьте результат в заметку или текстовый редактор.
- Сверьте переносы, числа и слова на границе изображения.
Плюсы:
- быстро извлекает текст из отдельного изображения
- не требует отдельного OCR-проекта, если OneNote уже используется для заметок
Минусы:
- не предназначен для сохранения сложного многостраничного searchable PDF
- не дает такого контроля областей и таблиц, как специализированные OCR-пакеты
Snipping Tool: OCR фрагмента экрана
В Windows 11 Snipping Tool умеет распознавать текст на сделанном снимке. После захвата нажмите Text actions, затем выделите нужный фрагмент или выберите Copy all text. Это локальный способ быстро забрать одну строку или абзац с открытой страницы PDF.

- Откройте нужную страницу PDF.
- Запустите Snipping Tool и сделайте снимок области с текстом.
- Нажмите Text actions.
- Скопируйте весь распознанный текст или только выбранную строку.
- Вставьте результат и проверьте цифры и специальные символы.
Плюсы:
- не нужно устанавливать отдельный OCR-редактор
- подходит для одного фрагмента страницы
- текст распознается на устройстве
Минусы:
- не создает поисковый текстовый слой внутри PDF
- многостраничный документ пришлось бы обрабатывать вручную по снимкам
Readiris PDF

Readiris PDF сочетает OCR, сканирование, конвертацию и управление PDF. Сканированные документы можно преобразовывать в searchable или редактируемые PDF, Word и Excel. Такой пакет уместен, когда OCR является частью регулярного документооборота, а не единичной операцией.
- Добавьте PDF или получите страницы со сканера.
- Запустите Scan and OCR.
- Выберите язык и нужный тип результата.
- Для таблицы используйте экспорт в Excel и проверьте ячейки после распознавания.
- Для архива создайте searchable PDF и убедитесь, что поиск находит слова на разных страницах.
Плюсы:
- поддерживает searchable и редактируемые PDF
- может экспортировать распознанные данные в Word и Excel
- подходит для регулярной обработки документов
Минусы:
- для одной короткой страницы набор функций избыточен
- при сложной верстке после экспорта нужно проверять структуру документа
VueScan

VueScan особенно полезен, когда OCR начинается не с готового PDF, а со сканера. Для создания поискового PDF в параметрах вывода используется PDF OCR text. Таким образом можно сразу получить многостраничный PDF, в котором изображение страницы сочетается с поисковым текстом.
- Переключите интерфейс в режим Professional.
- Настройте сканирование и получите четкое изображение страницы.
- Откройте вкладку Output.
- Включите PDF OCR text.
- Отсканируйте документ и откройте созданный PDF.
- Проверьте поиск по словам на первой и последней страницах.
Плюсы:
- объединяет получение изображения со сканера и создание searchable PDF
- удобен для многостраничного бумажного документа
- позволяет подготовить качественное изображение до OCR
Минусы:
- не заменяет редактор для ручной корректировки распознанных областей
- создание searchable PDF с OCR относится к Professional Edition
Foxit PDF Editor

Foxit PDF Editor определяет сканированные или image-based PDF и предлагает запустить распознавание. Для ручного запуска используется Convert → Recognize Text → Current File: затем выбирают диапазон страниц и параметры OCR. После обработки текст становится доступным для поиска и дальнейшей работы.
- Откройте сканированный PDF.
- Перейдите в Convert → Recognize Text → Current File.
- Выберите нужный диапазон страниц.
- Задайте параметры распознавания и запустите OCR.
- Проверьте выделение текста и поиск по нескольким страницам.
Плюсы:
- OCR встроен в полноценный PDF-редактор
- можно ограничить обработку нужным диапазоном страниц
- подходит, когда после распознавания документ нужно редактировать или аннотировать
Минусы:
- для одной строки отдельный PDF-редактор избыточен
- точность таблиц и сложного макета необходимо проверять после OCR
Nitro PDF Pro

В Nitro PDF Pro OCR запускается на вкладке Review кнопкой OCR. В диалоге доступны два практических результата: Make Searchable для выбора и поиска текста и Make Searchable and Editable для последующего редактирования.
- Откройте PDF.
- На вкладке Review нажмите OCR.
- Выберите Make Searchable либо Make Searchable and Editable.
- Через дополнительные параметры задайте страницы и OCR-настройки.
- Нажмите OK и дождитесь завершения.
- Проверьте поиск, копирование и — для редактируемого режима — положение текстовых объектов.
Плюсы:
- понятно разделяет поисковый и редактируемый результат
- можно выбирать отдельные страницы
- OCR встроен в общий рабочий процесс редактирования PDF
Минусы:
- редактируемый режим сильнее зависит от качества верстки, чем простой searchable PDF
- для единичного фрагмента системный OCR Windows быстрее
Инструменты, которые помогают со сканированием, но не заменяют полноценный OCR
В подборках PDF-программ рядом с OCR часто стоят средства сканирования и конвертации. Их роль полезна, но другая. Scanitto Pro упрощает получение страниц со сканера; WinScan2PDF быстро собирает сканы в PDF; DocuFreezer предназначен для пакетного преобразования документов. Если итоговый PDF состоит только из изображений, поисковый слой нужно создавать отдельным OCR-инструментом.
OCR CuneiForm — классический OCR-проект, который встречается в старых Windows-сценариях. Для новой большой инструкции он уступает активным PDF-редакторам и современным open-source связкам по удобству текущего рабочего процесса, поэтому его разумно рассматривать только для совместимости с уже настроенной системой, а не как первый выбор.
Как распознать PDF на macOS
NAPS2

NAPS2 работает с отсканированными страницами и импортированными PDF, а OCR используется для создания поискового текста внутри PDF. На macOS OCR открывается через меню Tools → OCR. После выбора языка включают создание searchable PDF и сохраняют документ.
- Импортируйте PDF или отсканируйте страницы.
- Откройте Tools → OCR.
- Выберите нужные языки.
- Включите Make PDFs searchable using OCR.
- Для плохого скана используйте доступные параметры очистки, включая исправление баланса белого и удаление шума.
- Сохраните PDF и проверьте поиск на нескольких страницах.
Плюсы:
- бесплатный инструмент без рекламных ограничений
- может добавлять OCR к импортированному PDF
- удобно объединяет сканирование, многостраничный PDF и поисковый слой
Минусы:
- для ручной коррекции таблиц и сложных зон возможностей меньше, чем у специализированных OCR-редакторов
- качество результата зависит от выбранного языка и качества скана
Prizmo
Prizmo ориентирован на Mac, iPhone и iPad и сочетает подготовку изображения с OCR. В приложение можно импортировать PDF или снимки страниц, исправить перспективу и читаемость, распознать текст и экспортировать его в searchable PDF или редактируемый формат. Один и тот же продукт здесь описывается один раз; мобильный сценарий аналогичен по логике.
- Импортируйте PDF или изображения страниц.
- Проверьте кадрирование, перспективу и читаемость.
- Откройте инструмент OCR и выберите язык.
- Запустите распознавание.
- Исправьте очевидные ошибки в распознанном тексте.
- Экспортируйте searchable PDF или DOCX, если документ нужно редактировать.
Плюсы:
- OCR и коррекция фотографии находятся в одном рабочем процессе
- можно создавать searchable PDF
- подходит для пользователей Mac и мобильных устройств Apple
Минусы:
- не предназначен для Windows и Linux
- для серверной пакетной обработки удобнее командные инструменты
Preview : проверка уже распознанного PDF

Preview удобен для контроля готового документа: поиск и выделение сразу показывают, существует ли текстовый слой. Для произвольного многостраничного скана Preview не стоит использовать как основной OCR-движок. Если страницы являются изображениями, сначала обработайте файл в NAPS2, Prizmo, Acrobat, FineReader или другом OCR-инструменте, затем откройте результат в Preview и проверьте поиск.
Как распознать PDF онлайн без установки
Браузерный OCR удобен для разового несекретного файла. Главный компромисс — документ передается внешнему сервису. Паспорт, медицинская документация, закрытый договор, финансовый отчет и другие материалы с чувствительными данными лучше обрабатывать локально, если политика хранения не разрешает загрузку в стороннее облако.
Google Drive + Google Docs
Google Drive может открыть загруженный PDF через Google Docs и преобразовать изображение текста в редактируемый документ. Этот способ удобен, когда нужен сам текст, а не точное сохранение страницы. Сложные таблицы, колонки, сноски и декоративное форматирование могут переноситься неполно.

- Загрузите PDF в Google Drive с компьютера.
- Щелкните файл правой кнопкой.
- Выберите «Открыть с помощью» → «Google Документы».
- Дождитесь создания нового документа с распознанным текстом.
- Сверьте текст с PDF, особенно таблицы и многостолбцовую верстку.
Плюсы:
- результат сразу доступен для редактирования в Google Docs
- не требуется отдельная OCR-программа
- удобен для текста из небольшой простой страницы
Минусы:
- не предназначен для точного сохранения исходной верстки скана
- облачная обработка не подходит для документов, которые нельзя передавать стороннему сервису
OnlineOCR.net
OnlineOCR.net принимает изображения и PDF, включая многостраничные документы, и может отдавать результат в Word, Excel, RTF, HTML, TXT и другие доступные форматы. Для гостевого режима действуют ограничения, поэтому сервис практичнее для небольших задач, чем для регулярного массового OCR.

- Выберите PDF.
- Укажите язык распознавания.
- Выберите выходной формат.
- Запустите преобразование.
- Скачайте результат и проверьте переносы, числа и структуру таблиц.
Плюсы:
- принимает PDF напрямую
- есть несколько редактируемых форматов результата
- подходит для разовой работы в браузере
Минусы:
- гостевой режим имеет лимиты
- документ передается на внешний сервер
PDF24 Tools
В PDF24 есть отдельный инструмент PDF OCR для создания searchable PDF. Он позволяет выбрать язык и параметры подготовки страниц, включая выравнивание и удаление артефактов. Это один из более подходящих онлайн-вариантов, когда результатом должен остаться именно PDF, а не отдельный текстовый файл.

- Добавьте PDF в инструмент OCR.
- Выберите язык.
- При необходимости включите выравнивание и очистку артефактов.
- Запустите распознавание.
- Сохраните searchable PDF и проверьте поиск по нескольким страницам.
Плюсы:
- результатом остается searchable PDF
- есть параметры подготовки плохого скана
- не требуется устанавливать настольный редактор
Минусы:
- онлайн-режим передает документ на сервер
- нет такой же ручной коррекции зон, как в полноценном OCR-редакторе
OCR.Space
OCR.Space принимает PDF и распространенные форматы изображений, возвращает текст и умеет создавать searchable PDF. Для автоматизации у сервиса есть API. В бесплатном режиме создания searchable PDF действует ограничение по страницам, поэтому его лучше использовать для короткого документа или теста.

- Добавьте PDF.
- Выберите язык.
- Определите, нужен ли обычный текст или searchable PDF.
- Запустите OCR.
- Проверьте полученный текст, а для PDF — поиск на каждой обработанной странице.
Плюсы:
- работает с PDF и изображениями
- может создать searchable PDF
- есть API для автоматизированных задач
Минусы:
- бесплатное создание searchable PDF ограничено по количеству страниц
- файл обрабатывается в облаке
iLovePDF

iLovePDF имеет OCR-инструмент для превращения невыделяемого текста в поисковый. Сервис уместен, когда пользователь уже работает с его браузерными PDF-инструментами и допускает облачную загрузку документа.
- Добавьте сканированный PDF в OCR-инструмент.
- Выберите доступные параметры распознавания.
- Запустите OCR.
- Сохраните обработанный PDF.
- Проверьте выделение и поиск по нескольким словам.
Плюсы:
- работает в браузере
- результат остается PDF с доступным для поиска текстом
- удобно совмещается с другими PDF-операциями
Минусы:
- обработка выполняется в облаке
- для ручной разметки сложных зон лучше настольный OCR-редактор
Smallpdf

Smallpdf распознает отсканированные PDF и позволяет получить searchable PDF либо продолжить преобразование в Word. Это простой вариант для короткого документа, когда не нужны отдельные зоны OCR и ручная настройка чтения колонок.
- Добавьте сканированный PDF.
- Запустите OCR.
- Выберите сохранение поискового PDF или дальнейшее преобразование в редактируемый формат.
- Скачайте результат.
- Проверьте числа, переносы строк и таблицы.
Плюсы:
- простой браузерный рабочий процесс
- можно сохранить поисковый PDF или перейти к Word
- не требуется установка
Минусы:
- документ передается стороннему сервису
- на сложном макете меньше ручного контроля, чем в настольных OCR-пакетах
Другие веб-сервисы из той же категории
Soda PDF, Aspose, Online-convert и Anytools.pro относятся к браузерным инструментам работы с документами или изображениями. Для сканированного PDF важно выбирать именно функцию OCR: обычный «PDF to text» может извлечь только уже существующий текстовый слой и ничего не сделать со страницей-картинкой.
NewOCR, img2txt, i2OCR, Prepostseo, Go4convert, «Цифра Р» и сервисы «Фото в текст» удобнее рассматривать как способы распознать отдельную страницу или изображение. Если сервис не принимает PDF напрямую, экспортируйте нужную страницу в PNG/JPEG и распознавайте ее как изображение. Для многостраничного searchable PDF такой обходной путь хуже специальных PDF-OCR сервисов: придется вручную разбирать страницы и затем собирать документ обратно.
PDF Maestro, Visual Paradigm Online и Lynote относятся к более специализированным облачным сценариям. В основной рабочий процесс их имеет смысл включать только тогда, когда пользователь уже работает в соответствующей среде; для простой задачи «сделать скан поисковым» быстрее выбрать инструмент, который принимает PDF напрямую.
ИИ и Document AI: когда это не замена обычному OCR
Мультимодальные ИИ и системы Document AI решают соседние, но не одинаковые задачи. Классический OCR отвечает прежде всего на вопрос «какие символы находятся на странице и где они расположены». Мультимодальная модель может дополнительно объяснить содержимое, собрать список полей или пересказать таблицу, а Document AI — вернуть структурированные значения и координаты для дальнейшей автоматизации.
| Класс инструмента | Что получается | Для чего подходит | Что не заменяет |
|---|---|---|---|
| OCR PDF | Текстовый слой или редактируемый текст | Поиск, копирование, архивирование скана | Смысловой анализ документа |
| Мультимодальный ИИ | Текст, ответ на вопрос, структурированный список | Разбор одной страницы, объяснение и извлечение нужных фактов | Гарантированное построение корректного слоя в оригинальном PDF |
| Document AI / OCR API | Текст, координаты, поля, JSON | Интеграция в приложение и поток однотипных документов | Простой настольный редактор для ручной работы |
| Автоматизация счетов и форм | Поля документа и workflow | Бухгалтерские и корпоративные процессы | Бытовой OCR одной страницы |
ChatGPT, Claude и DeepSeek можно использовать для чтения изображения страницы и получения текста или структуры, но такой ответ нельзя автоматически считать новым searchable PDF. Если конечная цель — поиск внутри файла, выбирайте PDF-OCR. Если нужно извлечь из счета номер, дату, сумму и строки таблицы в систему учета, полезнее класс Document AI.
Google Document AI, Google Cloud Vision OCR, Nanonets, Rossum, Parseur, DocuPhase, MyQ X, Tipalti, OneAI и другие корпоративные платформы ориентированы на автоматизированный поток документов. Их оценивают не по удобству кнопки «Распознать», а по качеству полей, API, обработке ошибок, правилам доступа к данным и способности встроиться в существующий процесс.
Как проверить ИИ-извлечение данных
- Возьмите 10–20 реальных документов одного типа, а не один удачный пример.
- Заранее выпишите эталонные значения: номер документа, дату, сумму, контрагента, строки таблицы.
- Сравните результат по каждому полю и отдельно посчитайте пропуски.
- Проверьте документы с плохим сканом, печатью, двумя языками и нестандартной таблицей.
- Определите, что происходит при низкой уверенности: поле должно отправляться на проверку, а не бесшумно попадать в систему с ошибкой.
Как распознать PDF на iPhone и iPad
Adobe Scan
Adobe Scan совмещает камеру, коррекцию границ и OCR. После съемки документ сохраняется как PDF с распознанным текстом, поэтому по нему можно искать слова. Метод особенно удобен, когда бумажный документ еще не переведен в PDF.
- Снимите документ камерой.
- Проверьте автоматические границы страницы и ориентацию.
- Исправьте перспективу и очистите тени, если они мешают чтению.
- Сохраните скан в PDF.
- Откройте готовый файл и проверьте поиск по характерному слову.
Плюсы:
- сканирование, коррекция изображения и OCR объединены в одном мобильном процессе
- подходит для документов, снятых камерой
- создает PDF с распознаваемым текстом
Минусы:
- для большого архива на компьютере проще организовать пакетный OCR
- таблицы и мелкий текст после съемки требуют особенно тщательной сверки
iScanner

iScanner доступен на iOS и Android. В приложении можно снять документ, исправить геометрию страницы, выполнить OCR и работать с полученным текстом. Это удобно для чеков, договоров, учебных листов и других документов, которые изначально находятся на бумаге.
- Снимите страницу или импортируйте изображение.
- Проверьте рамку, перспективу и ориентацию.
- Откройте OCR и выполните распознавание.
- Исправьте очевидные ошибки.
- Сохраните или экспортируйте результат в нужном формате.
Плюсы:
- OCR встроен в мобильный сканер
- есть коррекция перспективы и подготовка изображения
- подходит для последовательного сканирования нескольких страниц
Минусы:
- часть функций относится к подписке
- для большого многостраничного архива настольная пакетная обработка удобнее
ABBYY FineReader PDF for iOS
Мобильный FineReader для iOS сканирует документы и книги, распознает текст и позволяет экспортировать результат в редактируемые форматы. Android-версия FineReader PDF Mobile прекращена, поэтому этот способ относится именно к устройствам Apple.
- Снимите страницу или импортируйте документ.
- Проверьте границы и ориентацию.
- Запустите OCR.
- Сверьте распознанные числа и имена.
- Экспортируйте текст или PDF в нужном формате.
Плюсы:
- ориентирован на документы и книги
- есть экспорт распознанного текста
- удобен для мобильной оцифровки нескольких страниц
Минусы:
- актуальный мобильный продукт относится к iOS
- сложную верстку и большие проекты удобнее корректировать на компьютере
Xodo PDF Reader

Xodo PDF Reader развивает OCR как часть мобильной работы с PDF. На iOS OCR можно запускать непосредственно в просмотрщике для отсканированных страниц; на Android OCR используется и при добавлении сканированных страниц. Поэтому Xodo подходит пользователям, которым нужен PDF-редактор на телефоне, а не отдельное приложение только для распознавания.
После OCR обязательно проверьте, что текст действительно выделяется на обработанной странице. Если задача — получить точный DOCX с таблицами, мобильный PDF-редактор уступает специализированному настольному OCR-пакету.
Apple Notes и Photos: одна страница через Live Text

Live Text подходит для текста на фотографии или изображении страницы: слова можно выделить и скопировать. Это быстрый способ для чека, объявления, одной страницы учебника или скриншота, но не пакетный OCR многостраничного PDF. Для книги или договора лучше использовать инструмент, который создает поисковый слой сразу во всем файле.
Как распознать текст на Android
CamScanner

CamScanner сочетает съемку документа, коррекцию кадра, создание PDF и OCR. После съемки страницу можно выровнять, очистить и распознать. Это практично, когда документ поступает в работу через камеру телефона.
- Снимите страницу или импортируйте изображение.
- Исправьте границы и перспективу.
- Примените улучшение изображения, если фон серый или на странице есть тени.
- Запустите OCR.
- Сохраните результат и сверяйте числа, даты и реквизиты с фотографией.
Плюсы:
- камера, многостраничное сканирование и OCR находятся в одном приложении
- подходит для быстрого создания PDF с телефона
- есть подготовка изображения до распознавания
Минусы:
- часть возможностей зависит от тарифа
- автоматическая мобильная обработка не отменяет проверку таблиц и реквизитов
Text Fairy
Text Fairy — Android-инструмент для OCR изображений. Он подходит, когда требуется распознать фотографию или заранее сохраненную страницу PDF. Приложение позволяет выбрать язык, обрезать область и получить редактируемый текст; для многостраничного PDF это менее прямой путь, чем специальный PDF-OCR.

- Импортируйте изображение или сделайте снимок.
- Обрежьте область с текстом и выровняйте страницу.
- Выберите язык.
- Запустите OCR.
- Исправьте распознанный текст и скопируйте или экспортируйте результат.
Плюсы:
- подходит для быстрого OCR одной страницы на Android
- можно работать с выбранной областью изображения
- результат сразу доступен как обычный текст
Минусы:
- ориентирован прежде всего на изображения, а не на полноценный PDF-workflow
- для таблиц и книги из десятков страниц удобнее другое решение
Text Scanner: Image to Text OCR

В Google Play есть несколько приложений с похожими названиями Text Scanner. Этот класс приложений предназначен прежде всего для схемы «камера или изображение → текст». Если PDF не поддерживается напрямую, сначала экспортируйте только нужную страницу в PNG или JPEG, затем распознавайте ее. Для целой книги такой процесс слишком ручной.
Плюсы:
- минимальная схема для короткого фрагмента
- удобно скопировать распознанный текст в мессенджер или заметки
Минусы:
- одноименные приложения нужно различать по разработчику
- не предназначен для построения поискового слоя в большом PDF
Google Lens
Google Lens удобен для текста на фотографии или скриншоте. После анализа изображения можно выделить распознанный текст и скопировать его. Для одной страницы PDF достаточно сделать снимок или экспортировать страницу в изображение. Для многостраничного searchable PDF используйте специализированный OCR, потому что Lens не заменяет построение текстового слоя во всем файле.
Как распознать PDF в Linux
Tesseract OCR
Tesseract — OCR-движок командной строки. Он принимает изображения и умеет выводить обычный текст, hOCR, TSV и searchable PDF. Для одного изображения страницы базовая команда выглядит так:
tesseract page.png result -l rusДля создания PDF с поисковым слоем:
tesseract page.png searchable -l rus pdfTesseract не является полноценным редактором многостраничных PDF. Если на входе уже есть PDF, проще использовать оболочку, которая сама разобьет страницы и соберет результат, либо OCRmyPDF.
Плюсы:
- open-source OCR-движок
- удобен для скриптов и серверной обработки
- может создавать searchable PDF из изображений
Минусы:
- нет собственного полноценного GUI
- многостраничный PDF требует дополнительного рабочего процесса
OCRmyPDF
OCRmyPDF предназначен именно для существующих сканированных PDF. Он добавляет поисковый текстовый слой, сохраняя страницы в PDF, и хорошо подходит для пакетной обработки из командной строки.
ocrmypdf -l rus input.pdf output.pdfДля русско-английского документа устанавливают обе языковые модели и указывают соответствующие языки. После обработки откройте output.pdf и проверьте поиск по словам на разных страницах. Инструмент запускают только на доверенных PDF: обработчик документов не является средством обезвреживания вредоносных файлов.
Плюсы:
- работает непосредственно с PDF
- удобен для автоматизации большого числа файлов
- сохраняет привычный формат документа и добавляет searchable-слой
Минусы:
- командная строка требует первоначальной настройки
- для ручной корректировки зон нужен графический редактор
gImageReader
gImageReader — графическая оболочка для Tesseract. Она импортирует PDF и изображения, позволяет вручную или автоматически задавать области распознавания и показывает результат рядом со страницей. Это удобный вариант для пользователя, которому нужен контроль зон, но не хочется работать только через терминал.

- Импортируйте PDF или изображение.
- Выберите язык Tesseract.
- Автоматически определите области или нарисуйте их вручную.
- Запустите распознавание.
- Исправьте текст в правой панели.
- Сохраните обычный текст или hOCR/PDF в зависимости от выбранного режима.
Плюсы:
- дает графический интерфейс для Tesseract
- можно работать с PDF и отдельными областями
- видны изображение страницы и распознанный результат
Минусы:
- языковые модели Tesseract нужно настроить отдельно
- пакетный документооборот менее автоматизирован, чем в OCRmyPDF
PaddleOCR
PaddleOCR — open-source стек для разработчиков, которым нужны модели распознавания, детекция текста и собственный программный pipeline. Для одной домашней страницы это более сложный путь, чем gImageReader или OCRmyPDF. Его выбирают, когда OCR нужно встроить в приложение, обрабатывать изображения программно или экспериментировать с моделями, а не когда нужна одна кнопка «сделать PDF поисковым».
Как распознавать таблицы, колонки и формы
Сложная верстка — главная причина, по которой «все слова распознаны» еще не означает «документ распознан правильно». В двух колонках важен порядок чтения, в таблице — связь числа с ячейкой, а в форме — принадлежность значения конкретному полю.
Две и более колонки
На тестовой странице скопируйте весь распознанный текст в простой редактор. Если после последней строки левой колонки идет первая строка правой — порядок корректный. Если строки чередуются, используйте OCR-редактор с областями и разметьте колонки отдельно. Автоматическое повторное распознавание без изменения областей обычно повторит ту же ошибку.
Таблицы
Проверьте не только заголовки. Сверьте первую, среднюю и последнюю строку, а также столбец с числами. Особенно опасны десятичные разделители, минусы, проценты, даты и нули. Для дальнейших расчетов экспортируйте таблицу в XLSX и сравните критичные ячейки с изображением. Нельзя считать результат надежным только потому, что таблица визуально похожа на оригинал.
Анкеты, счета и формы
В форме OCR должен сохранить связь «подпись поля → значение». Если задача повторяется на сотнях однотипных документов, обычный PDF-OCR перестает быть оптимальным: лучше использовать систему извлечения полей, которая возвращает структурированные значения и уровень уверенности. Для единичной формы ручная проверка быстрее и прозрачнее.
Вертикальный текст и подписи
Вертикальные заголовки таблиц, подписи к рисункам и текст в повернутых штампах часто требуют отдельной области с собственной ориентацией. Если редактор позволяет распознавать только выделенный фрагмент, поверните или выделите его отдельно, а не меняйте ориентацию всей страницы.
Как распознавать двуязычные и многоязычные PDF
На странице с русским и английским один и тот же символ может выглядеть одинаково, но принадлежать разным алфавитам. Особенно легко перепутать латинские C, B, H, P и похожие кириллические буквы, а также цифру 0 и букву O. Поэтому язык нельзя выбирать «на глаз» после OCR — его задают до распознавания, если программа предоставляет такой параметр.
- Определите все языки, которые реально встречаются на тестовой странице.
- Включите только эти языки: лишние модели расширяют набор возможных символов и могут увеличить число неоднозначностей.
- После OCR найдите по одному характерному слову каждого языка.
- Скопируйте строку со смешанной кириллицей, латиницей и цифрами в простой редактор.
- Для терминов, фамилий и кодов выполните посимвольную сверку.
Если документ чередует языки по страницам, при пакетной обработке полезнее разделить диапазоны и запускать OCR с отдельными наборами языков. Например, русские приложения к договору распознавать с русским, а англоязычные спецификации — с английским. Это дает более предсказуемый результат, чем включение большого списка языков для всей книги.
Как организовать пакетное распознавание десятков и сотен PDF
Для одного файла главный критерий — удобство интерфейса. Для сотен файлов важнее повторяемость, журнал ошибок и возможность повторно обработать только проблемные документы. Ручной браузерный сервис плохо масштабируется: каждую загрузку и сохранение приходится контролировать отдельно.
- Соберите тестовый набор. Включите хорошие и плохие сканы, таблицы, страницы с печатями и разные языки.
- Определите единый результат. Например, searchable PDF для архива или DOCX для дальнейшего редактирования.
- Настройте именование. Результат не должен перезаписывать оригинал до проверки. Для командной обработки используйте отдельную выходную папку.
- Проверьте 10–20 файлов. Если ошибка повторяется в одном типе документа, исправьте параметры до запуска всей очереди.
- Сохраняйте отчет об исключениях. Файлы с ошибками, паролем, поврежденными страницами или отсутствующим языком должны попадать в отдельную очередь.
- Проводите выборочный контроль. После массового OCR откройте случайные файлы из начала, середины и конца партии.
Для локальной пакетной работы подходят OCRmyPDF, Tesseract в скриптах и настольные программы с batch-функциями. Для корпоративной интеграции используют OCR API или Document AI. Главное отличие от ручного процесса — ошибка не должна проходить незамеченной: система должна либо пометить сомнительный результат, либо отправить документ на ручную проверку.
Когда повторный OCR вреден
Если часть PDF уже содержит хороший текстовый слой, бездумно прогонять весь архив заново не нужно. Второй слой может ухудшить поиск, создать дублирование текста или усложнить редактирование. Перед массовой обработкой проверьте смешанные документы и выберите режим, который пропускает страницы с уже существующим текстом либо обрабатывает только заданный диапазон.
Рукописный текст: отдельная задача
Классический OCR печатного шрифта и распознавание рукописи — разные задачи. Инструменты ввода рукописи стилусом тоже нельзя автоматически считать OCR для фотографии тетради. Google Handwriting Input, MyScript и Microsoft Ink Recognizer создавались прежде всего вокруг рукописного ввода и цифровых чернил; Google Keep умеет извлекать текст из изображений, но результат на рукописи зависит от почерка.
Для рукописной страницы используйте сервис или модель, где handwriting recognition заявлен именно для изображения документа. Затем выполняйте построчную вычитку. Фамилии, даты, суммы и сокращения проверяют полностью: контекстная модель может «исправить» необычное имя на более распространенное слово, и такая ошибка выглядит правдоподобно.
Минимальный тест рукописи
Возьмите одну страницу с обычными словами, собственными именами, числами и двумя-тремя исправлениями от руки. Сравните результат по каждой категории. Если инструмент хорошо распознает общие слова, но регулярно ошибается в фамилиях и цифрах, его нельзя использовать для переноса ответственных данных без полной ручной сверки.
Устаревшие способы и продукты, которые не стоит ставить в начало инструкции
Несколько популярных ранее OCR-продуктов уже прекращены. Они могут сохраняться в старых установках, но новый рабочий процесс лучше строить на действующих инструментах.
- Microsoft Lens / Office Lens. Приложение выведено из эксплуатации в 2026 году; его не следует выбирать для нового OCR-процесса.
- ABBYY FineReader Online. Отдельный старый веб-сервис закрыт. Его не нужно путать с действующим настольным FineReader PDF.
- TextGrabber. Мобильный продукт прекращен.
- FineReader PDF Mobile for Android. Android-продукт прекращен; мобильный FineReader продолжает существовать на iOS.
- FreeOCR и Freemore OCR. Эти старые Windows-программы уступают активным инструментам по удобству нового рабочего процесса и совместимости с современными форматами PDF.
- ABBYY Screenshot Reader. Узкий сценарий OCR участка экрана сегодня проще закрыть Snipping Tool с Text actions в Windows 11.
Статус программы важнее старого рейтинга или номера версии. Если продукт больше не развивается, не стоит строить на нем регулярный процесс только потому, что его инструкция сохранилась в интернете.
Как проверить качество распознавания
Сообщение «OCR завершен» означает только окончание обработки. Правильность текста нужно проверять отдельно. Для бытового документа достаточно системной выборочной сверки; для исследования, юридически значимых данных или большого архива нужен более строгий контроль.
- Поиск. Найдите 3–5 слов: короткое, длинное, слово с «ё», фамилию и число.
- Копирование. Скопируйте абзац из середины страницы в простой редактор и сравните с изображением.
- Похожие символы. Проверьте 0/O, 1/l/I и пары похожих кириллических и латинских букв.
- Числа. Сверьте даты, суммы, номера документов, артикулы и телефоны символ в символ.
- Колонки. Убедитесь, что текст читается в правильном порядке и строки не прыгают между колонками.
- Таблицы. Сверьте минимум первую, среднюю и последнюю строку и все критичные числовые столбцы.
- Языки. На двуязычной странице проверьте слова из обоих алфавитов.
- Поисковый слой. Выделение мышью должно совпадать с видимой строкой, а не попадать на соседний абзац.
Проверка большого корпуса
Для тысяч страниц полезно заранее подготовить вручную вычитанный эталонный фрагмент и сравнивать с ним разные настройки OCR. На техническом уровне используют character error rate, расстояние Левенштейна и подсчет замен, вставок и пропусков. Эти метрики нужны не для красивой цифры, а для выбора настроек: например, сравнить два набора языков или определить, помогла ли очистка фона.
Даже хорошая средняя точность не гарантирует правильность реквизитов. Одна ошибка в сумме, номере счета или фамилии может быть важнее десяти опечаток в обычном абзаце, поэтому контроль строят по цене ошибки, а не только по проценту распознанных символов.
Почему OCR распознает PDF неправильно
| Проблема | Как проявляется | Что исправить |
|---|---|---|
| Низкое разрешение | Сливаются тонкие буквы и знаки | Повторно отсканировать или переснять страницу |
| Перекос | Строки распадаются, символы смещаются | Использовать deskew / выравнивание |
| Тени и серый фон | Появляются лишние символы | Очистить фон и повысить контраст |
| Неверный язык | Кириллица превращается в похожую латиницу | Выбрать правильный язык или нужную пару языков |
| Две колонки | Строки перемешиваются | Разметить колонки отдельными областями |
| Таблица | Числа переезжают в соседний столбец | Использовать табличные зоны и сверить экспорт |
| Печать поверх текста | Часть букв закрыта | Сверить перекрытые места вручную |
| Рукопись | Слова искажаются, модель заменяет их похожими | Использовать handwriting-модель и полную вычитку |
| Старый плохой OCR-слой | Поиск находит неверные слова или дубли | Удалить или заменить старый слой подходящим режимом |
После OCR текст есть, но выделение смещено
Это означает, что координаты текстового слоя плохо совпали с изображением. Ошибка особенно заметна после сильного исправления перспективы или неправильного масштаба. Для архива такой файл нужно переделать: формальный «поиск работает» недостаточен, если пользователь не может нормально выделить нужное слово.
После OCR исчезла верстка
Причина обычно в выборе экспорта в редактируемый документ вместо searchable PDF. Если внешний вид страницы критичен, используйте режим «изображение + невидимый текстовый слой». DOCX выбирайте только тогда, когда дальнейшее редактирование важнее точного визуального совпадения.
Конфиденциальность: когда онлайн-OCR лучше не использовать
Распознавание PDF может затрагивать персональные данные, договоры, медицинскую информацию, финансовые реквизиты и внутренние документы организации. Онлайн-сервис технически требует передать файл сторонней системе, поэтому перед загрузкой убедитесь, что правила владельца данных и рабочая политика разрешают такую передачу.
- Личные документы. Для паспорта, удостоверения и документов с адресом безопаснее локальная обработка, если нет конкретной причины использовать облако.
- Рабочие файлы. Внутренний договор или отчет может подпадать под правила компании. Удобство веб-формы не отменяет требования по хранению данных.
- Массовый OCR. Для сотен документов важно понимать, где файлы временно хранятся, кто имеет доступ и как удаляются после обработки.
- API. При интеграции в приложение отдельно настраивают учетные данные, журналы, права доступа и срок хранения результатов.
Локальная обработка не означает автоматическую безопасность: компьютер тоже нужно защищать, а временные файлы — хранить в подходящей папке. Но она дает больше контроля над тем, куда именно попадает PDF. Для конфиденциального архива это часто важнее удобства браузерного интерфейса.
Локальная программа или онлайн-OCR: что выбрать
| Сценарий | Практичный вариант | Почему |
|---|---|---|
| Один несекретный скан | PDF24, OnlineOCR.net, Google Drive | Не требуется установка |
| Договор или закрытый отчет | PDF Commander, FineReader, Acrobat, Master PDF Editor | Файл можно обработать локально |
| Нужно редактировать распознанный текст | FineReader, PDFelement, Acrobat, Nitro | Есть редактируемый результат и PDF-инструменты |
| Сложная таблица | FineReader, PDFelement или Document AI | Нужна работа со структурой, а не только символами |
| Одна строка на экране | Snipping Tool Text actions | Минимум действий |
| Бумажный документ на телефоне | Adobe Scan, iScanner, CamScanner | Камера, коррекция и OCR в одном процессе |
| macOS без тяжелого PDF-пакета | NAPS2 или Prizmo | Есть OCR и создание поискового PDF |
| Linux и автоматизация | OCRmyPDF, Tesseract, gImageReader | Есть CLI и GUI open-source варианты |
| Сотни однотипных форм | OCR API / Document AI | Нужны поля, координаты и автоматическая интеграция |
Не выбирайте программу только по количеству функций. Для одного скана важнее короткий путь и понятный результат; для большого архива — пакетность и предсказуемость; для таблиц — корректная структура; для конфиденциальных документов — контроль над передачей данных.
Частые вопросы
Почему в PDF не выделяется текст?
Страница может быть сохранена как изображение. Проверьте несколько страниц: если курсор не выделяет отдельные символы, нужен OCR. Если текст выделяется, но копирование запрещено, проблема связана с правами доступа, а не с отсутствием текстового слоя.
Можно ли распознать только одну страницу?
Да. PDF Commander, Acrobat, PDF-XChange Editor и другие полноценные OCR-редакторы позволяют ограничить диапазон. Такой тест полезно делать перед обработкой большого документа.
Как сохранить внешний вид скана?
Выбирайте searchable PDF или режим невидимого текстового слоя. Изображение страницы остается визуальной основой, а распознанные символы используются для поиска и копирования.
Что лучше — DOCX или searchable PDF?
DOCX выбирают для редактирования содержания. Searchable PDF — когда важен внешний вид оригинальной страницы и возможность поиска. Для архива второй вариант обычно предсказуемее.
Можно ли распознать таблицу?
Да, но таблица требует отдельного контроля. Сверьте границы столбцов, числа и объединенные ячейки. Если данные пойдут в расчеты, экспортируйте их в XLSX и проверьте все критичные значения.
Что делать с русским и английским на одной странице?
Включите оба языка, если OCR поддерживает многозначный выбор. После обработки отдельно проверьте похожие кириллические и латинские символы, а также сокращения и коды.
Почему после OCR PDF стал больше?
К изображению страниц добавляется текстовый слой; некоторые редакторы одновременно пересохраняют изображения и встраивают дополнительные данные. Сравнивайте не только размер, но и качество страницы, возможность поиска и совместимость с нужным просмотрщиком.
Можно ли не загружать документ в облако?
Да. Для локальной работы подходят PDF Commander, FineReader, Acrobat, Master PDF Editor, NAPS2, Tesseract, OCRmyPDF и другие настольные инструменты. На телефоне режим хранения зависит от конкретного приложения, поэтому конфиденциальные документы лучше обрабатывать в соответствии с правилами организации.
Как распознать сотни файлов?
Используйте пакетный OCR или автоматизацию. OCRmyPDF и Tesseract удобны для скриптов; настольные OCR-пакеты предлагают batch-сценарии; для корпоративного потока используют OCR API. Перед массовым запуском обязательно тестируют небольшую выборку.
Как понять, что OCR закончен успешно?
Откройте готовый файл, найдите поиском несколько слов, скопируйте абзац и сверяйте числа. Для таблицы проверьте строки и столбцы. Сам факт завершения операции не подтверждает правильность текста.
Можно ли распознавать рукопись тем же инструментом?
Не всегда. Большинство классических OCR-движков оптимизировано для печатного текста. Для рукописной страницы нужна модель, которая прямо поддерживает handwriting recognition, и более строгая ручная проверка.
Нужно ли повторять OCR после поворота страницы?
Если текстовый слой был создан до изменения геометрии и после поворота выделение перестало совпадать с видимыми строками, проверьте совпадение слоя с видимыми строками и повторите OCR при обнаруженном смещении. Если редактор корректно повернул и изображение, и слой, повторная обработка не требуется.
Что выбрать в итоге
Для Windows и работы непосредственно с PDF первым способом используйте PDF Commander: он позволяет открыть скан, выбрать страницы и язык, извлечь текст или добавить невидимый поисковый слой. Для сложной ручной коррекции зон и таблиц удобнее ABBYY FineReader PDF. Если PDF уже редактируется в экосистеме Acrobat, OCR логично выполнять в Adobe Acrobat Pro. Для отдельной строки в Windows 11 быстрее Snipping Tool с Text actions.
На macOS практичны NAPS2 и Prizmo. Для разового несекретного файла в браузере подходят Google Drive, PDF24, OnlineOCR.net или OCR.Space. На телефоне лучше сразу сканировать документ через Adobe Scan, iScanner или CamScanner, чем сначала делать необработанное фото и затем отдельно исправлять геометрию. В Linux для существующего PDF удобен OCRmyPDF, для изображений и скриптов — Tesseract, а для графического интерфейса — gImageReader.
Независимо от программы, финальный критерий один: слова должны находиться поиском и копироваться в правильном порядке, а числа, фамилии, таблицы и смешанные языки — совпадать с изображением страницы. Если цена ошибки высока, OCR рассматривают как этап ввода данных, а не как замену проверке.
Другие программы этой категории доступны в разделе OCR и распознавание текста на FreeEXE.