Отсканированный документ нельзя редактировать одним универсальным способом: сначала нужно понять, что именно хранится в файле. Если страница представляет собой цельное изображение, буквы на ней являются пикселями, поэтому обычный текстовый редактор не сможет поставить курсор между словами. Для полноценного изменения текста понадобится OCR — оптическое распознавание символов. Если PDF уже содержит текстовый слой, можно сразу использовать PDF-редактор. А когда требуется лишь закрыть старый номер, убрать пятно, выровнять страницу или заменить небольшой фрагмент внешне, быстрее работать со сканом как с изображением. Ниже эти сценарии разделены, чтобы не выполнять лишнюю конвертацию и не разрушать макет.
Первый практический способ показан через PDF Commander: он подходит для локальной работы с PDF и позволяет распознать текст отсканированных страниц. Далее разобраны OCR-редакторы, Word, браузерные сервисы, встроенные средства Apple, мобильные приложения и Linux-инструменты. Для каждого метода указано, что он действительно меняет: исходный текст, только текстовый слой, визуальное изображение страницы либо извлечённый текст в новом документе.
Сначала определите, что именно нужно изменить в скане
Фраза «отредактировать скан» объединяет несколько разных задач. Самая частая ошибка — открыть фотографию страницы в Word или PDF-просмотрщике и ожидать, что буквы сразу станут редактируемыми. Сканер фиксирует внешний вид листа, а не структуру документа. Поэтому правильный маршрут начинается не с выбора программы, а с определения типа исходника и желаемого результата.
Сценарий 1. Нужно изменить слова, числа или абзацы
Для такого сценария требуется распознавание текста. OCR анализирует изображение страницы и создаёт текстовые данные. Дальше возможны два варианта: редактор сохраняет текстовый слой внутри PDF либо экспортирует результат в DOCX, TXT или другой редактируемый формат. Первый вариант полезнее, когда важно сохранить расположение элементов на странице; второй — когда документ нужно серьёзно переписать, переформатировать или продолжить редактировать в Word.
Проверить наличие текстового слоя можно без специальных инструментов. Откройте PDF, попробуйте выделить отдельное слово мышью и скопировать его. Затем используйте поиск по заведомо существующему слову. Если выделяется только вся страница как картинка и поиск ничего не находит, перед редактированием потребуется OCR.
Сценарий 2. Нужно убрать пятно, исправить фон или закрыть фрагмент
OCR здесь не обязателен. Изображение страницы можно обработать в графическом редакторе: обрезать поля, исправить наклон, повысить контраст, скрыть небольшой участок фоном, дорисовать линию или вставить новый элемент. Такой способ не превращает напечатанные буквы в настоящий текст. Он меняет только внешний вид страницы, поэтому поиск, копирование и последующее редактирование исходных слов по-прежнему невозможны.
Сценарий 3. Нужно получить документ Word из скана
Оптимальная цепочка выглядит так: качественный скан → OCR → проверка ошибок распознавания → экспорт в DOCX → финальная правка в Word. Пропуск этапа проверки особенно заметен в таблицах, колонках, документах с мелким шрифтом, печатями, рукописными пометками и низким контрастом. Даже хороший OCR не освобождает от сверки фамилий, номеров, дат и сумм с оригиналом.
Сценарий 4. PDF уже распознан, но макет сложный
Если текст выделяется, предпочтительнее сначала попробовать PDF-редактор, а не конвертацию в Word. Прямое редактирование внутри PDF обычно меньше затрагивает положение изображений, подписи, поля и разбиение на страницы. Word при открытии PDF создаёт конвертированную копию и пытается восстановить структуру документа; результат особенно хорошо подходит для преимущественно текстовых страниц, но сложная верстка может измениться.
Как подготовить скан перед OCR
Качество распознавания определяется не только программой. OCR получает на вход изображение, поэтому перекос, тень от корешка, размытость, слишком маленькие буквы и неправильный язык распознавания напрямую увеличивают число ошибок. Подготовка особенно важна для многостраничных документов: одна плохо отсканированная страница может дать десятки незаметных ошибок в именах и числах.
- Сохраните исходник отдельно. Не перезаписывайте единственную копию скана. Рабочую обработку ведите на дубликате, чтобы можно было вернуться к оригинальной странице.
- Поверните страницу правильно. Текст должен идти горизонтально. Автоповорот помогает, но страницу с таблицами, штампами и несколькими ориентациями лучше проверить вручную.
- Уберите лишние поля. Большие тёмные края, соседняя страница книги, пальцы и фон стола мешают анализу макета. Обрезка также уменьшает объём лишних пикселей.
- Исправьте перекос. Даже небольшой наклон строк ухудшает сегментацию. Для книжных разворотов дополнительно важна деформация возле корешка.
- Не увеличивайте изображение простым растягиванием. Интерполяция делает файл крупнее, но не возвращает деталей, которых не было в исходном скане.
- Выберите язык OCR. Для русского документа должен быть включён русский язык; для двуязычного — оба реально присутствующих языка. Неверный набор языков повышает число замен похожих символов.
- Проверьте порядок страниц. До распознавания проще переставить перевёрнутые или перепутанные страницы, чем исправлять уже экспортированный DOCX.
Для чёрно-белых деловых документов обычно полезнее читаемые контуры букв, чем «красивое» изображение. Не следует чрезмерно повышать резкость и контраст: тонкие штрихи могут исчезнуть, а точки и шум — превратиться в ложные символы. Оценивать обработку нужно на масштабе, при котором видны мелкие буквы и знаки препинания.
Какой способ выбрать: краткое сравнение
| Способ | Что меняет | OCR | Где работает | Когда выбирать |
|---|---|---|---|---|
| PDF Commander | Распознаёт scanned PDF, позволяет работать с текстом и визуальными элементами PDF | Есть | Windows | Нужно локально исправить PDF и не загружать документ в браузерный сервис |
| ABBYY FineReader | Распознаёт страницы, проверяет OCR, редактирует PDF и экспортирует в офисные форматы | Есть | Настольная программа | Сложный макет, таблицы, многостраничный документ, требуется контроль OCR |
| Adobe Acrobat Pro | После OCR позволяет менять текст непосредственно в scanned PDF | Есть | Windows, macOS | Нужно сохранить PDF как основной рабочий формат |
| Microsoft Word | Редактирует конвертированную копию PDF или уже распознанный текст | Не основной OCR для image-only скана | Windows, macOS, web | Нужно серьёзно переписать текст после распознавания |
| Google Drive + Google Docs | Извлекает текст из загруженного изображения или PDF в документ Google Docs | Есть | Браузер | Разовая задача без установки, макет не критичен |
| Apple Notes | На iPhone вставляет распознанный текст; на Mac позволяет визуально управлять сканом | Есть для извлечения текста на iPhone | iPhone, macOS | Нужно быстро получить текст или поправить ориентацию/кадрирование скана |
| WPS Office | Сканирует и распознаёт текст на мобильном устройстве | Есть | Android и другие поддерживаемые платформы | Нужно выполнить OCR с телефона и получить редактируемый результат |
| OCRmyPDF | Добавляет поисковый текстовый слой в существующий PDF | Есть | Linux и другие системы с Python/CLI | Нужно сделать архив scanned PDF searchable до дальнейшего редактирования |
| GIMP | Меняет пиксели страницы: фон, кадрирование, дефекты, визуальные фрагменты | Нет | Windows, macOS, Linux | Текст менять не нужно либо скан сначала надо очистить |
Не стоит сравнивать эти варианты только по числу функций. PDF-редактор, OCR-конвертер и графический редактор решают разные части задачи. Если нужно исправить одну цифру в сохранённом макете, конвертация всего файла в DOCX может создать больше работы, чем прямая правка PDF. Если предстоит переписать несколько страниц, наоборот, удобнее один раз распознать документ и перенести его в текстовый редактор.
Windows: редактирование скана на компьютере
PDF Commander — основной способ для scanned PDF
PDF Commander подходит, когда исходник уже находится в PDF и требуется распознать текст локально. В программе OCR отделён от визуальной маскировки фрагментов: это важно, потому что скрыть старое слово белым прямоугольником и действительно получить распознанный текст — не одно и то же.
Шаг 1. Откройте отсканированный PDF
Запустите программу и загрузите PDF со сканированными страницами. До распознавания попробуйте выделить слово. Если страница ведёт себя как цельная картинка, переходите к OCR.

Шаг 2. Откройте распознавание текста
Перейдите в раздел «Распознавание» и выберите «Распознать текст». В диалоге задайте область обработки: текущая страница, все страницы или конкретный диапазон. Для чистого печатного документа можно использовать быстрый модуль распознавания. Если нужно сохранить searchable PDF, выбирайте вариант с добавлением невидимого текстового слоя; когда текст требуется получить отдельно, используйте извлечение текста.

Шаг 3. Укажите язык и запустите OCR
Выберите язык документа, затем нажмите «Распознать». Для смешанного материала не добавляйте языки «на всякий случай»: OCR должен анализировать реальный набор символов страницы. После завершения проверьте несколько сложных участков — фамилии, номера документов, дроби, даты и строки мелким шрифтом.

Шаг 4. Исправьте содержимое или внешний вид
После OCR работайте с содержимым документа. Если задача не требует настоящего изменения текста, а нужно только визуально убрать старый фрагмент, используйте инструменты редактора для скрытия области и добавления нового текста. Такой приём годится для макета или неофициальной копии, но его нельзя путать с исправлением текстового слоя: старые данные могут сохраняться в OCR-слое и находиться поиском. Для документа, который будут индексировать, копировать или передавать в электронный архив, после визуальной правки обязательно выполните поиск по старой фразе.
Шаг 5. Сохраните отдельную копию
Сохраняйте результат под новым именем. Затем закройте файл, откройте его повторно и проверьте три вещи: изменённый фрагмент отображается правильно, нужное слово находится поиском, а старое — не находится там, где его не должно быть. Для многостраничного документа дополнительно просмотрите первую и последнюю страницы диапазона OCR, чтобы исключить ошибку выбора страниц.
Плюсы:
- OCR выполняется локально на компьютере, поэтому скан не требуется загружать в браузерный сервис;
- можно распознать текущую страницу, весь документ или выбранный диапазон;
- есть разные цели OCR: извлечение текста и добавление невидимого текстового слоя;
- в том же приложении доступны визуальные правки PDF, поэтому для небольшого исправления не нужен отдельный графический редактор.
Минусы:
- OCR не отменяет ручную проверку распознанных чисел, имён и сложной верстки;
- визуальное закрытие фрагмента и изменение распознанного текста — разные операции, их легко спутать;
- для последующего масштабного переписывания большого текста удобнее экспортировать распознанное содержимое в текстовый редактор.
ABBYY FineReader : OCR с проверкой областей и экспортом
ABBYY FineReader полезен для документов, где простого автоматического OCR недостаточно: таблиц, колонок, многостраничных договоров, инструкций и сканов с неоднородной версткой. В программе есть PDF Editor для работы с PDF и отдельный OCR Editor, где можно контролировать области распознавания и результат.

Как выполнить OCR и правку в ABBYY FineReader
- Откройте scanned PDF. Если требуется точная обработка структуры, передайте страницы в OCR Editor.
- Проверьте, правильно ли программа определила области: обычный текст, таблицу, изображение. Ошибочная сегментация часто сильнее портит итог, чем отдельная ошибка буквы.
- Исправьте геометрию изображения: поворот, перекос и заметные дефекты страницы до финального распознавания.
- Запустите распознавание документа. Для спорных страниц используйте режим с проверкой результата, а не слепой пакетный экспорт.
- Сверьте подозрительные места с исходным изображением. После этого редактируйте PDF напрямую или экспортируйте в Word, если нужен свободный текстовый документ.

Когда этот способ особенно полезен
FineReader стоит выбирать, когда цена ошибки выше, чем цена нескольких дополнительных минут проверки. Например, при распознавании таблицы с артикулами недостаточно увидеть «похожие» цифры — нужно проверить каждую критичную ячейку. То же относится к фамилиям, реквизитам, индексам, серийным номерам и формулам. Для таких материалов полезнее инструмент, где изображение страницы и распознанный результат можно сверять в одном рабочем процессе.
Плюсы:
- контроль структуры страницы и областей OCR;
- подходит для многостраничной обработки и сложной верстки;
- можно выбрать между прямой работой с PDF и экспортом в редактируемый формат;
- есть отдельный этап проверки распознанного текста.
Минусы:
- для одной короткой страницы такой процесс может быть избыточным;
- автоматическое распознавание сложной таблицы всё равно требует ручной сверки;
- расположение команд отличается между поколениями FineReader, поэтому при работе важнее ориентироваться на функции PDF Editor и OCR Editor, а не на точное место кнопки на одном снимке.
Microsoft OneNote → Word: быстро извлечь текст из изображения
OneNote удобен, когда сохранение исходного макета не является основной задачей: нужно получить текст из картинки или распечатки PDF, перенести его в Word и отредактировать уже как обычный документ. Этот маршрут не следует использовать для точного воспроизведения сложной страницы — OCR извлекает содержание, а форматирование затем приходится проверять.
Шаг 1. Добавьте изображение или распечатку
Создайте страницу OneNote и вставьте изображение со сканом. Для PDF можно использовать вставку в виде распечатки, чтобы страницы появились в заметке как изображения.


Шаг 2. Скопируйте распознанный текст
Щёлкните изображение правой кнопкой мыши и выберите Copy Text from Picture. Для PDF-printout доступны команды копирования текста с одной страницы или со всех страниц распечатки. Если команда OCR появилась не сразу, не стоит повторно вставлять один и тот же файл: распознавание OneNote может выполняться не мгновенно.

Шаг 3. Вставьте текст в Word и проверьте
Откройте Word и вставьте содержимое из буфера обмена. Сначала исправьте ошибки OCR, затем восстанавливайте заголовки, интервалы и таблицы. Такой порядок быстрее: если сначала заново верстать страницу, а потом обнаружить неверно распознанные строки, часть оформления придётся переделывать.

Плюсы:
- не требуется отдельный OCR-конвертер для простого извлечения текста;
- можно работать с картинкой и PDF-printout;
- результат сразу переносится в обычный текстовый редактор.
Минусы:
- сложный макет исходной страницы не является главным объектом сохранения;
- распознанный текст нужно вычитывать;
- OCR-функция может быть доступна не мгновенно после добавления изображения.
Microsoft Word: когда PDF уже распознан или конвертируется приемлемо
Word умеет открывать PDF и создавать из него редактируемую копию. Это полезно для PDF, где текст уже присутствует либо структура достаточно простая для конвертации. Для чистого image-only скана Word не следует рассматривать как полноценную замену OCR: если страница остаётся одним изображением, сначала распознайте её в другом инструменте.

Порядок конвертации PDF в Word
- В Word выберите File → Open и укажите PDF.
- Подтвердите преобразование: Word создаст редактируемую копию, оригинальный PDF при этом не становится DOCX автоматически.
- Сравните первую страницу с оригиналом до массового редактирования. Проверьте таблицы, переносы, колонтитулы, подписи под рисунками и разрывы страниц.
- Исправьте текст и сохраните рабочую копию в DOCX. Если нужен PDF, экспортируйте его уже после полной проверки Word-документа.
Чем больше в исходнике текста и чем проще его структура, тем практичнее этот метод. Страницы с большим количеством графики, сносок, сложных таблиц и нестандартных колонок лучше предварительно обработать OCR-инструментом, который контролирует структуру страницы.
Плюсы:
- после конвертации доступны привычные средства редактирования текста;
- удобно для серьёзного переписывания и дальнейшего оформления документа;
- оригинальный PDF остаётся отдельным файлом.
Минусы:
- макет PDF может измениться при преобразовании;
- image-only скан сначала нуждается в OCR;
- сложные таблицы и графические страницы требуют особенно тщательной сверки.
PDFelement Pro : OCR и последующее редактирование PDF
PDFelement Pro объединяет распознавание image-based PDF и последующее изменение текста. Этот путь подходит, когда результат должен остаться PDF, а экспорт в Word нужен лишь как дополнительный вариант.

Как распознать PDF в PDFelement
- Откройте scanned PDF. Если программа определяет его как изображение, запустите OCR; в актуальном рабочем процессе распознавание также доступно через инструменты OCR Text Recognition.
- Укажите язык и страницы. Для длинного файла не обрабатывайте весь документ автоматически, если исправление нужно только на нескольких листах.
- После OCR перейдите к режиму Edit и выберите распознанный текст.
- Внесите исправления и сравните соседние строки: замена шрифта или изменение длины слова может нарушить выравнивание.
- Сохраните отдельную копию и проверьте поиском исправленную фразу.

Плюсы:
- OCR и редактирование выполняются в одном приложении;
- не требуется обязательный промежуточный DOCX для небольших правок;
- подходит для scanned PDF, который после исправления должен остаться PDF.
Минусы:
- после OCR необходимо отдельно контролировать совпадение шрифтов и строк;
- сложная верстка остаётся чувствительной к изменению длины текста;
- для простого извлечения одного абзаца такой PDF-процесс тяжелее, чем OneNote или онлайн-OCR.
Nitro PDF Pro : сделать OCR searchable и editable

Nitro PDF Pro разделяет два результата OCR. В Windows откройте PDF, перейдите на вкладку Review и нажмите OCR. В диалоге выберите Make Searchable, если нужен поиск и выделение, либо Make Searchable and Editable, если после распознавания предстоит менять текст.
Как выполнить OCR в Nitro PDF Pro
- Откройте scanned PDF и убедитесь, что исходные слова не выделяются как текст.
- Выберите Review → OCR.
- Установите Searchable and Editable, если планируете менять распознанное содержимое.
- Через Options задайте диапазон страниц; Advanced открывает дополнительные параметры OCR.
- Запустите распознавание, затем используйте инструмент редактирования существующего текста. После замены проверьте, не изменились ли межстрочные интервалы и положение соседних строк.
На macOS у Nitro PDF Pro другой путь для исправления существующего текста: выделяется текст, затем используется Correct Text. Поэтому не стоит переносить названия кнопок между Windows- и Mac-интерфейсами. Саму карточку программы оставляем в Windows-разделе, чтобы не дублировать один продукт в нескольких платформенных блоках.
Плюсы:
- явное разделение searchable и editable OCR;
- можно ограничить распознавание нужным диапазоном страниц;
- после OCR существующий текст редактируется внутри PDF.
Минусы:
- путь к командам отличается между Windows и macOS;
- OCR сложных таблиц и плохих сканов требует проверки;
- для чистого извлечения текста в новый документ полноценный PDF-редактор может быть избыточным.
PDF Agile: OCR напрямую или через PDF → Word
PDF Agile предлагает два практических маршрута. Первый — запустить OCR непосредственно для scanned PDF. Второй — открыть раздел преобразования, выбрать PDF to Word и использовать OCR-модель для конвертации изображения страницы в редактируемые символы. Выбор зависит от результата: если нужен PDF, логичнее сначала OCR; если предстоит много текстовых исправлений, удобнее DOCX.


Как обработать scanned PDF в PDF Agile
- Загрузите scanned PDF и сначала решите, нужен ли после обработки PDF или Word.
- Для OCR в самом приложении используйте команду OCR. Для DOCX откройте Convert и выберите PDF to Word с OCR.
- После распознавания не начинайте сразу форматировать весь документ: сначала проверьте текст на странице с самой сложной версткой.
- Если таблица или колонки распались, вернитесь к исходнику и попробуйте другой OCR-инструмент, а не исправляйте десятки строк вручную.
Плюсы:
- есть отдельный OCR и путь OCR → Word;
- подходит для извлечения текста из scanned PDF и изображения;
- можно выбрать результат в зависимости от дальнейшей работы.
Минусы:
- конвертация в Word может изменить сложный макет;
- результат OCR нужно вычитывать;
- после обновлений расположение элементов интерфейса может меняться, поэтому проверяйте название нужной операции — OCR или PDF to Word — перед запуском обработки.
Readiris Pro : OCR с экспортом в офисные форматы
Readiris Pro предназначен для преобразования сканов и изображений в редактируемые данные. Для этой задачи важна не только выдача обычного текста: Readiris поддерживает преобразование в Word, Excel, PowerPoint и индексируемый PDF, поэтому инструмент полезен, когда тип исходника и требуемый результат различаются.

Практический маршрут
- Добавьте scanned PDF или изображение и проверьте язык распознавания.
- Для результата в Word откройте раздел Convert и выберите Word.
- Откройте Settings. Если нужен баланс между сохранением структуры и удобством дальнейшего редактирования, выберите для Document Structure вариант Flowing.
- Примените настройки и запустите Convert.
- В итоговом DOCX сначала сверяйте текст и порядок блоков, затем таблицы, стили и разрывы страниц.
Readiris особенно полезен как конвертер между физическим документом и редактируемым офисным форматом. Это другой сценарий, чем точечная правка одной строки непосредственно в PDF: там PDF-редактор даст меньше промежуточных преобразований.
Плюсы:
- несколько типов выходного формата;
- OCR рассчитан на изображения и сканированные документы;
- поддерживается пакетный сценарий для серии файлов.
Минусы:
- при экспорте в офисный формат сложная верстка всё равно нуждается в проверке;
- для одной визуальной правки страницы OCR-конвертация не нужна;
- после извлечения текста исходный PDF и редактируемый документ становятся двумя разными версиями, которыми нужно управлять аккуратно.
CuneiForm и другие классические OCR-программы
CuneiForm выполняет OCR изображений и сканов и подходит для маршрута «распознать текст → проверить результат → перенести текст в редактор». Это не полноценный WYSIWYG-редактор scanned PDF: после распознавания основная правка выполняется в Word или другом текстовом редакторе.
Если CuneiForm уже установлен и корректно работает с нужным языком, сначала распознайте одну контрольную страницу, сравните числа, похожие символы и переносы, а затем переносите текст в редактор. Для сложного PDF, где требуется менять существующие абзацы без промежуточного DOCX, удобнее выбрать PDF-редактор с OCR.
HP Scan : когда лучше пересканировать бумажный оригинал

Если бумажный документ всё ещё доступен, не всегда разумно исправлять слабую фотографию или старый сжатый JPEG. HP Scan поддерживает сценарий сканирования в редактируемый текст с OCR. Это позволяет получить новый исходник нормального качества, а затем править распознанное содержимое.
Когда пересканирование выигрывает
- страница сфотографирована под углом, и строки имеют перспективные искажения;
- на старом изображении сильные JPEG-артефакты;
- буквы мелкие и размытые;
- часть текста закрыта тенью или плохо освещена;
- нужно обработать десятки страниц одного документа с одинаковыми настройками.
При новом сканировании сначала сделайте тестовую страницу, проверьте OCR и только затем запускайте всю пачку. Так проще обнаружить неверный язык, слишком низкое качество или неправильную область листа до обработки десятков файлов.
Предобработка в Adobe Photoshop , Paint , Paint.NET , ACDSee , XnView и ImBatch
Графические редакторы не заменяют OCR, но часто решают проблему на один этап раньше. Если программа распознавания получает кривую, тёмную или перегруженную шумом страницу, результат будет хуже независимо от качества последующего текстового редактора. Для одного скана подойдёт ручная обработка; для десятков страниц важнее пакетные операции.
| Инструмент | Практическая роль перед OCR | Когда использовать |
|---|---|---|
| Adobe Photoshop | Точная ручная коррекция, кадрирование, работа с уровнями, локальная очистка | Проблемная страница, где нужно контролировать отдельные участки |
| Microsoft Paint | Простая обрезка, поворот, визуальная замена небольшого участка | Разовая несложная задача без OCR |
| Paint.NET | Более гибкая растровая обработка и слои | Нужно изменить внешний вид скана, не переписывая текстовый слой |
| ACDSee | Просмотр и коррекция серии изображений | Сканы хранятся как отдельные изображения |
| XnView | Пакетные преобразования изображений | Нужно одинаково обработать множество страниц |
| ImBatch | Цепочки пакетной обработки | Для повторяемого процесса над папкой сканов |
Для визуальной замены текста без OCR действуйте особенно осторожно. Если вы закрыли старую строку цветом фона и поверх добавили новую, это лишь изменение изображения. В PDF может оставаться старый OCR-слой. Поэтому такой файл после сохранения нужно проверить поиском по старой и новой фразе. Если документ используется как searchable PDF, после визуального исправления текстовый слой должен соответствовать видимой странице.
macOS: правка scanned PDF и работа со сканом в Notes
Adobe Acrobat Pro : прямая правка текста после OCR
В Acrobat scanned PDF можно превратить в редактируемый непосредственно внутри PDF. Откройте файл и выберите Edit в верхнем меню. Для отсканированной страницы Acrobat автоматически применяет OCR и создаёт редактируемую копию. После этого выберите распознанный текст и внесите исправление.
Порядок прямого редактирования в Acrobat
- Откройте scanned PDF в Acrobat.
- Нажмите Edit. Дождитесь завершения автоматического OCR.
- Щёлкните текстовый фрагмент, который нужно изменить, и введите новый текст.
- Если OCR ошибся до начала правки, используйте All tools → Scan & OCR → Correct recognized text и просмотрите подозрительные места.
- На macOS сохраните результат через File → Save As, чтобы не перезаписывать оригинал.

Инструмент Correct recognized text важнее, чем кажется. Для поискового архива недостаточно визуально увидеть правильную страницу: невидимый OCR-слой может содержать другую букву или число. Проверка подозрительных слов помогает исправлять именно распознанное содержание.
Плюсы:
- OCR запускается внутри процесса редактирования scanned PDF;
- можно исправлять существующий текст, не переводя весь документ в DOCX;
- есть отдельная проверка ошибок распознавания.
Минусы:
- изменение длинной фразы может повлиять на локальную верстку;
- сложная таблица всё равно требует визуальной сверки;
- для массового переписывания нескольких страниц Word после OCR удобнее прямой правки PDF.
Apple Notes на Mac: кадрирование, поворот и фильтры — но не замена OCR-редактору
Приложение Notes на Mac подходит для управления сканом как страницей: PDF и отсканированные документы можно просматривать, обрезать, поворачивать, переименовывать и применять фильтры. Это полезно для подготовки изображения, но само по себе не превращает слова на старом скане в свободно редактируемые абзацы.
Используйте этот путь, если ошибка визуальная: страница перевёрнута, захвачены лишние края, фон выглядит плохо или требуется привести несколько сканов к единому виду. Если нужно заменить слово в содержимом, после подготовки передайте документ OCR-инструменту.
Плюсы:
- не требуется стороннее приложение для базовой визуальной подготовки;
- удобно исправлять ориентацию и кадрирование перед OCR;
- файл остаётся в привычном рабочем процессе Notes.
Минусы:
- нет полноценного механизма изменения печатного текста старого image-only скана;
- визуальная коррекция не создаёт правильный searchable-слой;
- для экспорта в Word понадобится отдельный OCR-маршрут.
Встроенное сканирование macOS: создайте более качественный исходник
Когда бумажный оригинал доступен, macOS позволяет заново получить PDF через подключённый сканер и сразу включить OCR. Это полезно не как «редактор старого файла», а как способ создать более качественный цифровой исходник до правки.
- Откройте Apple menu → System Settings → Printers & Scanners.
- Выберите подключённый принтер или сканер и нажмите Open Scanner.
- При необходимости нажмите Show Details, чтобы увидеть расширенные параметры.
- Для обычного чёрно-белого документа в Kind можно выбрать Text; для цветного оригинала используйте соответствующий тип изображения.
- Настройте Resolution, область страницы и, если требуется, Rotation Angle. Для автоподатчика доступна настройка Use Document Feeder, а двустороннее сканирование зависит от возможностей устройства.
- В поле Format выберите PDF. Для PDF macOS предоставляет OCR-опцию, которая делает распознанный текст редактируемым. Если нужно объединить несколько страниц, используйте соответствующую опцию объединения сканов.
- Нажмите Overview для предварительного просмотра, исправьте область и параметры, затем нажмите Scan.
Главный практический критерий: пересканировать страницу стоит тогда, когда на старом файле текст физически неразборчив. OCR не может восстановить буквы, которых нет в изображении; новый скан с правильной геометрией и детализацией даёт больше результата, чем многократная фильтрация плохой копии.
Онлайн: как распознать и редактировать скан без установки
Браузерные сервисы удобны для разовой задачи, но меняют модель приватности: документ загружается на чужой сервер. Для публичной инструкции, рекламного листа или учебного материала это может быть приемлемо; для паспорта, договора с персональными данными, банковских реквизитов или внутреннего документа организации лучше использовать локальный OCR, если политика обработки данных не разрешает облачную загрузку.
Google Drive + Google Docs
Google Drive позволяет открыть загруженный PDF или изображение через Google Docs и получить распознанный текст. Этот вариант особенно удобен, когда нужен именно текст, а точное сохранение исходной верстки не критично.
Как извлечь текст через Google Docs
- Загрузите PDF, JPEG, PNG или GIF в Google Drive.
- На компьютере щёлкните файл правой кнопкой мыши и выберите Open with → Google Docs.
- Google Docs создаст документ, где изображение исходной страницы сопровождается распознанным текстом.
- Исправьте OCR-ошибки и при необходимости перестройте форматирование.

Этот метод не следует выбирать для сложной таблицы, многоуровневых колонок или документа, где каждая строка должна остаться на прежнем месте. Таблицы, колонки, сноски и концевые сноски распознаются хуже обычного линейного текста. Для такого материала предпочтительнее OCR-редактор с контролем областей.
Плюсы:
- работает в браузере;
- быстро превращает простой скан в редактируемый текст;
- результат сразу доступен в Google Docs.
Минусы:
- макет сложной страницы может не сохраниться;
- файл загружается в облачный сервис;
- для точечной правки существующего PDF потребуется дополнительный инструмент.
Smallpdf : OCR → searchable text → дальнейшая правка
Smallpdf распознаёт scanned PDF и делает его текст выделяемым и доступным для дальнейшей обработки. Практически это промежуточный этап: после OCR документ можно редактировать другим PDF-инструментом либо преобразовать в Word.
Как выполнить OCR в Smallpdf
- Откройте PDF OCR и добавьте scanned PDF.
- Дождитесь распознавания: результат должен стать searchable и selectable.
- Проверьте несколько слов через поиск и попробуйте выделить строку мышью.
- Если нужно переписать большие фрагменты, продолжите через PDF to Word; для точечных правок используйте PDF-редактор.
- После экспорта отдельно проверьте таблицы, переносы и порядок колонок.

Плюсы:
- не нужна установка настольной программы;
- подходит для image-only PDF;
- результат OCR можно использовать для поиска и последующей конвертации.
Минусы:
- облачная загрузка не подходит для любого конфиденциального документа;
- OCR и полноценное редактирование — отдельные этапы;
- после преобразования в Word сложную верстку нужно проверять.
iLovePDF : сделать текст выбираемым и конвертировать дальше

iLovePDF использует OCR для PDF, в котором текст изначально не выделяется. После распознавания можно получить searchable PDF либо продолжить преобразование в редактируемый формат. При работе с документом на нескольких языках выбирайте реально присутствующие языки распознавания.
Для исправления одного слова разумнее сначала проверить, можно ли отредактировать полученный PDF напрямую. Конвертировать весь документ в Word только ради одного числа имеет смысл лишь тогда, когда PDF-редактор не справляется с исходным макетом.
Плюсы:
- OCR работает из браузера;
- удобно получить текстовый слой для скана;
- есть дальнейший маршрут к офисному формату.
Минусы:
- файл передаётся онлайн-сервису;
- часть сценариев конвертации и OCR может зависеть от условий сервиса;
- searchable PDF ещё не означает, что вся верстка свободно редактируется без последствий.
NewOCR: извлечь текст из изображения или PDF
NewOCR подходит, когда нужен распознанный текст, а не сохранение сложного PDF-макета. На стартовой странице выбирается файл, затем открывается предварительный просмотр. После этого укажите язык, при необходимости ограничьте область распознавания и запустите OCR. Результат можно скопировать либо сохранить в доступном текстовом/документном формате.
Что проверить перед экспортом
- не захвачена ли вместе с текстом соседняя колонка;
- правильно ли определён поворот страницы;
- совпадают ли цифры, дефисы и знаки препинания;
- не превратились ли строки таблицы в последовательный текст.
Для сложного PDF этот способ лучше рассматривать как извлечение содержания, а не как восстановление оригинальной верстки.
OnlineOCR: OCR с выбором языка и выходного формата
В OnlineOCR рабочая последовательность проста: выбрать файл, указать язык документа и выходной формат, затем запустить конвертацию. Сервис подходит для небольших разовых файлов, когда редактирование будет продолжено в Word или другом приложении. Для большого архива локальная пакетная обработка обычно удобнее, потому что не требует вручную загружать каждый файл.
При выборе выходного формата ориентируйтесь на содержание. Word удобен для обычного текста; Excel имеет смысл только для действительно табличного материала и всё равно требует сверки строк и столбцов; plain text подходит для извлечения содержания без сохранения верстки.
PDFescape : не используйте как замену OCR

PDFescape не следует использовать как замену OCR. Он полезен для добавления текста, аннотаций и других элементов поверх PDF, но image-only скан сначала должен получить текстовый слой в OCR-инструменте. Иначе новый текст будет лишь дополнительным объектом поверх изображения страницы.
Это пример принципиального различия между «добавить новый текст в PDF» и «изменить существующий напечатанный текст на скане». Если задача — получить настоящий searchable документ, одного наложения текстового блока недостаточно.
Online2PDF и Zamzar: конвертация после распознавания
Online2PDF и Zamzar уместно рассматривать как конвертеры в цепочке PDF → редактируемый формат. Если сервис корректно обрабатывает конкретный scanned PDF с OCR, итог можно открыть в Word и исправить. Но для документа, где сохранение геометрии страницы критично, сначала протестируйте одну сложную страницу, а не весь файл.
Критерий простой: если после конвертации таблица, подпись и колонки требуют ручного восстановления почти с нуля, выберите специализированный OCR-редактор. Конвертер хорош тогда, когда стоимость исправления макета меньше, чем ручной набор текста.
Xodo PDF Reader / Xodo PDF Studio: OCR и редактирование как два последовательных этапа
В экосистеме Xodo OCR используется для превращения scanned PDF в searchable документ, после чего содержимое можно передать инструменту редактирования. Для настольного приложения функция OCR вызывается из раздела документа через ImageOCR с выбором языка. После распознавания обязательно проверьте текстовый слой поиском.
Xodo PDF Reader и Xodo PDF Studio не нужно смешивать с браузерным OCR в один шаг. В PDF Studio для существующего документа используется Document → ImageOCR: выберите язык, диапазон страниц и при необходимости Auto Deskew Images, затем запустите OCR. После распознавания проверьте поиск и только потом переходите к редактированию.
PDF24 Creator и онлайн OCR PDF24
PDF24 Creator полезен для локальных PDF-операций, а экосистема PDF24 также предоставляет OCR для создания searchable PDF. Эти варианты нельзя считать одним и тем же способом: Creator — установленная программа, онлайн OCR — браузерный сервис. Если задача связана с конфиденциальным документом, предпочтительнее локальная обработка; если нужен разовый OCR без установки, можно использовать браузерный маршрут при допустимой политике обработки данных.
iPhone: извлечь текст из скана без отдельного OCR-редактора
Apple Notes: команда Scan Text
На iPhone встроенная функция Notes позволяет получить именно редактируемый текст, а не просто фотографию страницы. Откройте заметку, нажмите кнопку вложений и выберите Scan Text. Наведите камеру на документ, выделите распознанный фрагмент и нажмите Insert. Текст появится в заметке как обычное содержимое, которое можно исправлять, копировать и переносить дальше.

Когда этот способ подходит
- нужно быстро перенести абзац с бумаги в сообщение или документ;
- важно исправить содержание, а не сохранить оригинальную верстку листа;
- сканировать весь PDF не требуется;
- документ находится рядом и его можно снять камерой заново.
Если нужно получить именно PDF-копию листа, используйте в Notes отдельную команду сканирования документов. Она создаёт страницу-скан с кадрированием и фильтрами. Scan Text решает другую задачу — извлекает текст для редактирования. Это разграничение предотвращает ситуацию, когда пользователь создаёт красивый PDF-скан, а затем обнаруживает, что слова внутри него всё ещё являются частью изображения.
Плюсы:
- OCR встроен в системный рабочий процесс;
- полученный текст редактируется сразу в заметке;
- не нужно сначала создавать PDF.
Минусы:
- макет исходной страницы не переносится как редактируемая верстка;
- таблицы и сложные колонки нужно проверять и часто оформлять заново;
- для большого многостраничного архива настольный пакетный OCR удобнее.
Adobe Scan: мобильное сканирование с OCR
Adobe Scan снимает бумажную страницу камерой, определяет границы, корректирует геометрию и сохраняет PDF с распознанным текстом. Если после сканирования нужно изменить именно распознанный текст на телефоне, откройте PDF в Acrobat mobile, выберите More tools → Recognize text, дождитесь завершения OCR, коснитесь нужного текста и выберите Edit text. Редактирование текста в scanned PDF в Acrobat mobile требует подписки Acrobat. Для конфиденциальных документов заранее оцените допустимость облачного хранения и синхронизации.
Для одной-двух страниц телефон удобен. Для десятков листов лучше сканер с автоподачей или настольная программа: качество геометрии и повторяемость настроек важнее мобильности.
Android: мобильный OCR и редактируемый результат
WPS Office : скан → OCR → редактирование
WPS Office позволяет начать со сканирования на телефоне, выполнить OCR и получить результат для дальнейшей правки. В мобильном процессе после создания скана доступно распознавание текста; на экране экспорта также присутствует действие Recognize text.

Практический порядок
- В мобильном приложении создайте новый скан через встроенный scanner.
- Проверьте границы страницы и поворот до OCR.
- Запустите распознавание через Recognize text/OCR.
- Исправьте ошибки в распознанном тексте.
- Экспортируйте результат в формат, который нужен для дальнейшей работы, например документ, а исходный скан сохраните отдельно.
Плюсы:
- весь процесс можно выполнить на телефоне;
- OCR встроен в сценарий сканирования;
- подходит для быстрой передачи распознанного текста в офисный документ.
Минусы:
- маленький экран неудобен для проверки большой таблицы;
- длинный документ быстрее вычитывать на компьютере;
- качество результата зависит от ровной съёмки страницы и освещения.
CamScanner: мобильный сканер с OCR и конвертацией
CamScanner остаётся действующим мобильным инструментом для сканирования документов и OCR. Он подходит для ситуации, когда бумага находится на руках, а компьютер и отдельный сканер недоступны. Сначала снимите страницу, откорректируйте границы и улучшение изображения, затем примените распознавание текста. Распознанный результат можно использовать для поиска, извлечения текста и дальнейшей конвертации.

Как получить более точный OCR на телефоне
- кладите лист на контрастный однотонный фон;
- держите камеру параллельно странице, а не под углом;
- избегайте бликов на глянцевой бумаге;
- проверяйте рамку кадрирования до сохранения;
- для мелкого шрифта лучше сделать новую фотографию ближе, чем пытаться увеличить размытую страницу программно.
Плюсы:
- камера, кадрирование и OCR находятся в одном мобильном процессе;
- удобно оцифровать документ вне рабочего места;
- подходит для дальнейшего получения редактируемого текста или Word-документа.
Минусы:
- ручная вычитка большого документа на телефоне неудобна;
- перспективные искажения камеры могут снижать точность;
- для конфиденциальных материалов нужно учитывать политику хранения и синхронизации используемого аккаунта.
Linux: OCR, searchable PDF и подготовка страниц
В Linux удобно разделить процесс на независимые этапы: подготовить изображение, добавить OCR-слой, проверить распознавание, а затем редактировать текст в подходящем приложении. Это особенно полезно для больших архивов, потому что командную строку можно автоматизировать. При этом важно понимать роль каждой утилиты: OCRmyPDF и Tesseract распознают текст, Poppler извлекает содержимое PDF, QPDF работает со структурой PDF, а графические инструменты улучшают изображение. Ни один из них сам по себе не превращается в полноценный визуальный Word-редактор.
OCRmyPDF: добавить текстовый слой в scanned PDF
OCRmyPDF предназначен для PDF, где страницы являются изображениями. Он добавляет OCR-слой, благодаря которому документ можно искать и копировать. Это хороший первый этап перед дальнейшим редактированием, но не WYSIWYG-редактор: после OCR содержимое меняют уже другим инструментом.
Базовый запуск
ocrmypdf input.pdf output.pdfЕсли страницы слегка перекошены, используйте автоматическое выравнивание:
ocrmypdf --deskew input.pdf output.pdfДля материала с неправильной ориентацией и шумом можно объединить операции:
ocrmypdf --deskew --clean --rotate-pages input.pdf output.pdfВажно: --rotate-pages исправляет страницы, повернутые на кратный 90° угол, а --deskew предназначен для небольшого наклона строк. Это разные дефекты. После обработки откройте output.pdf и проверьте поиск по нескольким словам. Если текст находится, OCR-слой создан.
Автоматизация через Python API
Для собственного скрипта OCRmyPDF можно вызывать из Python. Минимальный пример с выравниванием:
import ocrmypdf
ocrmypdf.ocr("input.pdf", "output.pdf", deskew=True)Такой вариант полезен, когда PDF поступают регулярно и их нужно обрабатывать по одному правилу. Скрипт следует сначала проверить на копии нескольких файлов, а ошибки выполнения — обрабатывать явно, чтобы не принять неполный output.pdf за готовый результат.
Плюсы:
- подходит для автоматизации большого PDF-архива;
- не требует конвертировать каждую страницу вручную;
- есть выравнивание, поворот и очистка перед распознаванием.
Минусы:
- не предназначен для визуального редактирования абзацев;
- командная строка требует аккуратно работать с именами входного и выходного файлов;
- результат всё равно нужно проверять на OCR-ошибки.
Tesseract: получить TXT или searchable PDF из изображения
Tesseract — OCR-движок командной строки. Он принимает изображения, а не PDF как обычный входной формат, поэтому страницы PDF при необходимости предварительно извлекают в изображения. Для русского текста должен быть установлен русский языковой пакет.
Распознать PNG в текстовый файл:
tesseract scan.png result -l rusПосле выполнения появится result.txt. Для двуязычной страницы можно указать несколько установленных языков через знак +. Чтобы создать searchable PDF непосредственно из изображения:
tesseract scan.png result -l rus pdfВторой вариант создаёт result.pdf с изображением страницы и скрытым текстовым слоем. Он удобен для архивирования, но не означает, что макет превратился в свободно редактируемые блоки. Для содержательной правки экспортированный текст нужно открыть в текстовом редакторе либо использовать PDF-редактор, который умеет работать с OCR-слоем.
Плюсы:
- подходит для скриптов и массовой обработки изображений;
- можно получить обычный текст или searchable PDF;
- есть языковые модели для русского.
Минусы:
- PDF перед OCR часто нужно предварительно преобразовать в изображения;
- сам Tesseract не восстанавливает офисный макет;
- неверный язык или плохая сегментация страницы резко увеличивают число ошибок.
Poppler / pdfimages: извлечь изображения из PDF перед OCR
Если scanned PDF содержит изображения страниц, а распознавать их нужно внешним движком, утилита pdfimages из Poppler позволяет извлечь вложенные изображения без ручных снимков экрана. После этого каждую страницу можно обработать Tesseract или графическим фильтром.
Такой подход полезен, когда PDF собран из сканов разного качества и отдельные страницы требуют индивидуальной подготовки. Не следует преобразовывать хороший встроенный скан в новый JPEG без необходимости: повторное сжатие может добавить артефакты. Предпочтительнее извлечь исходный растр в максимально близком виде, затем работать с копией.
pdf2docx и Pandoc: не путайте конвертацию форматов с OCR
Конвертацию форматов и OCR нужно считать разными этапами. Конвертер PDF → DOCX восстанавливает редактируемый текст только тогда, когда в исходном PDF уже есть пригодный текстовый слой или сам конвертер выполняет OCR. Если PDF состоит из изображений страниц и текст не выделяется, сначала выполните распознавание.
Pandoc полезен для преобразования структурированного текста между форматами, но не является распознавателем отсканированных пикселей. Поэтому цепочка «скан → Pandoc → Word» без OCR концептуально неверна. Правильный порядок: скан → OCR → проверенный текст/структурированный документ → дальнейшая конвертация.
QPDF: служебные операции с PDF, но не распознавание
QPDF работает со структурой PDF и полезен в автоматизированных цепочках, однако не выполняет OCR и не превращает изображение страницы в редактируемые слова. Его следует использовать только для операций с самим PDF-контейнером, а задачу распознавания передавать OCRmyPDF или другому OCR-движку.
Это важное правило для командной строки: наличие утилиты в процессе обработки PDF ещё не означает, что именно она отвечает за распознавание текста.
NAPS2 : GUI-сканирование и OCR в Linux
NAPS2 работает в Windows, macOS и Linux. Он удобен как графический интерфейс для сканирования, импорта и перестановки страниц, а OCR добавляет searchable-текст к PDF. Для изменения существующих абзацев после распознавания потребуется PDF-редактор или текстовый редактор.


Рабочий процесс
- Отсканируйте страницы или импортируйте существующий PDF/изображения и расставьте страницы в нужном порядке.
- Нажмите OCR на панели инструментов; на Mac используйте Tools → OCR.
- При первом запуске выберите нужный язык и нажмите Download, чтобы добавить языковые данные OCR.
- В окне OCR Setup включите Make PDFs searchable using OCR и проверьте выбранный язык. Для документа на нескольких языках используйте Multiple Languages….
- Сохраните PDF. Если исходная страница не имела текста, NAPS2 добавит OCR-слой; затем проверьте документ поиском и копированием контрольной строки.
NAPS2 также умеет добавлять OCR к импортированному существующему PDF. Поэтому физический сканер не обязателен, если файл уже создан, но пока остаётся image-only.
Плюсы:
- графический интерфейс вместо обязательной командной строки;
- есть поворот, обрезка, перестановка страниц и OCR;
- подходит для Windows, macOS и Linux, включая сканирование с разных типов устройств;
- удобен для формирования многостраничного PDF перед дальнейшей правкой.
Минусы:
- OCR делает текст searchable, но не превращает NAPS2 в полноценный редактор существующих абзацев;
- для сложной правки нужен второй инструмент;
- качество OCR зависит от исходного скана и правильно выбранного языка.
GIMP , ImageMagick и Scan Tailor: подготовка изображения
GIMP подходит для ручной обработки проблемной страницы: обрезки, поворота, коррекции контраста и удаления визуального мусора. ImageMagick удобнее, если ту же операцию нужно повторить на множестве файлов. Scan Tailor предназначен для подготовки отсканированных книжных страниц: разделения разворотов, выравнивания и очистки перед OCR. Ни один из этих инструментов сам по себе не заменяет распознавание текста.
Для ImageMagick важны команды -deskew и -trim. Пример конвейера для отдельной копии скана:
magick input.png -colorspace Gray -deskew 40% -trim +repage clean.pngПосле такой операции визуально сравните clean.png с оригиналом на мелком шрифте. Если тонкие штрихи стали хуже, не используйте обработанный файл для OCR. Автоматическую очистку нельзя оценивать только по размеру файла или «более белому» фону.
Плюсы:
- можно исправить геометрию до распознавания;
- ImageMagick подходит для повторяемой пакетной обработки;
- GIMP позволяет вручную контролировать проблемные участки.
Минусы:
- эти инструменты сами не создают редактируемый текст;
- агрессивная очистка способна удалить детали букв;
- пакетные настройки нужно сначала испытать на нескольких типичных страницах.
LibreOffice : редактирование после OCR

LibreOffice можно использовать как свободный офисный путь работы с документом после распознавания. Его правильная роль — не «магически распознать картинку», а принять уже распознанный текст или PDF с текстовым слоем и продолжить редактирование. Если страница остаётся изображением, сначала используйте NAPS2, OCRmyPDF, Tesseract или другой OCR-инструмент.
Для экспортированного DOCX/ODT порядок проверки такой же, как в Word: сначала содержание, затем таблицы и стили, затем разрывы страниц. Не исправляйте верстку до того, как убедились в точности текста.
Устаревшие программы: что не стоит выбирать для нового процесса
Часть знакомых средств больше не подходит как основа нового OCR-процесса. Причина должна быть конкретной: приложение снято с поддержки, компонент относится к давно неподдерживаемому Office или программа изначально решает другую задачу — например, только редактирует изображение.
| Программа | Статус и роль | Практическая замена |
|---|---|---|
| Microsoft Lens | Приложение выведено из эксплуатации; создание новых сканов больше не является рабочим маршрутом. | На iPhone используйте Apple Notes; на Android — мобильный OCR в WPS Office или CamScanner. |
| Adobe Fill & Sign | Отдельное мобильное приложение снято с поддержки. Оно не должно использоваться как новый OCR-редактор. | Для scanned PDF на телефоне используйте Adobe Scan для захвата и Acrobat mobile для OCR/редактирования. |
| Microsoft Office Document Imaging (MODI) | MODI был исключён из Office начиная с Office 2010 и относится к старому Office-процессу. | Для извлечения текста используйте OneNote или самостоятельный OCR; для PDF — PDF-редактор с OCR. |
| Picasa | Google прекратил поддержку Picasa; установленная копия может работать только как локальный старый инструмент для изображений. | Для подготовки растра используйте поддерживаемый графический редактор, а распознавание выполняйте отдельным OCR. |
Если на компьютере уже установлены SimpleOCR, Freemore OCR, FreeOCR, PDFill PDF Tools, Free PDF Editor, Скан Корректор А4, ScanLine, ScanKromsator, Scan Tailor, Book Restorer или PhotoScape, сначала определите фактическую роль конкретной программы: OCR, сканирование, подготовка изображения или PDF-операции. Не переносите шаги между разными инструментами только из-за похожего назначения. Для изменения слов нужен распознанный текст; для удаления пятна или исправления фона — работа с изображением; для перестановки страниц — PDF-операции.
Другие программы и сервисы: какую роль им отводить
Не все средства выполняют OCR и редактирование одновременно. Одни создают PDF со сканера, другие готовят изображения, третьи работают с уже распознанным документом. Таблица помогает выбрать вспомогательный инструмент по его реальной роли и не ждать от сканирующей утилиты функций полноценного PDF-редактора.
| Инструмент | Роль в процессе | Когда имеет смысл |
|---|---|---|
| WinScan2PDF | Получение PDF со сканера | Создать PDF-исходник, затем выполнить OCR другим инструментом |
| RiDoc | Сканирование и документный процесс | Когда основной этап — получение цифровой копии с бумажного оригинала |
| VueScan | Работа со сканером | Когда нужен качественный новый скан до распознавания |
| PDF2DOCX | Конвертация PDF в DOCX | Когда PDF уже содержит текстовый слой или OCR выполнен отдельным этапом |
| Adobe Acrobat Reader | Просмотр, комментарии и доступ к части PDF-функций | Не путать с Acrobat Pro при описании полноценного редактирования существующего scanned-текста |
| PDF24 Creator | Локальные PDF-операции и OCR-рабочий процесс | Когда требуется настольная обработка PDF без облачной загрузки |
| XnView | Просмотр и пакетная подготовка изображений | Перед OCR серии сканов |
| ImBatch | Пакетная обработка изображений | Одинаковая коррекция множества страниц |
Как исправлять ошибки OCR, а не просто замечать их
OCR не заканчивается нажатием кнопки распознавания. Для реального документа это промежуточный этап: результат нужно проверить системно, иначе самые опасные ошибки останутся в местах, которые визуально выглядят правдоподобно.
Проверяйте сначала символы с высокой ценой ошибки
- 0 и O. В кодах, номерах договоров и артикулах замена буквы на цифру меняет значение полностью.
- 1, I и l. Особенно опасно в латинских индексах и паролях, хотя конфиденциальные пароли лучше вообще не отправлять на облачный OCR.
- С и C, Р и P, Н и H. Смешение кириллицы и латиницы визуально незаметно, но ломает поиск и копирование.
- Десятичные разделители. Точка, запятая и плохо распознанный штрих меняют числовое значение.
- Дефис и тире. В идентификаторах и диапазонах это может быть существенным.
- Скобки и знаки. Особенно важны в формулах, реквизитах и технической документации.
Сверяйте документ по выборке, а не только визуально
Для длинного файла выберите контрольные страницы: первую, последнюю, одну со сложной таблицей, одну с самым мелким шрифтом и несколько случайных. Если ошибки повторяются по одному шаблону, например кириллическая «О» регулярно превращается в латинскую, исправляйте системно и затем повторно ищите ошибочный символ.
Используйте встроенную проверку, если она есть
В Acrobat для этого предусмотрено All tools → Scan & OCR → Correct recognized text. В FineReader проверка является отдельной частью OCR-процесса. Такая проверка полезнее простого чтения PDF глазами, потому что редактор показывает именно участки, в которых распознавание сомневается.
Не исправляйте плохой OCR бесконечно вручную
Если на одной странице десятки ошибок, вернитесь к изображению. Причина часто находится до OCR: перекос, слабый контраст, неправильный язык, лишний фон или слишком низкая детализация. Повторное распознавание улучшенного исходника быстрее, чем ручная правка каждой строки.
Таблицы, колонки и изображения: как не разрушить макет
OCR распознаёт символы, но редактирование документа требует ещё и правильной структуры. Особенно сложны таблицы, газеты с несколькими колонками, анкеты, формы и страницы, где текст обтекает изображения. Здесь нужно выбирать метод не по скорости первого запуска, а по стоимости последующего восстановления верстки.
| Тип страницы | Предпочтительный маршрут | Что проверить |
|---|---|---|
| Один обычный абзац | OneNote, Google Docs, простой OCR → Word | Символы, переносы, абзацы |
| Договор с фиксированными полями | PDF Commander, Acrobat, PDFelement, Nitro | Положение строк и шрифт после замены |
| Большая таблица | FineReader/Readiris с контролем структуры | Границы ячеек, объединения, числа, порядок столбцов |
| Газетные колонки | OCR с ручными областями | Правильный порядок чтения колонок |
| Книжный разворот | Предобработка геометрии → OCR | Искажение у корешка, наклон строк, обрезка |
| Фото документа с телефона | Мобильный scanner → crop/perspective → OCR | Блики, перспектива, резкость мелкого текста |
Почему экспорт в Word меняет страницу
PDF описывает размещение элементов на странице, а Word строит потоковый документ. При конвертации программа должна догадаться, что является абзацем, колонкой, таблицей и отдельным рисунком. Чем сложнее исходная геометрия, тем больше вероятность, что структура изменится. Поэтому Word — хороший конечный редактор для содержания, но не всегда лучший способ сохранить точное расположение каждого объекта.
Когда лучше править PDF напрямую
Если нужно заменить фамилию, дату или одну строку и остальной макет уже правильный, прямая правка PDF после OCR обычно рациональнее. Сначала распознайте страницу, затем измените конкретный блок и проверьте область вокруг него. Не конвертируйте десятки страниц в DOCX только ради одной локальной замены.
Когда Word всё же лучше
Если нужно переписать несколько абзацев, добавить новые разделы, поменять стили и продолжить работу как с обычным документом, сохранение старой PDF-геометрии перестаёт быть главным приоритетом. В таком случае OCR → DOCX даёт более удобный рабочий файл.
Многостраничные сканы и пакетная обработка
Для двух страниц можно вручную повторить одно действие несколько раз. Для сотни страниц нужен другой процесс. Сначала выделите операции, которые одинаковы для всех файлов, а затем отделите страницы-исключения.
- Сделайте резервную копию исходной папки. Пакетная команда должна работать с копиями.
- Нормализуйте имена и порядок. Например, страницы должны сортироваться одинаково файловым менеджером и OCR-программой.
- Выберите 3–5 тестовых страниц. В набор включите обычную, самую тёмную, страницу с таблицей и страницу с мелким шрифтом.
- Настройте поворот и deskew. Не обрезайте поля агрессивно до проверки тестовой группы.
- Запустите OCR только на тесте. Убедитесь, что язык, порядок чтения и таблицы определяются приемлемо.
- Запустите пакет на всей серии. Для CLI можно использовать OCRmyPDF/Tesseract; для GUI — FineReader, NAPS2 или инструменты пакетной подготовки.
- Проверьте выборку после обработки. Контролируйте не только первые страницы, но и середину и конец серии.
XnView, ImBatch и ImageMagick полезны на этапе одинаковой обработки изображений. OCRmyPDF и NAPS2 — на этапе создания searchable PDF. FineReader — когда нужна более глубокая проверка структуры. Эти инструменты не конкурируют напрямую: в большом проекте они могут последовательно решать разные задачи.
Конфиденциальные сканы: когда онлайн-сервис лучше не использовать
Технически браузерный OCR проще: загрузить файл, получить текст, скачать результат. Но выбор метода должен учитывать содержание документа. Паспортные данные, медицинские сведения, банковские реквизиты, кадровые документы, договоры с персональными данными и внутренние материалы организации могут подпадать под собственные правила хранения и передачи.
Если документ нельзя передавать третьей стороне, выбирайте локальный процесс: PDF Commander, FineReader, Acrobat, Nitro, NAPS2, Tesseract/OCRmyPDF или другой установленный инструмент, который не требует загрузки файла в веб-интерфейс. Сам факт того, что онлайн-сервис доступен бесплатно или без регистрации, не отменяет правила обработки конкретных данных.
Для обезличенного фрагмента можно дополнительно вырезать только нужную область до загрузки. Но это допустимо лишь тогда, когда на фрагменте действительно не осталось идентифицирующих данных, штрихкодов, номеров, QR-кодов и скрытой информации.
Как проверить готовый документ перед отправкой
Файл считается готовым не в момент, когда OCR закончил работу, а после повторного открытия и проверки. Для делового документа используйте короткий контрольный протокол.
- Сохраните отдельную копию. Оригинальный скан должен остаться неизменным.
- Закройте редактор и откройте новый файл заново. Это выявляет проблемы сохранения и шрифтов.
- Найдите исправленное слово поиском. Убедитесь, что поиск находит новую форму.
- Найдите старое слово. Если оно было заменено, оно не должно продолжать находиться в невидимом OCR-слое на исправленном месте.
- Скопируйте контрольный абзац. Вставьте его в простой текстовый редактор: так видно, соответствует ли текстовый слой визуальной странице.
- Проверьте числа. Даты, суммы, номера, индексы и артикулы сверяйте с оригиналом отдельно от обычного чтения.
- Проверьте геометрию. Увеличьте масштаб и посмотрите, не перекрывает ли новый текст соседние элементы.
- Просмотрите страницы вокруг изменённой. Пакетный OCR иногда затрагивает больший диапазон, чем ожидалось.
- Проверьте формат назначения. Если заказчику нужен DOCX, не ограничивайтесь проверкой PDF-превью; откройте именно DOCX в редакторе.
Частые ошибки при редактировании сканов
Ошибка: открыть картинку в Word и ждать редактируемый текст
Word видит вставленное изображение как графический объект. Используйте OCR через OneNote, FineReader, Google Docs, PDF-редактор с распознаванием или другой специализированный инструмент.
Ошибка: наложить новый текст и считать старый удалённым
Визуальная маска может скрыть старую строку, но невидимый OCR-слой останется прежним. После такой операции ищите старый текст и копируйте область в простой редактор для проверки.
Ошибка: конвертировать сложную таблицу целиком в Word без теста
Сначала обработайте одну страницу. Если структура таблицы разрушается, смените OCR-инструмент с контролем областей или редактируйте PDF напрямую.
Ошибка: выбрать слишком много языков OCR
Добавляйте только языки, которые реально есть на странице. Лишние алфавиты расширяют набор допустимых символов и могут повышать число визуально похожих замен.
Ошибка: чистить изображение до потери тонких штрихов
Слишком агрессивный Threshold, Levels или фильтр удаления шума способен стереть точки, запятые и тонкие части букв. Сравнивайте результат на мелком тексте до пакетного применения.
Ошибка: перезаписать единственный оригинал
OCR и графическая обработка должны выполняться на копии. Исходный скан нужен для проверки спорных мест и восстановления страницы, если автоматическая обработка дала плохой результат.
Ошибка: использовать Reader вместо Editor
Adobe Acrobat Reader и полноценный Acrobat Pro решают разные задачи. Аналогично любой PDF-просмотрщик может позволять комментарии и выделения, но это не означает возможность менять существующий распознанный текст.
Как выбрать способ по конкретной задаче
| Ситуация | Рекомендуемый маршрут | Почему |
|---|---|---|
| Одна ошибка в scanned PDF на Windows | PDF Commander → OCR нужной страницы → правка → проверка поиска | Не нужно конвертировать весь документ |
| Сложный многостраничный договор | ABBYY FineReader → проверка областей → OCR → контроль → PDF/DOCX | Нужен контроль структуры и ошибок |
| Нужно переписать много текста | OCR → Microsoft Word | Потоковый текст удобнее редактировать в текстовом редакторе |
| Нужен быстрый текст из одной картинки | OneNote или Google Docs | Макет не критичен, важнее содержание |
| Нельзя устанавливать программу | Google Drive, Smallpdf, iLovePDF или NewOCR | Работа через браузер; сначала оценить допустимость облачной загрузки |
| Документ содержит конфиденциальные данные | Локальный OCR | Не требуется передавать файл браузерному сервису |
| Нужно убрать пятно или выровнять страницу | GIMP, Photoshop или другой графический редактор | OCR не нужен для изменения пикселей |
| Нужно распознать бумагу на iPhone | Apple Notes → Scan Text | Текст сразу вставляется в заметку |
| Нужно распознать бумагу на Android | WPS Office или CamScanner | Сканирование и OCR выполняются на телефоне |
| Большой архив PDF в Linux | OCRmyPDF, при необходимости Tesseract и ImageMagick | Командный процесс автоматизируется |
| Нужен GUI-сканер в Linux | NAPS2 | Сканирование, перестановка страниц и OCR доступны в одном интерфейсе |
Ответы на практические вопросы
Почему текст в PDF виден, но не выделяется?
Страница является изображением без текстового слоя. Выполните OCR. Если после распознавания текст всё ещё не выделяется, проверьте, выбран ли режим создания searchable/текстового слоя, а не только извлечение текста в отдельный файл.
Можно ли изменить scanned PDF без OCR?
Да, если требуется только визуальная правка: обрезка, поворот, закрытие участка, дорисовка или добавление нового текста поверх изображения. Для настоящего изменения существующих слов и корректного поиска OCR необходим.
Почему после OCR шрифт отличается от оригинала?
OCR распознаёт символы и структуру, но исходный скан не содержит описания настоящего шрифта как обычный текстовый документ. PDF-редактор подбирает доступное оформление. При точечной правке сравните размер, насыщенность, межбуквенное расстояние и положение строки; при масштабной — лучше перейти в DOCX и оформить документ заново.
Почему таблица после PDF → Word распалась?
Конвертер неправильно восстановил структуру ячеек или порядок чтения. Повторите OCR в инструменте с контролем областей таблицы либо редактируйте исходный PDF напрямую, если изменения небольшие.
Можно ли распознать только одну страницу большого PDF?
Да, если выбранный OCR позволяет задать диапазон. Например, PDF Commander поддерживает текущую страницу, весь документ и выбранный диапазон; Nitro также позволяет настроить page range. Для локальной ошибки это лучше, чем заново распознавать сотни страниц.
Как понять, что PDF уже имеет OCR-слой?
Попробуйте выделить отдельное слово, скопировать его и найти через поиск. Затем вставьте скопированный текст в простой редактор. Если содержимое совпадает с видимой страницей, текстовый слой существует и хотя бы на проверенном участке корректен.
Что делать, если OCR путает русский и английский алфавит?
Ограничьте языки распознавания реальным набором документа и проверьте похожие буквы вручную. Для кодов и реквизитов полезно искать латинские символы внутри русских слов после распознавания.
Когда лучше пересканировать документ, а не улучшать старый файл?
Если буквы размыты, часть строки пересвечена, страница снята под сильным углом или мелкие символы физически неразличимы, новый скан даст больше, чем фильтры. OCR не восстанавливает информацию, которой нет в исходном растре.
Можно ли редактировать скан только на телефоне?
Да. На iPhone можно извлечь редактируемый текст через Apple Notes, на Android — использовать WPS Office или CamScanner. Но длинные таблицы и многостраничные документы удобнее проверять на большом экране.
Нужен ли OCR, если я просто хочу подписать скан?
Нет. Подпись, комментарий или новый текстовый блок можно добавить поверх PDF без распознавания существующего текста. OCR нужен, когда требуется работать именно с содержимым напечатанных слов или создать searchable PDF.
Почему старое слово находится поиском после визуального исправления?
Вы изменили изображение, но не OCR-слой. Перераспознайте исправленную область или измените текстовый слой в PDF-редакторе, затем повторите поиск.
Какой формат лучше сохранять после OCR?
Для архива и сохранения вида страницы — searchable PDF. Для серьёзной текстовой правки — DOCX или другой редактируемый офисный формат. Для простого извлечения содержания без верстки — TXT. Выходной формат выбирается по следующему этапу работы, а не по привычке.
Стоит ли загружать паспорт или договор в бесплатный онлайн OCR?
Только если правила обработки конкретного документа разрешают передачу такому сервису. Для персональных и внутренних данных безопаснее выбрать локальный OCR и не отправлять файл в веб-интерфейс без необходимости.
Итог: какой маршрут даёт предсказуемый результат
Для scanned PDF на Windows основной практический маршрут — PDF Commander: распознать нужные страницы, исправить содержимое и проверить текстовый слой поиском. Для сложных таблиц и многостраничных документов полезнее ABBYY FineReader с контролем областей и проверкой OCR. Когда исходный макет уже не важен и требуется серьёзно переписать текст, рациональнее после распознавания перейти в Word.
Для разовой неконфиденциальной задачи подойдут Google Docs и браузерные OCR-сервисы. На iPhone быстрее всего извлечь текст через Apple Notes, на Android — использовать мобильный OCR в WPS Office или CamScanner. В Linux большой архив удобно обрабатывать OCRmyPDF/Tesseract, а NAPS2 закрывает GUI-сценарий сканирования и searchable OCR.
Самое важное правило не зависит от платформы: сначала определите, меняете ли вы пиксели или настоящий текст, а после OCR всегда проверяйте результат. Визуально правильная страница ещё не гарантирует правильный скрытый текстовый слой, а красивый DOCX — точность распознанных фамилий, номеров и сумм.