Как конвертировать PDF в TXT: кодировка, OCR и страницы

Как сохранить текст из PDF в TXT: кодировка, OCR и порядок чтения

Преобразование документа PDF в текстовый файл TXT с OCR и UTF-8

TXT нужен не для сохранения внешнего вида документа, а для получения обычной последовательности символов. После такого экспорта исчезают шрифты, размеры, цвет, изображения, подписи, поля формы и большая часть табличной структуры. Зато текст можно открыть почти в любом редакторе, проиндексировать, обработать скриптом, загрузить в систему анализа или перенести в приложение, которое не понимает PDF.

Результат зависит не столько от кнопки «Конвертировать», сколько от устройства исходного PDF. В одном файле уже есть корректный текстовый слой, в другом каждая страница является фотографией, в третьем символы видимы, но закодированы нестандартными таблицами шрифтов. Поэтому надежный порядок работы всегда одинаков: определить тип документа, выбрать способ извлечения, настроить диапазон и кодировку, затем открыть TXT отдельно и проверить символы, абзацы и порядок чтения.

Главное ограничение TXT

Плоский текст не способен сохранить таблицу как таблицу, картинку как картинку или две колонки как две независимые колонки. Максимум, что можно получить, — строки, пробелы, табуляции и переводы строк. Если важна вёрстка, выбирайте DOCX или RTF; если нужны именно данные, заранее решите, чем разделять столбцы и страницы.

Быстрый выбор способа по типу PDF

Исходный файл Что проверить Подходящий путь Что ожидать в TXT
Обычный текстовый PDF Текст выделяется мышью, поиск находит слова PDF Commander или Adobe Acrobat Pro Высокая точность символов; возможны лишние переносы строк
Скан или фото страниц Ничего не выделяется, поиск не работает ABBYY FineReader либо OCR в Acrobat Нужна проверка языка, цифр, дефисов и похожих букв
Книга без сложной вёрстки Главы идут последовательно, мало таблиц Calibre или Epubor Ultimate Удобный сплошной текст; колонтитулы могут повторяться
PDF, который Word открывает корректно Страницы похожи на простой офисный документ Microsoft Word → Обычный текст Можно отредактировать текст до сохранения; порядок колонок требует проверки
Разовая неконфиденциальная задача Файл допустимо отправить на внешний сервер Convertio или Aconvert Быстро, но параметры кодировки и приватности ограничены
Защищённый PDF Копирование или экспорт запрещены владельцем Получить разрешённую копию либо пароль у владельца Конвертер не должен использоваться для обхода ограничений
Подписанный документ Есть действующая цифровая подпись Работать только с копией TXT не содержит подпись и не подтверждает подлинность исходника

Сначала определите, что находится внутри PDF

Тест 1. Выделение и поиск

Откройте документ в привычном просмотрщике и попробуйте выделить одно короткое слово. Затем нажмите Ctrl + F и найдите то же слово. Если выделение проходит по буквам, а поиск показывает совпадение, внутри, скорее всего, есть текстовый слой. Такой файл обычно можно сразу экспортировать в TXT. Если выделяется прямоугольник целиком или курсор вообще не превращается в текстовый, перед вами скан либо страница, превращённая в изображение.

Есть промежуточный вариант: поиск работает, но копирование даёт пустые квадраты, вопросительные знаки или бессмысленные латинские символы. Это признак проблем с таблицей соответствия шрифта, встроенной кодировкой или повреждённым текстовым слоем. Прямой экспорт повторит ошибку. Практичнее выполнить OCR по изображению страницы и создать новый текстовый слой, чем пытаться угадывать исходную карту символов.

Тест 2. Порядок чтения

Проведите выделением от начала первого абзаца до конца второго. В одноколоночном документе подсветка должна идти сверху вниз. В макете с колонками, сносками и плавающими подписями выделение иногда прыгает между областями. TXT записывает элементы в том порядке, который задан структурой PDF или вычислен конвертером. Внешне правильная страница поэтому может превратиться в чередование левой и правой колонок.

Особенно внимательно проверяйте журналы, каталоги, инструкции с боковыми примечаниями, формы и презентационные страницы. Для них полезно сначала экспортировать одну тестовую страницу и решить, подходит ли автоматический порядок. Если нет, применяйте OCR-программу с зонами распознавания или извлекайте колонки по отдельности.

Тест 3. Ограничения и состояние файла

  • Пароль на открытие. Без него программа не сможет прочитать документ. Запрашивайте пароль у владельца.
  • Запрет копирования. Это ограничение задаёт автор документа. Не пытайтесь обходить его; используйте разрешённую версию.
  • Цифровая подпись. Экспорт в TXT создаёт новый неподписанный файл. Подлинность проверяют только по исходному PDF.
  • Интерактивная форма. Значения полей могут храниться отдельно от видимого текста. После экспорта обязательно сверяйте заполненные ответы.
  • Повреждение. Если страницы открываются с ошибками, сначала сохраните исправленную копию или запросите исходник заново.
  • Смешанный документ. В одном PDF могут соседствовать текстовые страницы и сканы. Для него понадобится либо OCR всего файла, либо комбинированный процесс.

Как подготовить PDF и контрольную копию

  1. Скопируйте исходник. Дайте копии понятное имя, например dogovor_ocr_copy.pdf. Не перезаписывайте подписанный, архивный или полученный от другого человека документ.
  2. Зафиксируйте диапазон. Запишите номера страниц, которые действительно нужны. Учитывайте различие между номером на листе и позицией в PDF: обложка может считаться первой страницей, хотя на ней нет номера.
  3. Выберите небольшой образец. Для проверки достаточно 2–3 страниц: обычный абзац, страница с таблицей или колонками и страница со сложными символами.
  4. Определите целевую кодировку. Для современного обмена почти всегда выбирайте UTF-8. Windows-1251 имеет смысл только для старой системы, которая явно требует эту кодовую страницу.
  5. Решите, как разделять страницы. Один общий TXT удобен для поиска; отдельный файл на страницу удобнее для пакетной обработки и привязки ошибок к оригиналу.
  6. Подготовьте папку результата. Храните рядом PDF, TXT и короткую заметку с выбранными параметрами OCR. Это упрощает повторную конвертацию.
Безопасная работа с онлайн-сервисами

Не загружайте в веб-конвертеры паспорта, медицинские документы, закрытые договоры, школьные персональные данные, ключи, пароли и файлы с конфиденциальными приложениями. Для таких материалов используйте локальную программу и проверяйте, куда она сохраняет временные файлы.

Способ 1. PDF Commander: прямой экспорт PDF в TXT

PDF Commander подходит для текстового PDF, когда нужен локальный результат без загрузки документа в браузер. Встроенный конвертер предлагает формат text/TXT и сохраняет файл в указанную папку. Перед началом убедитесь, что текст в исходнике выделяется. Чистый скан без текстового слоя сначала следует распознать: прямой экспорт изображения в TXT не сможет восстановить буквы сам по себе.

Пошаговая конвертация

  1. Запустите программу. На стартовом экране нажмите «Конвертировать PDF». Альтернативный путь: откройте меню «Файл», перейдите в «Инструменты» и выберите «Конвертировать PDF…».
  2. В окне конвертера нажмите «Выбрать файл» и укажите рабочую копию документа. Проверьте имя файла, чтобы не обработать оригинал с похожим названием.
  3. В списке выходных форматов выберите плитку text с обозначением TXT. Не выбирайте HTML, если нужен именно плоский текст: HTML сохранит служебную разметку и потребует дополнительной очистки.
  4. Укажите имя и папку. Добавьте к имени диапазон или пометку кодировки, например otchet_pages_10-25_utf8.txt. Нажмите «Сохранить».
  5. Дождитесь окончания обработки. Большой многостраничный документ может конвертироваться дольше; не запускайте повторно ту же команду, пока первое окно не завершило работу.
  6. Откройте результат в Блокноте или другом текстовом редакторе. Проверьте первые и последние строки, кириллицу, кавычки, тире, номера страниц и порядок абзацев.
Меню PDF Commander с командой конвертации PDF
В меню «Файл» открыт раздел «Инструменты» и выделена команда «Конвертировать PDF».
Окно выбора PDF-файла в PDF Commander
Экран импорта: кнопка «Выбрать файл» добавляет исходный PDF в конвертер.
Выбор текстового формата TXT в PDF Commander
В списке выходных форматов выделен вариант text/TXT.
Сохранение TXT-файла из PDF Commander
Диалог сохранения текстового файла с полем имени и кнопкой «Сохранить».

Что делать с диапазоном страниц

Если диалог конкретной версии не предлагает диапазон для TXT, безопасный обходной путь — создать из копии PDF отдельный файл с нужными страницами, а затем конвертировать его. Так вы не получите лишний текст и не будете вручную удалять десятки страниц из результата. После экспорта сравните количество страниц в подготовленной копии с числом маркеров страниц или разделов в TXT.

Ограничения результата

Программа переносит в TXT символы, а не внешний вид. Заголовок может оказаться обычной строкой, таблица — набором строк и пробелов, а колонтитул — повторяться после каждой страницы. Изображения и подписи не попадают в текстовый файл. Если важен логический порядок сложного макета, используйте ABBYY FineReader с OCR-зонами либо сначала преобразуйте PDF в редактируемый документ и перестройте текст вручную.

Способ 2. Adobe Acrobat Pro: TXT с настройкой кодировки

В актуальном Acrobat предусмотрен прямой экспорт в TXT с отдельными настройками кодировки. Это предпочтительнее ручного копирования, когда нужно выгрузить весь документ. Для скана Acrobat может сначала создать поисковый текстовый слой с помощью OCR, а затем передать распознанные символы в TXT.

Прямой экспорт

  1. Откройте PDF и выберите на общей панели «Преобразовать».
  2. На левой панели выберите «Другой формат», затем в раскрывающемся списке укажите TXT.
  3. Нажмите «Настройки». Выберите кодировку, которую понимает принимающая система. Для русского текста и смешанных языков обычно используйте UTF-8.
  4. Нажмите «Преобразовать в TXT». В диалоге сохранения задайте папку и имя файла.
  5. Откройте TXT отдельно. Если редактор предлагает выбрать кодировку при открытии, сначала попробуйте UTF-8, затем только при необходимости Windows-1251.

OCR для сканированного PDF

  1. Откройте сканированную копию и перейдите «Все инструменты» → «Сканирование и OCR».
  2. Выберите «В этом файле». Укажите диапазон страниц и язык распознавания. Для русско-английского документа задайте оба языка, если интерфейс позволяет выбрать несколько.
  3. При необходимости откройте «Настройки» и проверьте параметры распознавания. Затем нажмите «Распознать текст».
  4. После создания поискового слоя попробуйте поиск по редкому слову и выделение нескольких строк. Затем выполните прямой экспорт в TXT.
  5. Для важных документов откройте инструмент исправления распознанного текста и просмотрите сомнительные слова до экспорта.

Ручное копирование небольшого фрагмента

Если нужен один абзац, не обязательно экспортировать весь файл. Выделите текст, скопируйте его и вставьте в Блокнот. Такой способ удобен для пары страниц, но на больших документах создаёт больше ошибок: можно пропустить часть выделения, случайно изменить порядок колонок или вставить повторяющийся колонтитул. После вставки сохраните файл как TXT и проверьте кодировку в строке состояния редактора.

Открытый PDF-документ в Adobe Acrobat
PDF открыт в Acrobat; видна страница, с которой предстоит извлечь распознанный текст.
Команда выделения всего текста в Adobe Acrobat
В меню редактирования выбран пункт «Выделить все».
Копирование распознанного текста из Adobe Acrobat
Текст выделен, на плавающей панели активна команда копирования.
Вставка текста в Блокнот Windows
В меню «Изменить» Блокнота выбрана команда «Вставить».
Открытый TXT с извлеченным текстом в Блокноте
Результат открыт в текстовом редакторе; видны строки, абзацы и кодировка UTF-8 в строке состояния.
Acrobat Reader и Acrobat Pro — не одно и то же

Бесплатный просмотрщик позволяет выделять и копировать уже существующий текстовый слой. Прямой экспорт, расширенные настройки и OCR зависят от редакции и лицензии. Если нужной команды нет, не подменяйте её похожей: используйте ручное копирование для малого фрагмента или другой подтверждённый конвертер.

Способ 3. ABBYY FineReader: OCR скана и экспорт распознанного текста

FineReader особенно полезен, когда PDF состоит из изображений, текстовый слой повреждён или требуется контролировать язык и зоны распознавания. Программа показывает изображение страницы и распознанный текст, поэтому ошибки можно заметить до сохранения. Для сложной вёрстки это обычно надёжнее прямого экспорта из просмотрщика.

Пошаговая работа

  1. На стартовом экране нажмите «Открыть PDF-документ» и выберите рабочую копию. Дождитесь построения миниатюр.
  2. Проверьте ориентацию страниц. Поверните перевёрнутые листы до OCR: распознавание текста под углом даёт больше замен и неверных строк.
  3. Укажите язык документа. Для смешанного русского и английского текста выберите оба языка, но не добавляйте десятки ненужных языков — это увеличивает число похожих вариантов.
  4. Нажмите «Распознать». Для одной проверки можно обработать несколько характерных страниц, а после настройки — весь диапазон.
  5. Просмотрите зоны. Абзац должен быть текстовой областью, иллюстрация — изображением, таблица — таблицей. Если колонки объединены одной зоной, разделите их перед повторным распознаванием.
  6. Раскройте список «Сохранить как…» и выберите «Документ TXT».
  7. В диалоге сохранения задайте имя, папку, объединение страниц в один файл или отдельные файлы, а также языки распознавания. Нажмите «Сохранить».
  8. Откройте TXT и выборочно сравните его с изображением страницы: фамилии, номера, десятичные разделители, дефисы, формулы и сноски.
Стартовый экран ABBYY FineReader с открытием PDF
На стартовом экране выделена команда «Открыть PDF-документ».
Команда распознавания в ABBYY FineReader
В окне PDF-редактора выделена кнопка «Распознать».
Выбор документа TXT в ABBYY FineReader
В раскрытом списке «Сохранить как» выделен вариант «Документ TXT».
Настройки сохранения TXT в ABBYY FineReader
Диалог сохранения показывает тип «Текст», опцию одного файла и языки распознавания.

Настройка зон и порядка чтения

Главное преимущество OCR-редактора — возможность управлять тем, что считать текстом и в каком порядке читать области. На странице с двумя колонками создайте отдельную текстовую зону для каждой колонки. Сначала должна идти левая, затем правая. Подпись под рисунком располагайте после соответствующего изображения, а не в середине соседнего абзаца. Перед итоговым распознаванием просмотрите несколько страниц с разной структурой: шаблон зон, подходящий для обычного разворота, может ошибаться на титульном листе или приложении.

Когда сохранять отдельный TXT на каждую страницу

Раздельный экспорт полезен для судебных материалов, анкет, архивных карточек и пакетной обработки, где важно сохранить соответствие «страница — текст». Общий файл удобнее для поиска и чтения, но в нём сложнее определить источник конкретной ошибки. Если выбираете отдельные файлы, используйте ведущие нули в именах: page_001.txt, page_002.txt. Тогда сортировка не поставит десятую страницу перед второй.

Способ 4. Calibre: конвертация книги или длинного текста

Calibre предназначен прежде всего для управления электронной библиотекой, но поддерживает преобразование PDF в TXT. Способ удобен для книг и последовательных одноколоночных документов. Для сканов без текстового слоя он не заменяет OCR, а для журналов и сложных макетов может перепутать порядок блоков.

  1. Добавьте PDF в библиотеку Calibre перетаскиванием или кнопкой «Добавить книги».
  2. Выделите нужную запись. Откройте меню рядом с кнопкой «Конвертировать книги» и выберите «Индивидуальное конвертирование».
  3. В правом верхнем углу окна укажите TXT в поле «Формат вывода». Проверьте, что исходный формат определён как PDF.
  4. Нажмите «ОК». Ход операции отображается в разделе «Задания» внизу окна.
  5. После завершения выберите в левой панели формат TXT, затем нажмите «Сохранить на диск» и укажите папку.
  6. Проверьте начало каждой главы, переносы слов и повторяющиеся колонтитулы. При необходимости удалите служебные строки только после сравнения с оригиналом.
Команда индивидуального конвертирования в Calibre
В меню кнопки «Конвертировать книги» выбран режим индивидуального преобразования.
Формат TXT в окне конвертации Calibre
В верхнем правом списке «Формат вывода» выбран TXT.
Окно заданий Calibre во время конвертации
Окно «Задания» показывает выполняющееся преобразование.
Сохранение формата TXT на диск в Calibre
В левой панели выбран формат TXT, на панели инструментов — «Сохранить на диск».

Что Calibre может изменить

Перед созданием TXT Calibre пропускает документ через собственную систему преобразования электронных книг. Это помогает собрать последовательный текст, но не гарантирует сохранение геометрии страницы. Номера страниц, верхние колонтитулы и подписи могут стать отдельными строками. Если в PDF есть разделённые переносом слова, часть дефисов останется, а часть будет интерпретирована как обычный знак. Поэтому не используйте результат без проверки для цитирования по страницам или для юридически значимого сравнения.

Способ 5. Microsoft Word: открыть PDF и сохранить как обычный текст

Word создаёт редактируемую копию PDF. Затем её можно исправить и сохранить как «Обычный текст». Это удобно, если после импорта нужно вручную убрать колонтитулы, восстановить абзацы или переставить фрагменты. Метод лучше работает с документами, похожими на исходные файлы Word: одна колонка, обычные абзацы, минимум сложных таблиц и графики.

  1. Откройте PDF через Word или перетащите файл в окно программы. Подтвердите предупреждение о преобразовании в редактируемый документ.
  2. Дождитесь окончания импорта. Большой PDF может обрабатываться долго; не закрывайте Word, пока страницы продолжают появляться.
  3. Просмотрите документ в режиме отображения непечатаемых знаков. Удалите лишние разрывы строк только там, где они действительно не разделяют абзацы.
  4. Откройте «Файл» → «Сохранить как», нажмите «Обзор» и задайте имя результата.
  5. В поле типа файла выберите «Обычный текст». В появившемся окне преобразования текста выберите кодировку Unicode/UTF-8, если она доступна, и проверьте образец.
  6. Сохраните файл, затем закройте и заново откройте его. Повторное открытие — обязательная проверка: корректный текст в окне Word ещё не гарантирует правильную кодировку записанного TXT.
Предупреждение Word о преобразовании PDF
Word сообщает, что создаст редактируемую копию PDF и что внешний вид может измениться.
PDF после преобразования в документ Microsoft Word
Страница PDF открыта как редактируемый документ Word.
Команда Сохранить как в Microsoft Word
В меню «Файл» выбран пункт «Сохранить как».
Формат Обычный текст в Microsoft Word
В диалоге сохранения раскрыт список типов файлов и выбран «Обычный текст».

Почему таблицы становятся строками

В документе Word таблица остаётся объектом с ячейками, но TXT не знает понятия ячейки. При сохранении Word вынужден заменить границы табуляциями, пробелами или переводами строк. Если данные дальше будут загружаться в таблицу, лучше заранее выбрать явный разделитель и проверить, нет ли такого символа внутри самих значений. Для сложной таблицы правильнее использовать экспорт в XLSX или CSV, а TXT оставить для абзацев и простых списков.

Способ 6. Epubor Ultimate: быстрый экспорт книги в TXT

Epubor Ultimate предлагает компактный рабочий процесс: добавить книгу, выбрать TXT в списке и запустить преобразование. Он подходит, когда приложение уже используется для электронной библиотеки и исходный PDF имеет нормальный текстовый слой. Для контроля OCR, зон и сложного порядка чтения лучше выбрать специализированный распознаватель.

  1. Запустите Epubor Ultimate и добавьте PDF в окно программы.
  2. Раскройте список форматов рядом с кнопкой Convert to… и выберите Txt.
  3. Выделите документ в списке и нажмите Convert to TXT.
  4. Откройте папку результата. По умолчанию приложение может использовать собственный каталог библиотеки; путь меняется в Settings → Output → Source location → Browse.
  5. Проверьте название, порядок глав и символы. Не удаляйте исходную запись из библиотеки до тех пор, пока не убедитесь, что итоговый файл сохранён в отдельную папку.
Выбор TXT в Epubor Ultimate
В раскрытом списке форматов Epubor Ultimate выбран TXT.
Кнопка Convert to TXT в Epubor Ultimate
Документ выделен, внизу интерфейса доступна команда «Convert to TXT».

Способ 7. Convertio: разовая конвертация в браузере

Convertio работает в браузере и не требует установки. Такой вариант удобен на чужом компьютере или устройстве, где нельзя ставить программы. Используйте его только для файлов, которые допустимо передавать внешнему сервису. Ограничения бесплатного режима и интерфейс могут меняться, поэтому ориентируйтесь на текущие подсказки страницы, а не на старые значения лимитов.

  1. Откройте инструмент PDF → TXT и нажмите «Выберите файлы». Проверьте, что загружаете копию без конфиденциальных данных.
  2. После загрузки откройте список выходных форматов и выберите TXT в группе документов.
  3. Нажмите «Конвертировать» и дождитесь окончания. Не обновляйте страницу во время передачи большого файла.
  4. Нажмите «Скачать». Сохраните результат в новую папку, а не поверх ранее проверенного TXT.
  5. Откройте файл локально и сравните несколько фрагментов с PDF. После этого удалите ненужные копии из папки загрузок и истории браузера, если компьютер общий.
Загрузка PDF в онлайн-конвертер Convertio
На странице Convertio выделена кнопка выбора исходного файла.
Выбор TXT в списке форматов Convertio
В меню выходных форматов выбран TXT в категории документов.
Кнопка конвертации PDF в TXT в Convertio
Исходный файл загружен, формат TXT выбран, доступна кнопка «Конвертировать».
Скачивание готового TXT из Convertio
Страница сообщает о завершении и показывает кнопку скачивания результата.

Сервис указывает, что исходные загрузки удаляются после обработки, а готовые файлы — через ограниченное время. Это не отменяет оценки риска: условия сервиса не превращают облачную обработку в подходящий вариант для секретных или персональных документов. Если важна конфиденциальность, выбирайте локальную программу.

Способ 8. Aconvert: TXT с опцией OCR для скана

Aconvert позволяет выбрать TXT как целевой формат и содержит опцию OCR для сканированных PDF. Это полезно для разовой обработки неконфиденциального скана, когда локального распознавателя нет. Качество всё равно зависит от разрешения, поворота, языка и структуры страниц.

  1. Перейдите в раздел работы с PDF и загрузите файл с устройства либо из разрешённого источника.
  2. В поле Target format выберите TXT.
  3. Если документ является сканом, включите опцию Use OCR for scanned PDF и укажите язык распознавания. Для текстового PDF OCR обычно не нужен: повторное распознавание может внести новые ошибки.
  4. Нажмите Convert Now и дождитесь появления строки в разделе Conversion Results.
  5. Скачайте TXT кнопкой в колонке действий. Сразу переименуйте случайное серверное имя в понятное, сохранив расширение .txt.
  6. Проверьте кириллицу, цифры, символы валют, дефисы, кавычки и порядок колонок. При системных ошибках повторите OCR с правильным языком или используйте локальную программу с ручными зонами.
Выбор TXT в поле Target format сервиса Aconvert
В раскрытом списке Target format выделен TXT.
Запуск конвертации PDF в TXT на Aconvert
PDF загружен, выбран TXT и выделена кнопка Convert Now.
Результат конвертации PDF в TXT на Aconvert
В разделе Conversion Results отображается готовый TXT и кнопка загрузки.

Как выбрать кодировку TXT и не получить «кракозябры»

Кодировка определяет, какие байты соответствуют буквам и знакам. PDF и TXT решают эту задачу по-разному: в PDF символ может ссылаться на встроенный шрифт и внутреннюю таблицу, а TXT хранит последовательность кодов. Ошибка выбора проявляется сразу: «РџСЂРёРІРµС‚», квадраты, вопросительные знаки или исчезнувшие буквы.

Когда выбирать UTF-8

UTF-8 — базовый выбор для русского, английского и смешанного текста. Он поддерживает кириллицу, большинство математических знаков, типографские кавычки, длинное тире и символы разных языков в одном файле. Современные редакторы, браузеры и языки программирования обычно распознают UTF-8 автоматически. Если принимающая система не предъявляет отдельное требование, сохраняйте именно так.

Когда может понадобиться Windows-1251

Старая бухгалтерская, архивная или производственная программа иногда принимает только Windows-1251. Выбирайте её лишь по явной документации или после теста. Такая кодировка не подходит для смешанных алфавитов и части специальных символов. Если документ содержит русский, польский, греческий и формулы одновременно, часть знаков может быть потеряна без возможности восстановления из готового TXT.

UTF-8 с BOM и без BOM

BOM — служебная метка в начале файла. Она помогает некоторым старым программам определить UTF-8, но иногда воспринимается как лишний невидимый символ перед первой строкой. Для импорта в скрипты и современные системы чаще подходит UTF-8 без BOM; для старого Windows-приложения может потребоваться вариант с BOM. Проверяйте не по внешнему виду, а по требованиям системы-получателя.

Проверка кодировки

  1. Откройте TXT в редакторе, который показывает текущую кодировку.
  2. Найдите строку с кириллицей, кавычками, тире, буквой «ё», знаком номера, процентом и, если есть, символом валюты.
  3. Закройте и откройте файл заново. Ошибка иногда появляется только после повторного чтения с автоматическим определением.
  4. Если текст искажён, не сохраняйте его поверх исходного TXT: откройте копию с другой кодировкой и сравните.
  5. Для автоматической загрузки создайте маленький тестовый файл и проверьте его в целевой системе до обработки сотен страниц.
Симптом Вероятная причина Действие
Пример вместо кириллицы UTF-8 ошибочно прочитан как однобайтовая кодировка Переоткрыть как UTF-8, не перекодируя повреждённый текст повторно
Кириллица заменена вопросительными знаками Файл уже сохранён в кодировке без нужных символов Вернуться к исходному PDF/TXT и повторить экспорт в UTF-8
Квадраты вместо отдельных знаков Шрифт редактора не содержит глифы либо символы потеряны Сменить шрифт; если коды отсутствуют — повторить распознавание
Лишний символ в начале первой строки BOM прочитан как обычные данные Сохранить UTF-8 без BOM для этой системы
Русский читается, а греческий нет Выбрана Windows-1251 Использовать UTF-8 и повторить экспорт из исходника

Диапазоны страниц, отдельные файлы и понятные имена

Экспорт всего PDF удобен не всегда. В документе могут быть приложения, титульные листы, пустые страницы и сканы, которые требуют другого языка OCR. Разделение диапазонов снижает время обработки и упрощает контроль. Главное — не перепутать физическую позицию страницы с напечатанным номером.

  • Один общий TXT. Подходит для чтения, поиска и загрузки в корпус. Добавляйте между страницами явный разделитель, если программа это позволяет.
  • Один TXT на страницу. Подходит для архива, OCR-контроля и пакетного анализа. Используйте имена с ведущими нулями.
  • Диапазоны по разделам. Удобны для книги: предисловие, главы, приложения. Имя должно содержать диапазон и название раздела.
  • Смешанный PDF. Текстовые страницы экспортируйте напрямую, сканы — через OCR. Затем объединяйте результаты только после проверки порядка.
  • Выборочные страницы. Если программа не умеет задавать диапазон для TXT, создайте временную копию PDF только с нужными страницами.

Для последующей автоматизации избегайте пробелов, кавычек и случайных окончаний вроде «новый (7)». Практичный шаблон: project_section_p001-020_ru_utf8.txt. Он сообщает источник, диапазон, язык и кодировку. Не включайте в имя персональные данные, если файл будет отправляться или храниться в общей папке.

Как исправить порядок чтения, переносы и служебные строки

Две колонки перемешались

Автоматический конвертер может читать строку слева, затем строку справа, хотя человек сначала читает всю левую колонку. Для исправления используйте OCR-редактор с отдельными зонами и заданным порядком. Если страниц мало, экспортируйте каждую колонку отдельно. Простая замена переводов строк не исправит уже перемешанные предложения.

Каждая визуальная строка стала отдельным абзацем

PDF часто хранит текст по строкам, потому что для отображения важны координаты, а не логические абзацы. После экспорта можно объединять строки, если предыдущая не заканчивается точкой, вопросительным или восклицательным знаком, а следующая начинается со строчной буквы. Это лишь эвристика: списки, стихи, адреса, программный код и библиографические записи требуют сохранения строк.

Слова разорваны переносами

Удаляйте дефис на границе строк только когда обе части образуют одно слово. Не трогайте дефисы в фамилиях, диапазонах, сложных словах и идентификаторах. Для русского текста полезно проверять сочетание по словарю, но словарь тоже ошибается на терминах и названиях. Сохраняйте исходный TXT, а очистку выполняйте в копии.

Колонтитул повторяется на каждой странице

Найдите строки, которые повторяются с одинаковым или почти одинаковым текстом через равные интервалы. Номер страницы меняется, поэтому шаблон может включать постоянную часть и число. Удаляйте повтор только после проверки: название главы в верхнем колонтитуле иногда несёт полезный контекст. Для юридического документа лучше оставить колонтитулы и отметить их отдельным префиксом.

Таблица потеряла столбцы

В TXT столбцы можно имитировать табуляциями или разделителями. Множественные пробелы ненадёжны: пропорциональный шрифт показывает их неравномерно, а программы могут схлопывать. Для машинной обработки используйте табуляцию, точку с запятой или другой согласованный разделитель и экранируйте его внутри значений. Если структура важнее простоты, экспортируйте таблицу в CSV/XLSX, а текстовые абзацы — отдельно.

Сноски попали в середину абзаца

Это ошибка порядка чтения. В OCR-программе вынесите область сносок после основного текста страницы. При прямом экспорте можно собрать сноски отдельно по устойчивым маркерам и перенести в конец раздела. Не удаляйте номера автоматически: одинаковые цифры могут быть частью формулы или ссылки.

OCR для скана: параметры, от которых зависит точность

Параметр Практическая настройка Типичная ошибка
Разрешение Около 300 dpi для обычного печатного текста; больше не всегда лучше Слишком низкое разрешение сливает штрихи, чрезмерное увеличивает шум и время
Язык Выбрать реальные языки страницы Слишком широкий список повышает число похожих замен
Ориентация Повернуть страницу до распознавания OCR читает строки боком или создаёт случайные символы
Перекос Выпрямить линии текста Буквы на краях строк распознаются хуже
Контраст Убрать серый фон, не стирая тонкие штрихи Агрессивная очистка уничтожает точки, запятые и диакритику
Зоны Разделить текст, таблицы, картинки и колонки Одна большая зона перемешивает порядок
Диапазон Сначала тестовые страницы, затем весь файл Неверная настройка применяется к сотням страниц

Для многоязычного скана оценивайте страницы отдельно. Русско-английская инструкция может распознаваться одним набором языков, а приложение с немецкими именами — другим. При выборе языка обращайте внимание не только на буквы, но и на словари: корректный язык помогает различать похожие сочетания и восстанавливать слова, однако не должен самовольно «исправлять» коды, артикулы и фамилии.

После OCR не ограничивайтесь беглым чтением. Сформируйте набор контрольных символов: 0/O, 1/l/I, 5/S, 8/B, кириллические «с/е/о/р/х» и похожие латинские буквы, дефис и минус, кавычки, десятичная запятая, знак процента. Для финансовых и технических документов проверяйте все числа или применяйте двойной контроль другим человеком.

OCR не восстанавливает смысл автоматически

Даже качественное распознавание может дать грамматически правдоподобное, но неверное слово. Поэтому орфографическая проверка дополняет, а не заменяет сравнение с изображением. Особое внимание требуется именам, адресам, формулам, серийным номерам и значениям в таблицах.

Как проверить готовый TXT

  1. Откройте файл повторно. Так проверяется реальная кодировка, а не временное отображение в программе-экспортёре.
  2. Сравните начало и конец. Обрыв последней страницы часто остаётся незамеченным.
  3. Проверьте редкое слово. Найдите его в PDF и TXT; совпадение подтверждает, что поиск и символы работают.
  4. Сверьте контрольные страницы. Используйте страницу с обычным текстом, колонками, таблицей и специальными знаками.
  5. Посчитайте объём. Нулевой или подозрительно маленький файл указывает на скан без OCR либо ошибку экспорта.
  6. Проверьте порядок. Заголовок должен находиться перед своим абзацем, сноска — после ссылки, а вторая колонка — после первой.
  7. Проверьте переносы. Отличайте настоящий новый абзац от визуального конца строки.
  8. Сохраните журнал параметров. Запишите программу, дату, диапазон, кодировку и языки OCR.

Минимальная выборочная проверка

Для обычного документа проверяйте не меньше пяти точек: первая страница, последняя, случайная страница из первой трети, страница из середины и страница со сложной структурой. Для скана добавьте страницы с худшим качеством, штампами и мелким шрифтом. При пакетной обработке лучше автоматически сравнивать число страниц, размер результатов и наличие пустых файлов, а затем вручную просматривать выбросы.

Типичные ошибки и точные способы исправления

TXT пустой или содержит несколько строк

Причина. PDF состоит из изображений либо текстовый слой отсутствует. Проверка. Попробуйте выделить слово и выполнить поиск. Если это невозможно, запустите OCR с правильным языком. Исправление. После OCR повторите экспорт и сравните объём с тестовой страницей.

Вместо русских букв появились латинские сочетания

Причина. Файл открыт не в той кодировке. Проверка. Откройте копию как UTF-8. Не сохраняйте искажённый текст поверх исходного. Исправление. Если повторное открытие не помогает, экспортируйте заново с явным выбором UTF-8.

Только часть страниц попала в результат

Причина. В конвертере задан диапазон, обработка прервана или некоторые страницы защищены/повреждены. Проверка. Сверьте диапазон, журнал задания и последнюю строку TXT. Исправление. Обработайте пропущенный диапазон отдельно и не склеивайте файлы до проверки.

Абзацы идут в неправильном порядке

Причина. Страница содержит колонки, плавающие блоки или неверную структуру чтения. Проверка. Проведите выделением по странице и посмотрите последовательность. Исправление. Используйте OCR-зоны или экспортируйте колонки по отдельности.

Каждая строка заканчивается переносом

Причина. Конвертер воспроизвёл визуальные строки PDF. Проверка. Включите отображение непечатаемых символов и отличите строки от абзацев. Исправление. Объединяйте строки по правилам пунктуации в копии результата.

Слова разорваны дефисом

Причина. В PDF использован перенос по ширине колонки. Проверка. Сравните конец строки с началом следующей. Исправление. Удаляйте только переносные дефисы, сохраняя смысловые дефисы и минусы.

Таблица стала нечитаемой

Причина. TXT не хранит ячейки и границы. Проверка. Проверьте, можно ли представить столбцы табуляциями. Исправление. Для структурированных данных повторите экспорт в CSV/XLSX.

Повторяются заголовки и номера страниц

Причина. Колонтитулы извлечены как обычный текст. Проверка. Найдите устойчивые повторяющиеся строки. Исправление. Удалите их по проверенному шаблону или пометьте как служебные.

OCR путает 0 и O, 1 и l

Причина. Скан размыт, мелкий или выбран неверный язык. Проверка. Увеличьте страницу и сравните спорные символы. Исправление. Повторите OCR после выравнивания/очистки и проверьте критические значения вручную.

Часть символов превратилась в квадраты

Причина. Редактор не отображает глифы либо символы потеряны при сохранении. Проверка. Смените шрифт и откройте файл в другом редакторе. Исправление. Если кодов нет, вернитесь к исходнику и экспортируйте в Unicode.

Конвертер сообщает об ошибке файла

Причина. PDF повреждён, зашифрован или содержит нестандартные объекты. Проверка. Откройте копию в другом просмотрщике и попробуйте сохранить новую копию. Исправление. Если ошибка сохраняется, запросите исходный документ заново.

Онлайн-сервис завис на загрузке

Причина. Файл слишком велик, соединение нестабильно или действует лимит сервиса. Проверка. Проверьте размер и попробуйте небольшой диапазон. Исправление. Разделите копию PDF или используйте локальную программу.

Word изменил порядок элементов

Причина. Импорт PDF реконструировал макет как редактируемый документ. Проверка. Просмотрите страницы до сохранения TXT. Исправление. Переставьте блоки вручную или выберите OCR-редактор с зонами.

Calibre добавил лишние служебные строки

Причина. Метаданные книги и колонтитулы вошли в поток текста. Проверка. Найдите повторяющиеся элементы в начале глав. Исправление. Очистите копию TXT после сравнения с PDF.

После OCR исчезли точки и запятые

Причина. Слишком агрессивная очистка фона или низкое разрешение. Проверка. Сравните скан до и после предобработки. Исправление. Ослабьте фильтрацию и повторите распознавание.

Смешались кириллица и похожая латиница

Причина. OCR выбрал неверный алфавит для отдельных букв. Проверка. Проверьте слова с е/е, о/o, р/p, с/c, х/x. Исправление. Ограничьте языки и выполните поиск-замену только по подтверждённым шаблонам.

Номера страниц не совпадают

Причина. Позиция листа в PDF отличается от напечатанной нумерации. Проверка. Сопоставьте миниатюры, обложку и внутренние номера. Исправление. Именуйте диапазоны по физическим позициям и фиксируйте соответствие.

TXT открывается, но импорт в систему падает

Причина. Система ждёт другую кодировку, окончания строк или разделитель. Проверка. Изучите требования импорта на маленьком тестовом файле. Исправление. Преобразуйте копию в нужную кодировку и формат переводов строк.

Дополнительные варианты и когда они уместны

Универсальная схема большинства настольных конвертеров одинакова: добавить PDF, выбрать TXT, задать папку и запустить обработку. Например, PDFMate использует именно такую последовательность. Это не означает, что все приложения одинаково работают со сканами: наличие формата TXT не подтверждает OCR. Перед установкой проверяйте, заявлено ли распознавание, можно ли выбрать язык и диапазон, и как программа обрабатывает многостраничный документ.

Google Документы могут открыть PDF через облачное хранилище и сформировать редактируемый документ, после чего текст сохраняется в обычном формате. Такой путь иногда помогает с простым сканом, но результат зависит от облачного OCR и порядка блоков. Он не подходит для конфиденциальных файлов и не гарантирует сохранение таблиц. Smallpdf, PDF2TXT и другие веб-инструменты удобны для разовой задачи, но требуют той же проверки кодировки, диапазона, приватности и результата, что Convertio и Aconvert.

Если программа обещает «сохранить исходное форматирование в TXT», трактуйте формулировку осторожно. Она может попытаться воспроизвести отступы пробелами, но плоский текст всё равно не хранит шрифты, изображения и координаты. Чем сложнее страница, тем важнее пробный экспорт и выбор формата, соответствующего реальной цели.

Часто задаваемые вопросы

Можно ли сохранить изображения и таблицы в TXT?

Изображения — нет. Таблица может превратиться в строки с пробелами или табуляциями, но границы, объединённые ячейки и оформление потеряются. Для таблиц выбирайте CSV/XLSX, для текста с оформлением — DOCX/RTF.

Почему текст выделяется, но после экспорта получается мусор?

В PDF может быть неверная таблица соответствия символов встроенного шрифта. Внешне буквы выглядят правильно, но их внутренние коды не соответствуют Unicode. Повторное OCR по изображению страницы часто надёжнее прямого извлечения.

Нужен ли OCR для каждого PDF?

Нет. OCR необходим сканам и файлам с повреждённым или отсутствующим текстовым слоем. Для нормального текстового PDF повторное распознавание может снизить точность и изменить символы.

Какую кодировку выбрать для русского текста?

Обычно UTF-8. Windows-1251 выбирайте только для старого приложения, которое явно её требует. После сохранения обязательно закройте и снова откройте TXT.

Как перевести только несколько страниц?

Задайте диапазон в конвертере или создайте временную копию PDF только с нужными страницами. В имени TXT укажите физические позиции страниц.

Можно ли конвертировать подписанный PDF?

Можно извлечь текст из копии, если права доступа это разрешают, но TXT не содержит цифровую подпись и не доказывает подлинность. Исходный подписанный PDF нужно хранить отдельно и не изменять.

Что делать, если копирование запрещено?

Не обходите ограничение. Запросите у владельца разрешённую версию, пароль или отдельный текстовый файл.

Почему две колонки перемешались?

PDF хранит элементы по координатам и внутреннему порядку, который может не совпадать с визуальным чтением. Настройте OCR-зоны и порядок областей или обрабатывайте колонки отдельно.

Как убрать переносы строк автоматически?

Работайте с копией и используйте правила: объединять строку, если она не заканчивает предложение и следующая начинается со строчной буквы. Для списков, стихов, адресов и кода автоматическое объединение отключайте.

Онлайн-конвертер безопасен?

Он требует отправки файла внешней стороне. Даже при заявленном удалении не загружайте секретные, медицинские, финансовые и персональные документы. Для них используйте локальную обработку.

Почему TXT весит намного меньше PDF?

PDF содержит шрифты, изображения, разметку, метаданные и другие объекты. TXT хранит в основном символы и переводы строк, поэтому обычно занимает значительно меньше места.

Как проверить качество OCR большого файла?

Выберите контрольные страницы из начала, середины, конца и участков с худшим качеством. Отдельно проверяйте числа, имена, адреса, формулы и похожие символы. Для критических данных нужен полный или двойной контроль.

Можно ли сохранить один TXT на каждую страницу?

Да, если программа предоставляет такую опцию. Это удобно для архива и пакетной проверки. Используйте ведущие нули в именах, чтобы сортировка сохраняла порядок.

Чем TXT отличается от RTF?

TXT содержит только символы и простые разделители строк. RTF может хранить шрифты, размеры, выделение и часть структуры. Если оформление важно, TXT не подходит.

Как понять, что файл повреждён?

Он открывается не во всех просмотрщиках, выдаёт ошибки при переходе по страницам, имеет пустые миниатюры или обрывается при экспорте. Работайте с копией и по возможности запросите исходник заново.

Итоговый рабочий алгоритм

  1. Сделайте копию PDF и определите, выделяется ли текст.
  2. Для текстового файла используйте прямой экспорт; для скана — OCR с правильным языком и зонами.
  3. Сначала обработайте несколько контрольных страниц.
  4. Выберите UTF-8, если другая кодировка не требуется явно.
  5. Определите диапазон и способ разделения страниц.
  6. Сохраните TXT под новым понятным именем.
  7. Закройте и заново откройте результат.
  8. Сверьте символы, числа, абзацы, порядок колонок и последнюю страницу.
  9. Храните исходный PDF отдельно: TXT не заменяет подписанный документ, макет и изображения.

Для обычного текстового PDF самый короткий путь — прямой экспорт в PDF Commander или Acrobat. Для скана ключевым этапом становится OCR в FineReader или Acrobat с языком, диапазоном и проверкой сомнительных символов. Calibre, Word и Epubor полезны для последовательных книг и офисных документов, а браузерные сервисы — только для неконфиденциальных разовых задач. Независимо от инструмента качество подтверждает не сообщение «готово», а повторное открытие TXT и сравнение с исходными страницами.

Контрольные сценарии перед массовой конвертацией

Книга на 300 страниц

Проверьте оглавление, начало трёх глав, страницу с иллюстрацией и конец. Убедитесь, что колонтитулы не смешиваются с абзацами, а названия глав стоят перед текстом. Для повторяющихся ошибок настройте очистку один раз и применяйте её только к копии.

Скан договора

Выберите русский и английский языки, если присутствуют реквизиты латиницей. Сверьте суммы, даты, номера пунктов, ФИО и адреса. Не удаляйте подписи и печати из исходного PDF: в TXT они всё равно не переносятся.

Техническое руководство

Проверьте обозначения единиц, минусы, греческие буквы, индексы и кодовые блоки. Обычный текст может потерять верхние и нижние индексы, поэтому формулы лучше хранить вместе с PDF или в отдельной разметке.

Журнал с двумя колонками

Проверьте порядок чтения на каждой разновидности страницы: статья, реклама, оглавление, разворот. Автоматический порядок часто отличается. Используйте зоны или экспорт колонок по отдельности.

Анкета или форма

Сверьте, попали ли значения заполненных полей. Пустые подписи полей и ответы могут идти отдельно. Для дальнейшего анализа создайте явные пары «поле: значение».

Архив газет

Перед OCR выровняйте перекос и уменьшите фон, но не стирайте тонкие засечки. Старые шрифты и дефекты бумаги требуют больше ручной проверки. Сохраняйте отдельные файлы по страницам для привязки к изображению.

Смешанный русско-английский отчёт

Используйте Unicode и оба языка OCR. Проверьте похожие буквы разных алфавитов. Для кодов и адресов электронной почты отключайте агрессивную словарную коррекцию, если программа это позволяет.

PDF из презентации

Ожидайте фрагментарный порядок: заголовки, подписи и текстовые блоки размещены независимо. TXT подходит для извлечения тезисов, но не для восстановления логики слайда без ручной перестановки.

Каталог с ценами

Не полагайтесь на пробелы как на столбцы. Если нужны товар, артикул и цена, экспортируйте таблицу в структурированный формат либо создайте разделитель и проверьте каждую строку.

Документ для программного анализа

Зафиксируйте кодировку, окончание строк, разделитель страниц и правила очистки. Сохраните исходный необработанный TXT и отдельную нормализованную версию, чтобы можно было воспроизвести результат.

Судебное дело с нумерованными листами

Сохраняйте привязку к физическим страницам PDF и не полагайтесь только на напечатанную нумерацию. Перед экспортом составьте таблицу соответствия: позиция в файле, номер листа дела, заголовок документа. В TXT ставьте явный разделитель страницы и не удаляйте повторяющиеся реквизиты до завершения сверки. Фамилии, даты, номера дел и суммы проверяйте по изображению, потому что даже единичная ошибка OCR меняет смысл. Подписанный или заверенный PDF храните неизменным: текстовый файл служит поисковой копией, а не доказательством подлинности.

Учебник с формулами

Плоский текст плохо передаёт дроби, индексы, матрицы и расположение символов. До массовой обработки решите, что важнее: извлечь объяснительные абзацы или сохранить математическую запись. Формулы можно заменять маркерами вида [ФОРМУЛА, стр. 27] и хранить вместе с PDF. При OCR отдельно проверяйте минус и тире, латинские и греческие буквы, верхние индексы и знак умножения. Не пытайтесь автоматически «исправить» формулу по орфографическому словарю: для него технические обозначения выглядят как ошибки.

Отчёт с диаграммами и подписями

TXT извлечёт заголовки, легенды и подписи, но не сохранит связь с графическими элементами. Если текст нужен для анализа, добавляйте маркеры [ДИАГРАММА 1] и оставляйте подпись рядом. Проверьте порядок: легенда может попасть раньше заголовка, а подпись оси — в середину абзаца. Для каждой страницы с графиком сравните итог вручную. Числа на изображении без текстового слоя требуют OCR, однако распознавание по цветному фону часто хуже, чем по обычной странице; при необходимости обрабатывайте область отдельно.

Бланк с рукописными ответами

Обычный OCR рассчитан прежде всего на печатный текст и может не распознать рукописные записи. Сначала извлеките подписи полей и печатную часть, затем пометьте рукописные области как требующие ручного ввода. Не выдавайте пустую строку за пустой ответ: возможно, запись просто не распознана. Для контроля используйте пары «поле — значение — страница» и отмечайте степень уверенности. Подписи людей не переводите в текст автоматически и не используйте TXT как замену исходному изображению.

Счёт или накладная

Критичны цифры, десятичные разделители, НДС, артикулы и итоговые суммы. После OCR проверьте равенство промежуточных и итоговых значений, но не считайте арифметическую проверку доказательством правильности каждой позиции. Табличную часть лучше сохранять в CSV или XLSX; TXT можно использовать для реквизитов и примечаний. Символы 0/O, 1/I/l и 5/S проверяйте во всех идентификаторах. Если документ содержит QR-код или штрихкод, он не переносится в TXT и должен храниться отдельно.

Протокол собрания

Для протокола важен порядок реплик, пунктов и решений. Проверьте, что номера пунктов не отделились от текста, а подписи участников не попали в середину предыдущего абзаца. При наличии колонок «слушали — выступили — решили» плоский экспорт может смешать блоки; лучше задать зоны или преобразовать документ в таблицу. В итоговом TXT оставляйте явные метки разделов и страницы. Исправления выполняйте в копии и фиксируйте, какие строки были объединены вручную.

Научная статья со сносками

Сноски и ссылки часто имеют отдельный порядок чтения. Перед экспортом выберите стратегию: оставлять сноску на странице после основного текста или переносить все примечания в конец. Сохраняйте номера сносок и проверяйте, что они не смешались с показателями степени. Библиографические записи не объединяйте по правилам обычных абзацев: каждая строка может иметь собственную структуру. DOI, латинские фамилии, дефисы и диапазоны страниц проверяйте отдельно.

Каталог товаров с несколькими языками

Выберите все реальные языки OCR и сохраните результат в UTF-8. Названия брендов и модели не следует исправлять по общему словарю: распознаватель может заменить редкий артикул на знакомое слово. Для табличной части задайте устойчивый разделитель и проверьте, что он не встречается внутри описаний. Сопоставляйте каждую строку по артикулу, а не только по позиции, поскольку порядок товаров может измениться после распознавания колонок.

Архив писем

Письма могут содержать машинописный текст, рукописные пометки, штампы и просвечивание обратной стороны. Для каждого типа страницы подберите отдельные параметры очистки. Сохраняйте дату, отправителя, получателя и номер листа в явном заголовке TXT. Не удаляйте повторяющиеся формулы приветствия автоматически: они помогают разделять документы. Неразборчивые слова помечайте квадратными скобками, не подставляя догадку без отметки.

Инструкция с предупреждениями в боковых блоках

Боковая рамка может читаться до, после или внутри основного шага. В OCR-редакторе задайте её отдельной зоной и поставьте рядом с тем шагом, к которому она относится. В TXT используйте маркер «ПРЕДУПРЕЖДЕНИЕ» или «ПРИМЕЧАНИЕ», иначе важная информация растворится среди строк. Проверяйте нумерацию действий, подписи кнопок и сочетания клавиш. Иллюстрации интерфейса храните вместе с PDF, потому что текстовая версия не показывает расположение элементов.

Документ с печатями и водяными знаками

Фоновые надписи могут распознаться как обычный текст и повторяться на каждой странице. Сначала определите, несёт ли водяной знак смысл: отметка «Копия» или «Черновик» важна и не должна исчезать. Декоративный фон можно исключить из OCR зоной изображения. Печать и подпись не переносятся в TXT; рядом допустимо поставить нейтральный маркер [ПЕЧАТЬ] или [ПОДПИСЬ], если это нужно для навигации, но исходный вид подтверждается только PDF.

Документ с вертикальным текстом

Подписи на полях, корешке или оси графика могут иметь поворот 90 градусов. Автоматический порядок часто ставит их в случайное место. Определите, нужны ли эти подписи в итоговом тексте; если да, распознайте их отдельной зоной с правильной ориентацией и вставьте в логическое место. Не поворачивайте всю страницу ради одного блока. После экспорта найдите все короткие одиночные строки: среди них часто скрывается вертикальный текст.

Файл с вложениями и комментариями

TXT обычно извлекает содержимое страницы, но не гарантирует перенос вложенных файлов, всплывающих комментариев и аннотаций. Перед конвертацией проверьте панель вложений и комментариев. Если они относятся к задаче, экспортируйте их отдельно и добавьте в текст явные маркеры с автором, датой и страницей. Не смешивайте комментарий рецензента с основным текстом без обозначения: это создаёт ложное впечатление, что замечание было частью исходного документа.

PDF, созданный из веб-страницы

Внутренний порядок может следовать структуре HTML, а не визуальному расположению. Меню, боковая колонка, хлебные крошки и футер иногда попадают между абзацами статьи. Сначала найдите повторяющиеся элементы и отделите основное содержимое. Ссылки в TXT теряют кликабельность, поэтому при необходимости сохраняйте адрес после текста ссылки в скобках. Для длинной страницы проверяйте, не разорвались ли списки на границах печатных страниц.

Скан с сильным перекосом

До OCR выровняйте строки, но не обрезайте буквы у края. Проверьте четыре угла страницы и поля после автоматической коррекции. Перекос влияет не только на распознавание символов, но и на разделение строк: соседние строки могут слиться. Сначала обработайте одну худшую страницу и сравните несколько вариантов. Если программа исправляет перспективу, убедитесь, что таблицы не деформировались и номера в крайних столбцах сохранились.

Фотография документа с телефона

Исправьте перспективу, тени и неравномерное освещение. Блики могут полностью скрыть символы, а алгоритм контраста — превратить тень в ложные буквы. Перед OCR обрежьте фон стола, но оставьте поля документа. Для многостраничного набора приведите все снимки к одной ориентации и порядку. Низкокачественную страницу лучше переснять, чем пытаться восстанавливать важные цифры по сомнительному распознаванию.

Документ с мелким шрифтом

Увеличение изображения само по себе не добавляет деталей. Если исходное разрешение низкое, интерполяция лишь размывает края. Ищите более качественный PDF или сканируйте заново. При распознавании выбирайте реальный язык и минимальную очистку, чтобы не исчезли точки над буквами и знаки препинания. Контроль выполняйте на строках с самым мелким кеглем, а не только на крупном заголовке.

Многофайловая партия

Создайте единый шаблон имён, отдельную папку исходников, результатов и журнала. До запуска всей партии обработайте по одному представителю каждого типа: текстовый PDF, скан, две колонки, таблица. Автоматически фиксируйте размер TXT и предупреждайте о нулевых или аномально маленьких файлах. Не объединяйте результаты разных документов без разделителей. После обработки выберите случайную выборку и все выбросы для ручной проверки.

Документ с нумерованными списками

Проверьте, что номер и текст пункта остаются в одной логической строке. OCR может принять маркер «1.» за букву, а многоуровневые списки — потерять отступ. В TXT используйте явную иерархию: 1, 1.1, 1.1.1 или табуляции. Не выравнивайте список множественными пробелами. Если номера используются как ссылки внутри документа, сохраните их без перенумерации.

Словарь или указатель

Две и более колонки, короткие статьи и частые сокращения создают высокий риск перемешивания. Распознавайте колонки раздельно и сохраняйте каждую словарную статью с новой строки. Не объединяйте строки по обычной пунктуационной эвристике: определение может намеренно продолжаться с отступа. Алфавитный порядок помогает контролю — резкий переход назад часто указывает на ошибку чтения колонок.

Юридический акт с приложениями

Основной текст, приложения и формы могут требовать разных способов. Сначала сформируйте карту разделов и диапазонов. Приложение с таблицей не стоит принудительно превращать в тот же поток, что и статьи закона. Сохраняйте номера статей, частей, пунктов и подпунктов; не удаляйте повторяющиеся заголовки до проверки ссылок. Официальной версией остаётся исходный документ, а TXT используется для поиска и анализа.

Скан с просвечиванием оборота

Фоновые строки создают ложные символы и мешают сегментации. Попробуйте режим удаления фона или сканирование заново с подложкой, но сравните, не исчезли ли тонкие элементы лицевой стороны. Выберите небольшой участок с сильным просвечиванием и оцените количество ошибок. При ручной очистке не ретушируйте смысловые штрихи. Для архивного материала сохраняйте исходное изображение без изменений.

Документ с нестандартным шрифтом

Прямое извлечение может дать неверные коды, даже если страница выглядит нормально. Скопируйте редкое слово и сравните с видимым. Если результат бессмысленный, выполните OCR по изображению, а не пытайтесь заменить символы вслепую. Проверьте лигатуры, кавычки, длинное тире и буквы с диакритикой. Для исторических шрифтов может понадобиться ручная проверка каждой строки.

Текст с программным кодом

Не применяйте автоматическое объединение строк и орфографическую коррекцию. Отступы, регистр, обратные слэши, кавычки и табуляции имеют значение. OCR часто путает фигурные и круглые скобки, ноль и букву O. Если код присутствует как изображение, лучше перепроверить его компиляцией или тестом, но не считать успешный запуск доказательством полного совпадения. Храните исходный фрагмент страницы рядом.

Резюме или анкета с боковой колонкой

Контактные данные, навыки и даты могут находиться в узкой боковой колонке, которую конвертер вставит в середину основной истории. Определите желаемый порядок заранее: заголовок, контакты, опыт, образование, навыки. Для каждой зоны задайте собственную последовательность. После экспорта проверьте адреса электронной почты, телефоны, даты и названия организаций; OCR особенно часто ошибается в коротких кодовых строках.

Документ с цветным фоном

Цвет снижает контраст отдельных каналов. Перевод в оттенки серого иногда улучшает OCR, но может уничтожить светлый текст на цветной плашке. Тестируйте несколько режимов на одной странице и сохраняйте исходник. Разделяйте обычный чёрный текст и инвертированные белые надписи на тёмном фоне. В результате проверьте все заголовки на плашках: они часто пропускаются полностью.

Сборник нескольких документов

Между документами нужны явные границы, иначе конец одного письма соединится с началом другого. Используйте заголовок с именем исходного файла, диапазоном страниц и, при наличии, датой. Не полагайтесь только на пустую строку. Для каждого вложенного документа сохраняйте собственный язык OCR и тип обработки. Итоговую сборку выполняйте после индивидуальной проверки частей.

Материал для поискового индекса

Сохраняйте необработанный TXT и нормализованную версию отдельно. В нормализованной копии можно унифицировать пробелы, переносы и регистр, но нельзя терять связь со страницами. Добавляйте маркеры страниц или отдельное поле метаданных. Проверяйте, что очистка не склеила слова и не удалила значимые дефисы. Для воспроизводимости храните версию программы и параметры.

Документ с персональными данными

Выбирайте локальный инструмент и ограничивайте доступ к рабочей папке. Не помещайте ФИО, номер документа или диагноз в имя файла. После завершения удаляйте временные копии согласно правилам организации, но сохраняйте необходимый журнал без раскрытия содержания. TXT проще копировать и индексировать, поэтому риск утечки может быть выше, чем у исходного защищённого PDF. Не отправляйте результат через неразрешённые каналы.

Материал для цитирования

TXT удобен для поиска, но не сохраняет точную пагинацию и оформление. Каждую цитату сверяйте с исходным PDF и указывайте страницу по оригиналу. Не цитируйте по порядковому номеру строки в TXT. Если были удалены переносы и колонтитулы, храните описание преобразований. Для спорного фрагмента сохраняйте изображение страницы или ссылку на исходный файл внутри рабочей системы.

Финальная приёмка текстового файла

Сверка полноты

Сопоставьте не только первую страницу, но и границы разделов, последнюю страницу и участки после крупных изображений. Конвертер может корректно обработать начало, а затем пропустить блок из-за повреждённого объекта или неожиданной ориентации. Проверьте, что в результате присутствуют все заголовки верхнего уровня, приложения и заключительный абзац. Если страницы выгружались отдельными файлами, сравните их количество с выбранным диапазоном и убедитесь, что нумерация не имеет пропусков или дублей.

Сверка символов

Выберите контрольную строку с кириллицей, латиницей, цифрами, кавычками, тире, дефисом, знаком процента и буквой «ё». Для технического текста добавьте единицы измерения, индексы и греческие символы. Такая строка быстрее показывает проблему кодировки или OCR, чем случайное чтение обычного абзаца. Проверяйте символы после повторного открытия файла и в той программе, куда TXT будет импортирован: разные редакторы могут по-разному определять кодировку.

Сверка структуры

Просмотрите начало каждого раздела и место перехода между страницами. Заголовок должен предшествовать своему тексту, нумерованный пункт — оставаться рядом с номером, а примечание — не разрывать предложение. Отдельно проверьте страницы с двумя колонками, таблицами, боковыми блоками и сносками. Если структура нарушена, исправляйте не только итоговый TXT: по возможности вернитесь к зонам распознавания и получите воспроизводимый результат.

Сверка чисел и идентификаторов

Для договоров, счетов, отчётов и анкет составьте список критических полей: даты, суммы, проценты, номера документов, телефоны, адреса, артикулы. Сверьте каждое поле с изображением страницы. Автоматическая проверка формата помогает найти подозрительные строки, но не подтверждает правильность значения. Особенно опасны замены 0/O, 1/I/l, 5/S, запятой на точку и дефиса на минус.

Сверка очистки

Если после экспорта удалялись колонтитулы, объединялись строки или исправлялись переносы, сравните очищенную версию с необработанной. Убедитесь, что правило не удалило полезный заголовок главы, не склеило два пункта списка и не изменило составное слово. Храните исходный TXT рядом с нормализованным и фиксируйте применённые операции. Это позволяет повторить процесс и объяснить происхождение результата.

Сверка совместимости

Откройте файл в конечной системе: редакторе, индексаторе, программе анализа или форме импорта. Проверьте кодировку, окончания строк, максимальную длину строки и допустимые разделители. Маленький тестовый файл должен проходить весь путь до запуска массовой обработки. Если система требует старую кодировку, сохраняйте отдельную совместимую копию, а мастер-версию оставляйте в UTF-8.

Сверка безопасности

Проверьте место хранения TXT, права доступа и временные файлы. Плоский текст легко индексируется и копируется, поэтому закрытый PDF после экспорта может стать менее защищённым. Удалите ненужные загрузки и промежуточные копии по правилам организации, не отправляйте результат через случайные сервисы и не включайте персональные данные в имя файла. Исходный документ и рабочий текст должны храниться раздельно, если у них разные требования доступа.

Фиксация результата

Запишите название программы, её версию, дату, диапазон страниц, кодировку, языки OCR и способ разделения страниц. Для важной работы добавьте контрольную сумму файлов и краткое описание ручных исправлений. Такой журнал превращает разовую конвертацию в воспроизводимый процесс: другой человек сможет повторить экспорт, понять различия и проверить, что TXT относится именно к нужной версии PDF.