В Linux программа сканирования — лишь верхний слой цепочки. Между кнопкой «Сканировать» и готовым PDF находятся прошивка устройства, USB- или сетевое подключение, backend SANE либо eSCL/WSD, права доступа, собственно графический фронтенд и, при необходимости, OCR-движок. Поэтому красивое окно не гарантирует, что конкретный сканер увидит автоподатчик, откроет двусторонний режим или отдаст заявленные 600 dpi. Надёжный выбор начинается не с списка функций, а с проверки того, какие возможности реально сообщает системе используемая модель.
Для домашнего планшетного сканера достаточно корректного обнаружения, предпросмотра, выделения области и сохранения одного-двух листов. В офисе требования другие: профиль должен помнить источник ADF, размер A4, 300 dpi, цветовой режим, удаление пустых страниц и порядок сторон; после задания важны перестановка листов, распознавание и сохранение многостраничного PDF. При работе с фотографиями на первый план выходят точный выбор рамки, глубина цвета и ручная коррекция, а не скорость подачи.
Ни одна позиция ниже не получает автоматического преимущества только из-за поддержки Linux. Учитываются способ доступа к устройству, работа с планшетом и автоподатчиком, возможность выбрать одностороннюю или двустороннюю подачу, сохранение профилей, качество предпросмотра и постобработки, пакетная сборка страниц, OCR и предсказуемость экспорта. Там, где функция зависит от backend или аппаратной части, это указано прямо: приложение не может добавить сканеру отсутствующий дуплекс и не заменяет драйвер.
Перед массовым заданием полезно приготовить пять тестовых листов: обычную страницу с мелким текстом, цветной лист с печатью или маркером, страницу с серым фоном, лист с разной ориентацией сторон и чистый лист. Такой набор быстро показывает, правильно ли работает цвет, не режутся ли поля, не переворачивается ли оборот, не создаёт ли алгоритм удаления пустых страниц ложные пропуски и насколько читаемым получается OCR.
Критерии оценки программ для сканирования в Linux
1. Доступ к устройству: SANE, eSCL/WSD и фирменные драйверы
SANE отделяет графическую программу от низкоуровневого backend. Фронтенд запрашивает список устройств и доступных опций, а backend переводит эти запросы в команды конкретного сканера. Из этого следует главное ограничение рейтинга: надпись «работает с SANE» означает совместимость с инфраструктурой, но не обещает поддержку каждой модели. Если backend не знает устройство, любой SANE-фронтенд увидит один и тот же пустой список.
Для сетевых МФУ всё чаще используется driverless-доступ по eSCL, иногда называемый AirScan, или WSD. Он может дать планшет, ADF и дуплекс без фирменного пакета, но только если аппарат публикует соответствующий сервис и сеть не блокирует обнаружение. В сегментированных сетях автоматическое обнаружение через mDNS может не пройти между VLAN; тогда нужен явный адрес или настройка backend. Фирменные пакеты HPLIP, ScanGear MP и Image Scan полезны для поддерживаемых линеек, однако их наличие не превращает программу в универсальный фронтенд.
2. Обнаружение и прозрачная диагностика
Сильная программа показывает не только маркетинговое имя устройства, но и выбранный драйвер или протокол. Это помогает различить два одинаково выглядящих пункта, например USB-вариант через SANE и сетевой вариант через eSCL. Важны понятные сообщения при занятости сканера, обрыве сети, открытой крышке ADF и отсутствии бумаги. Если интерфейс просто бесконечно ищет устройство, диагностику приходится переносить в scanimage.
3. Источник бумаги, ADF и дуплекс
Параметр Source может называться Flatbed, Glass, Feeder, ADF, Automatic Document Feeder, Duplex или Front/Back. Набор значений формирует драйвер. Для аппаратного дуплекса приложение должно выбрать двусторонний источник и правильно принять последовательность изображений. Некоторые модели отдают пары «лицо–оборот», другие сначала все лицевые стороны, затем обороты; качественный фронтенд сохраняет правильный порядок или предлагает режим чередования.
Если аппарат поддерживает только одностороннюю подачу, двусторонний комплект можно собрать вручную: сначала сканируются нечётные стороны, затем пачка переворачивается и проходят чётные. Здесь важна отдельная команда interleave или хотя бы удобная перестановка миниатюр. Обещание «duplex» без уточнения аппаратного или ручного режима вводит в заблуждение, поэтому эти варианты в сравнении разделены.
4. Профили, DPI, цвет и область
Профиль полезен, когда сохраняет всю повторяемую конфигурацию: конкретное устройство, источник, размер бумаги, разрешение, цвет, яркость, контраст, автокадрирование, поворот, пропуск пустых страниц, OCR и шаблон имени. Для текста обычно достаточно 300 dpi в оттенках серого или цвете; 150 dpi уменьшает файл, но ухудшает мелкий шрифт и распознавание. 600 dpi оправдан для мелких деталей и фотографий, но резко увеличивает время, память и размер.
Предпросмотр особенно важен на планшете. Он должен позволять заново задать прямоугольник, не выполняя полный проход всей площади, и показывать фактическую ориентацию. Автокадрирование удобно на контрастном фоне, но его нужно проверять на чеках, тонкой бумаге и страницах с тенями у корешка: алгоритм может обрезать край или принять тень за границу.
5. Пакет страниц и обработка
После получения изображений нужна рабочая область с миниатюрами. Минимальный набор — поворот отдельных листов, удаление дублей, перенос, вставка повторно отсканированной страницы и выбор диапазона при сохранении. Для больших пачек полезны разделители по пустой странице, пакетное выравнивание, очистка фона и устранение перекоса. Эти операции должны быть обратимыми либо выполняться над копией проекта, поскольку агрессивный порог может стереть светлый штамп и карандашные пометки.
6. OCR и экспорт
OCR бывает встроенным, подключаемым или отсутствует. Сам факт наличия Tesseract в системе не означает, что программа умеет формировать поисковый PDF: она может лишь показать распознанный текст или сохранить его отдельно. Для архива важен результат, где исходное изображение остаётся видимым, а невидимый текстовый слой совпадает с координатами слов. Перед сохранением проверяют язык, ориентацию, диапазон страниц и способ обработки уже существующего текста.
Экспорт оценивается отдельно от OCR. Для деловой пачки нужен многостраничный PDF с контролируемым сжатием; для мастер-копии фотографий — TIFF или PNG; JPEG удобен как компактная копия, но повторное сохранение ухудшает мелкие детали. Программа должна ясно различать сохранение текущей страницы, всех страниц и добавление к существующему файлу. Перезапись единственного экземпляра без резервной копии — плохой рабочий процесс независимо от приложения.
Сравнение: SANE, ADF, дуплекс, профили и OCR
| Программа | Доступ к сканеру | ADF и дуплекс | Профили | Обработка страниц | OCR и экспорт | Основное ограничение |
|---|---|---|---|---|---|---|
| PDF Commander | Linux-версия умеет получать сканы; используемый backend публично не конкретизирован | не заявляются без проверки конкретного драйвера и устройства | параметры задаются в диалоге сканирования | кадрирование, поворот, порядок, удаление и добавление страниц | OCR и работа с PDF после получения изображения | нет основания обещать SANE, ADF или аппаратный дуплекс для произвольной модели |
| NAPS2 | SANE и eSCL в Linux | источники Glass, Feeder и Duplex при поддержке устройства | полные именованные профили | миниатюры, поворот, перестановка, пакетное сканирование | поисковый PDF, изображения, OCR через Tesseract | часть опций зависит от backend; сетевое обнаружение требует исправной сети |
| Document Scanner | SANE | подача всех страниц и выбор сторон при доступности параметров | базовые настройки в Preferences | поворот, кадрирование, порядок, удаление | PDF, JPEG и PNG; встроенный OCR не является основной функцией | меньше пакетных и OCR-инструментов, чем у специализированных решений |
| gscan2pdf | SANE через scanimage или scanadf | ADF; ручная сборка двусторонней пачки доступна в подходящих сценариях | параметры сканирования и сеанса | богатая пакетная обработка, миниатюры, импорт | PDF, DjVu, изображения; OCR через внешние движки | много функций зависят от установленных пакетов |
| Skanpage | сканирующий слой KDE поверх поддерживаемых устройств | планшет и ADF, если их сообщает драйвер | настройки задания | перетаскивание, поворот, удаление, многостраничная сборка | многостраничный PDF и изображения; OCR не считаем подтверждённой базовой функцией | набор расширенных опций меньше, чем у gscan2pdf или XSane |
| Skanlite | инфраструктура сканирования KDE/SANE | ориентирован прежде всего на планшет и выбранную область | сохранение настроек и автоименование | предпросмотр, рамка, несколько областей | графические форматы; не заменяет OCR-конвейер | не лучший вариант для длинных офисных пачек |
| XSane | прямой графический фронтенд SANE | показывает источники и batch-опции, которые отдаёт backend | наборы параметров можно сохранять | предпросмотр, область, гистограмма, пакетный список | графические форматы и PDF/PS в доступных режимах; OCR обычно внешний | старый многооконный интерфейс и зависимость от device-specific опций |
| VueScan | собственный слой поддержки и сетевые протоколы для заявленных моделей | аппаратный дуплекс или ручное чередование в поддерживаемых конфигурациях | сохраняемые параметры | кадрирование, цвет, порядок, многостраничный вывод | PDF, TIFF, JPEG и searchable PDF с OCR | платная лицензия; совместимость нужно проверять по модели и пробным сканом |
Проверка сканера до установки графической программы
Первый тест проводится вне рейтингового приложения. Он показывает, существует ли рабочий путь от Linux до устройства. Подключите сканер напрямую, уберите USB-хаб на время диагностики, включите питание и дождитесь окончания самотеста. Для сетевого МФУ проверьте, что компьютер и аппарат находятся в доступных подсетях, а веб-интерфейс устройства открывается по адресу, известному администратору. После этого переходите к командам.
Шаг 1. Отделить обнаружение USB от поддержки сканирования
Команда lsusb подтверждает только присутствие USB-устройства. Утилита sane-find-scanner может найти чип или интерфейс сканера, но также не доказывает, что установлен подходящий backend. Поэтому запись в выводе этих команд — промежуточный результат, а не гарантия работы. Если USB-устройство не видно вообще, проверяют кабель, порт, питание и сообщения ядра; смена графического фронтенда здесь не поможет.
Шаг 2. Получить список SANE-устройств
Выполните scanimage -L. Нормальный ответ содержит строку с идентификатором устройства и его описанием. Этот идентификатор полезно сохранить целиком: разные фронтенды могут сокращать отображаемое имя, а точная строка позволяет понять, какой backend выбран. Пустой вывод означает, что сначала нужно исправить SANE, права или сетевое обнаружение. Устанавливать по очереди пять оболочек в надежде, что одна «увидит» аппарат, нерационально: большинство из них получают один и тот же список.
Шаг 3. Посмотреть реальные опции конкретной модели
Команда scanimage --device-name 'идентификатор' --all-options или сокращённый вариант с --help показывает доступные значения Source, Mode, Resolution, размеры области, batch-параметры и специфические переключатели backend. Именно этот вывод отвечает на вопрос, есть ли ADF и Duplex. Если драйвер предлагает только Flatbed, графическая программа не должна обещать подачу. Если разрешения ограничены 75, 150, 300 и 600 dpi, ввод произвольного 400 dpi может быть отклонён или округлён.
Шаг 4. Выполнить минимальный контрольный проход
Для одного листа можно получить TIFF или PNG через scanimage и открыть файл в обычном просмотрщике. Цель теста — не построить рабочий процесс в терминале, а подтвердить, что backend действительно отдаёт изображение. После успешного прохода графический интерфейс выбирают по удобству профилей, страниц и OCR. Если терминальный тест падает, сообщение ошибки обычно информативнее общего уведомления GUI.
Шаг 5. Отдельно проверить сетевой eSCL/WSD
При driverless-сканировании аппарат публикует сервис, а sane-airscan или встроенная поддержка приложения обнаруживает его. Проверьте, что mDNS не заблокирован локальным файрволом и точкой доступа, а клиентская изоляция Wi‑Fi выключена для рабочего сегмента. В корпоративной сети разумнее согласовать статический адрес или DNS-имя. Даже если протокол предусматривает планшет, ADF и дуплекс, конкретная реализация МФУ может сообщать неполный набор опций; контрольный скан остаётся обязательным.
Шаг 6. Зафиксировать исходную конфигурацию
Запишите модель, способ подключения, идентификатор scanimage, backend, доступные источники, разрешения и успешный формат теста. Эта короткая карточка экономит время при обновлении системы: можно сравнить, что изменилось после новой версии sane-backends, ядра или сетевых правил. Для нескольких одинаковых устройств добавьте серийный номер или адрес, чтобы оператор не отправлял конфиденциальную пачку на чужое МФУ.
1. PDF Commander: сканирование и доводка PDF в поддерживаемых Linux-системах
PDF Commander подходит для сценария, где результатом должен стать не набор отдельных изображений, а сразу управляемый PDF: страницы нужно получить со сканера, проверить, повернуть, кадрировать, переставить и при необходимости распознать. Официально подтверждена Linux-версия для ряда российских дистрибутивов и наличие функции сканирования. При этом публичное описание не раскрывает, какой именно backend используется и как программа обрабатывает ADF и аппаратный дуплекс. Поэтому совместимость с конкретной моделью проверяют практическим проходом, а не выводят из общего слова «сканирование».
Подготовка устройства и тест без обещаний SANE
Сначала убедитесь, что сканер доступен системе штатным способом и не занят другой программой. Затем откройте PDF Commander и вызовите создание документа со сканера. Если в списке нет устройства, не делайте вывод, что достаточно установить дополнительный OCR-пакет: распознавание работает после получения изображения и не исправляет канал доступа к сканеру. Сравните поведение с системной диагностикой и документацией производителя. Для сетевой модели также проверьте, не изменился ли адрес после перезагрузки роутера.
Когда в списке есть несколько одинаковых названий, выполните одностраничный тест на каждом пункте и запишите, какой соответствует USB, а какой — сети. Не загружайте в ADF оригиналы до проверки: ошибочный выбор устройства может открыть медленный сетевой канал, задать неподходящий формат или направить задание на другой аппарат. Для первой попытки используйте копию обычного листа без скрепок, стикеров и загнутых углов.
Выбор сканера, разрешения и цветового режима
В диалоге сканирования выберите устройство, размер страницы, разрешение и цвет. Для обычных договоров начните с A4, 300 dpi и оттенков серого либо цвета, если есть печати, маркеры и цветовые пометки. Чёрно-белый режим уменьшает файл, но порог может стереть тонкие подписи и серый текст. 600 dpi оставьте для мелкого шрифта, печатей со сложной сеткой и отдельных фрагментов: для многостраничной пачки он увеличивает время и нагрузку без пропорционального выигрыша.

Параметры источника подачи и дуплекса считайте доступными только тогда, когда они действительно появились в вашем диалоге и прошли контрольный тест. Если программа показывает один общий пункт сканера без выбора Flatbed/ADF, это не доказательство автоматической подачи. Аналогично, наличие двустороннего сканера в паспорте устройства не означает, что текущий драйвер передаёт режим приложению. При сомнении просканируйте два листа, один из которых имеет заметную метку на обороте, и проверьте последовательность четырёх сторон.
Получение и сборка страниц
После запуска дождитесь, пока каждая страница появится в документе. Не закрывайте окно сразу после прекращения шума механизма: сетевой сканер может ещё передавать крупное изображение, а приложение — добавлять его в PDF. Сверьте число физических листов и миниатюр. Для дуплекса ожидаемое число страниц вдвое больше числа листов, кроме пустых оборотов, если они были удалены осознанно. Если страница появилась дважды, удалите дубль только после сравнения масштаба и содержимого.
Миниатюры — главный контроль порядка. Перетащите листы на правильные позиции, замените ошибочный повторным сканом и проверьте начало и конец каждого логического раздела. При ручной двусторонней подаче не полагайтесь на визуально «правильную» первую пару: ошибка чередования часто проявляется в середине пачки. Пройдите по нумерации документа или по контрольным меткам на углах.

Кадрирование, поворот и осторожная коррекция
Откройте проблемную страницу и примените поворот на 90 или 180 градусов только к ней. Затем используйте кадрирование, если видны стекло, чёрная рамка или широкий пустой край. Оставляйте небольшой запас вокруг текста и печатей: слишком плотная рамка может отрезать нижние элементы букв и помешать OCR. Для документов с подписями избегайте агрессивной автоматической очистки фона, если не можете сравнить её с исходным сканом.

Если перекос одинаков на всей пачке, причина часто механическая: направляющие ADF раздвинуты шире бумаги или листы поданы неровно. Программная коррекция исправит вид, но не вернёт обрезанный край. Остановите задание, выровняйте стопку и повторите несколько листов. Если перекос меняется от страницы к странице, осмотрите ролики и бумагу; продолжение большой пачки создаст больше ручной работы.
Распознавание текста и проверка результата
Перейдите к инструменту распознавания, задайте язык и диапазон страниц. Для смешанного русско-английского документа выберите оба языка, если интерфейс это допускает; лишние языки без необходимости могут снизить точность. Не запускайте OCR до окончательного поворота и кадрирования: распознаватель ориентируется на текущий вид страницы. На бланках с таблицами и несколькими колонками проверьте не только слова, но и порядок чтения.

После OCR сохраните тестовую копию под новым именем. Откройте её заново, найдите редкое слово из середины документа, выделите строку мышью и скопируйте в текстовый редактор. Совпадение внешнего вида ничего не говорит о качестве слоя: иногда PDF содержит изображение без текста, иногда слова есть, но расположены в неверном порядке. Сравните размер файла с вариантом без OCR и убедитесь, что все страницы открываются.
Когда выбирать и где остановиться
PDF Commander удобен, когда после сканирования требуется работа именно со структурой PDF и страницами в одном интерфейсе. Он не должен быть единственным вариантом для парка разнородных сканеров, пока не подтверждены нужные модели и режимы. Для обязательного SANE, прозрачного выбора eSCL, именованных профилей ADF и воспроизводимого пакетного задания безопаснее сначала протестировать NAPS2, gscan2pdf или системный фронтенд, а PDF Commander использовать на этапе сборки и доводки.
Ограничение формулируется практично: не планируйте многосотстраничную двустороннюю оцифровку, пока тест из нескольких листов не подтвердил источник, порядок сторон, устойчивость передачи и восстановление после замятия. Если точные параметры ADF отсутствуют в интерфейсе, не заменяйте проверку предположением. Программа хорошо решает подтверждённые задачи — получение скана, управление страницами, кадрирование, поворот и OCR, — но не должна получать функции, которых нет в документации и контрольном проходе.
2. NAPS2: профили SANE/eSCL, ADF, дуплекс и OCR
NAPS2 наиболее последовательно закрывает офисный цикл: Linux-версия умеет работать через SANE и eSCL, сохраняет именованные профили, предлагает источники планшета, подачи и дуплекса, собирает страницы в рабочей области, запускает пакетное сканирование и формирует PDF с OCR. Однако даже здесь источник появляется только при поддержке устройства и драйвера. Профиль не создаёт отсутствующую возможность; он лишь воспроизводит уже доступную конфигурацию.
Создание профиля, а не набор параметров каждый раз
Нажмите Profiles и создайте новый профиль. В поле Driver выберите SANE Driver для устройства, которое уже видно через sane-backends, или eSCL Driver для совместимого сетевого МФУ. Затем нажмите Choose device и выберите точный экземпляр. Если одинаковое устройство отображается через два драйвера, создайте отдельные профили с понятными именами, например «МФУ — USB — планшет» и «МФУ — сеть — ADF». Это исключает случайное переключение протокола.
В Paper source выберите Glass для планшета, Feeder для одностороннего ADF или Duplex, если такой пункт действительно доступен. Задайте Page size A4 либо фактический формат, Resolution 300 dpi для текста, Bit depth или Color mode, Brightness и Contrast. Не повышайте контраст на тесте до предела: лёгкий серый фон можно убрать позже, а потерянные тонкие линии восстановить нельзя. Включайте Auto Save только после того, как шаблон имени и папка проверены на черновом задании.

Проверка профиля на четырёх сторонах
Положите в ADF два листа с крупными отметками «1 лицевая», «1 оборот», «2 лицевая», «2 оборот». Запустите профиль один раз. Ожидаемый результат — четыре миниатюры в правильной последовательности и ориентации. Если обороты перевёрнуты, ищите настройку поворота обратной стороны либо используйте пакетную коррекцию после прохода. Если получены только две страницы, выбран односторонний источник или backend не передал дуплекс.
Если сканирование останавливается после первого листа, проверьте, не выбран ли Glass, не сообщает ли ADF «нет бумаги» и не требует ли устройство подтверждения на панели. При сетевом eSCL смотрите устойчивость Wi‑Fi и размер задания: 600 dpi в цвете может создать длинную паузу между механическим проходом и появлением миниатюры. Не отправляйте повторное задание во время этой паузы, иначе получите дубли.

Основной проход и пакетное сканирование
В главном окне выберите профиль и нажмите Scan. Для серии отдельных документов используйте Batch Scan, когда нужно повторять один и тот же профиль, добавлять фиксированное число страниц или сохранять каждую пачку по шаблону. Перед запуском проверьте назначение: добавлять страницы в текущий проект, создавать новые документы или автоматически сохранять. Ошибка здесь опаснее неверного DPI, потому что может смешать документы разных людей в одном PDF.

Следите за миниатюрами по мере поступления. При замятии остановите процесс, не вытягивайте лист против механизма и запомните последнюю полностью принятую страницу. После устранения проблемы отсканируйте диапазон заново и удалите пересечение по содержимому. Для длинных пачек полезно оставлять физические разделители и сверять их с миниатюрами; автоматическое удаление пустых листов включайте только после теста на бледных страницах.
Редактирование страниц перед OCR
После прохода выделите страницы с неверной ориентацией и примените Rotate. Перетащите миниатюры в правильный порядок, удалите пустые захваты и повторные листы. Если часть страницы обрезана, не пытайтесь компенсировать это масштабом: повторите скан с корректным размером бумаги или областью. Вставляйте повторный лист рядом с исходным, сравнивайте, затем удаляйте плохой — так меньше риск потерять единственный экземпляр.

OCR и поисковый PDF
Откройте OCR, установите нужные языки Tesseract и укажите, какие страницы обрабатывать. Для договора на русском с латинскими реквизитами обычно достаточно русского и английского. После распознавания сохраните PDF под новым именем. NAPS2 может добавлять текстовый слой к изображениям, но качество зависит от DPI, перекоса, фона и языковых данных. OCR не исправляет размытие от движения листа и не восстанавливает обрезанные поля.
Проверка поискового PDF включает три действия: поиск уникальной фамилии или номера, копирование абзаца и просмотр страницы при увеличении. Если поиск ничего не находит, убедитесь, что OCR применён к нужному диапазону. Если текст копируется бессмысленными символами, проверьте язык и качество изображения. Если внешний вид ухудшился, сравните параметры сжатия и сохраните мастер-копию без агрессивной оптимизации.
Сильные стороны и ограничения
Главное преимущество NAPS2 — воспроизводимые профили. Оператору не нужно помнить, что для входящей корреспонденции требуются ADF Duplex, A4, 300 dpi, цвет и OCR: профиль хранит набор. Это снижает количество случайных различий между сменами и компьютерами. Для домашнего сканера можно сделать второй профиль 600 dpi для фотографий, не меняя офисный.
Ограничения остаются аппаратными и системными. SANE-профиль наследует возможности backend; eSCL зависит от корректного сетевого сервиса. Некоторые device-specific опции могут быть доступны только в Advanced. Перед обновлением приложения или sane-backends сохраните параметры профилей и повторите четырёхсторонний тест. Если критична юридически значимая неизменность, сохраняйте исходный скан отдельно от распознанной и оптимизированной версии.
3. Document Scanner: простой фронтенд GNOME для SANE
Document Scanner, ранее широко известный как Simple Scan, рассчитан на быстрый повседневный процесс: выбрать устройство, указать тип оригинала, получить одну страницу или всю пачку из автоподатчика, повернуть и кадрировать листы, затем сохранить документ. Программа использует SANE, поэтому её способность увидеть конкретный сканер определяется backend. Простота интерфейса полезна оператору, но не должна скрывать этот технический факт.
Что означает экран поиска устройств
После запуска приложение опрашивает доступные сканеры. Экран Searching for Scanners означает, что готового устройства ещё нет: либо поиск продолжается, либо SANE не вернул подходящий экземпляр. Подождите завершения и не нажимайте Scan многократно. Если состояние не меняется, закройте другие программы сканирования, выполните scanimage -L и проверьте права. Переустановка только графической оболочки редко решает проблему отсутствующего backend.

Тёмная и светлая темы не меняют логику обнаружения. На рабочем месте важно научить оператора различать «поиск» и «готовность»: в первом состоянии загружать оригиналы в ADF рано, во втором внизу отображается конкретное устройство. Для сетевого сканера ожидание может быть дольше, но бесконечный поиск всё равно требует проверки сети, mDNS и sane-airscan.

Выбор режима документа и разрешения
Когда появляется Ready to Scan, откройте меню устройства и убедитесь, что выбрана нужная модель. В Preferences задайте разрешение отдельно для текста и изображений. Для писем и договоров используйте 300 dpi; для фотографий и мелких схем — 600 dpi после теста скорости и размера. Режим Text подходит только там, где потеря полутонов допустима. Если на листе есть печати, карандаш или цветовые маркеры, выбирайте Color либо подходящий серый режим.

Если список показывает несколько устройств, сделайте профилирование внешними средствами: запишите, какой пункт соответствует планшету по USB, а какой сетевому МФУ. Document Scanner ориентирован на простоту и не заменяет развитую систему именованных профилей NAPS2. Поэтому перед каждой нестандартной пачкой — особенно после сканирования фотографий — перепроверяйте DPI и тип документа.

Планшет, все страницы из ADF и выбор сторон
Для одного листа используйте обычную команду Scan. Для автоподатчика откройте меню рядом с кнопкой и выберите сканирование всех страниц из подачи. Если в Preferences доступен параметр Scan Sides, задайте односторонний или двусторонний режим. Пункт появляется только когда стек программ и устройство сообщают соответствующую возможность. Отсутствующий выбор нельзя компенсировать ожиданием: либо используется ручной двухпроходный процесс, либо другой backend.
Перед полной пачкой положите два тестовых листа. Сверьте количество страниц и ориентацию оборотов. Если программа получает все стороны, но задние перевёрнуты, примените поворот к выбранным миниатюрам и проверьте, можно ли сохранить такой рабочий процесс. Если задние стороны вообще не поступают, вернитесь к параметрам источника и выводу scanimage, а не создавайте ложное ощущение дуплекса ручным повторным нажатием без последующей сборки.
Просмотр, поворот, кадрирование и порядок
После сканирования страница появляется в рабочей области. Используйте нижнюю панель для поворота и удаления. Кадрирование применяйте только после проверки всех полей при увеличении. Для серии чеков или фотографий полезно создать новый документ, чтобы предыдущая пачка не смешалась с текущей. Команда New Document очищает рабочую область; перед ней убедитесь, что существующий результат сохранён.

Во время активного задания кнопка превращается в Stop. Останавливайте процесс, если ADF захватил два листа, появился сильный перекос или слышен ненормальный шум. После остановки сначала зафиксируйте последнюю корректную миниатюру. Повторно сканируйте с небольшим перекрытием и удаляйте дубли по содержимому. Если просто продолжить с приблизительной страницы, пропуск может обнаружиться только после отправки PDF.

Сохранение и отсутствие встроенного OCR-конвейера
Сохраните документ через стандартную команду Save. Для многостраничной пачки выбирайте PDF; JPEG и PNG подходят для отдельных изображений. Проверьте имя, папку и расширение до подтверждения. Если файл предназначен для OCR, не снижайте качество до уровня, при котором мелкие буквы распадаются. Сам Document Scanner не следует считать полноценным встроенным OCR-комбайном: распознавание можно выполнить следующим приложением, сохранив исходный PDF отдельно.
Простой интерфейс уменьшает вероятность случайно включить редкую опцию, но оставляет меньше средств для пакетной автоматизации, сложного чередования сторон и обработки. Выбирайте Document Scanner для домашних задач, небольших офисных пачек и систем GNOME, где SANE уже надёжно работает. Для десятков повторяемых профилей, автоматического OCR и длинных ADF-заданий NAPS2 или gscan2pdf дают больше контроля.
4. gscan2pdf: сложные пачки, внешняя обработка и OCR
gscan2pdf строит процесс вокруг проекта из страниц. Он получает изображения через scanimage или scanadf, умеет импортировать уже существующие PDF, DjVu и графические файлы, показывает миниатюры, подключает внешние инструменты обработки и OCR, затем сохраняет многостраничный результат. Это один из наиболее гибких вариантов, но гибкость зависит от пакетов: если ImageMagick, unpaper, Tesseract, GOCR или Cuneiform не установлены, связанные команды могут отсутствовать или быть неактивны.
Создание сеанса и выбор фронтенда сканирования
Запустите программу и выберите File → Scan. В диалоге укажите frontend: scanimage подходит для обычного SANE-прохода, scanadf — для подачи, если он установлен и совместим с backend. Выберите точное устройство, затем источник, режим, разрешение и геометрию. Не переносите параметры из чужой инструкции буквально: gscan2pdf отображает опции, которые доступны в текущей системе, и названия могут различаться у разных backend.
Для текста начните с 300 dpi и серого либо цветного режима. Включение Lineart требует осторожности: порог, подходящий для лазерной распечатки, может уничтожить серую печать. Размер страницы задавайте явно, если драйвер неправильно определяет область ADF. После первого листа проверьте, не добавлены ли белые полосы и не срезан ли нижний край. Исправить геометрию до сотой страницы проще, чем кадрировать всю пачку.

ADF, односторонняя подача и ручной дуплекс
При выборе ADF программа принимает последовательность изображений до окончания подачи или до сигнала backend. Некоторые сканеры не сообщают «лоток пуст» корректно; тогда scanadf может ждать или завершаться с сообщением, которое выглядит как ошибка. Контрольный тест показывает нормальное поведение конкретной пары устройства и backend. Не включайте автоматический повтор, пока не уверены, что окончание пачки обрабатывается предсказуемо.
Для сканера без аппаратного дуплекса используйте два прохода. Сначала получите лицевые стороны в естественном порядке. Затем переверните стопку строго по выбранной схеме и получите обороты. Перед объединением определите, идут ли обороты в прямом или обратном порядке. На тестовой пачке из трёх листов это видно сразу. В gscan2pdf страницы можно переставить и чередовать, но оператор должен точно знать, как была перевёрнута бумага.
Пакетная обработка и зависимости
После сканирования выделите нужные миниатюры. Поворот и перестановка доступны без сложного конвейера. Для устранения перекоса, очистки фона, полей и шума программа может вызывать внешние инструменты. Перед применением ко всей пачке обработайте копию двух страниц: обычную и самую сложную. Сравните тонкие линии, подписи, печати и номера. Настройка, которая красиво очищает фон, способна сделать документ неполным.
Неактивная команда чаще означает отсутствующую зависимость, а не дефект текущего PDF. Проверьте сообщения запуска и список рекомендуемых пакетов своего дистрибутива. После установки нового OCR-движка перезапустите gscan2pdf, чтобы он обнаружил программу. Не смешивайте версии из разных источников пакетов без необходимости: несовместимость библиотек может проявляться только при сохранении или обработке большой пачки.
Импорт существующих страниц и повторное сканирование
Через File → Open или импорт добавьте PDF, DjVu либо изображения, когда часть комплекта уже существует в цифровом виде. Помните: импорт PDF может растрировать страницы в зависимости от выбранного пути и параметров, поэтому цифровой текст и векторные линии могут превратиться в изображение. Если нужно сохранить исходную структуру текстового PDF, лучше объединять его специализированным PDF-инструментом после сканирования, а не прогонять все страницы через растровый проект.
Ошибочный лист заменяйте так: отсканируйте его отдельно, поместите новую миниатюру рядом со старой, сравните края и содержание, затем удалите плохую. Эта последовательность безопаснее удаления до повторного прохода. После замены проверьте соседние номера страниц и начало следующего раздела.
OCR и выбор результата
Откройте Recognize → OCR, выберите движок и языки. Для Tesseract установите соответствующие языковые данные. OCR можно применить к выделенным страницам, что удобно для смешанного проекта: цифровые или уже распознанные листы не нужно обрабатывать повторно. На таблицах и колонках проверьте порядок блоков. Если нужен searchable PDF, убедитесь, что выбран режим сохранения скрытого текстового слоя, а не только вывод распознанного текста в отдельное окно.

При сохранении через File → Save выберите формат и диапазон. Для архивного мастера используйте PDF с умеренным сжатием и сохраните проект или исходные изображения, пока результат не прошёл контроль. Для DjVu проверьте, что получатель действительно поддерживает формат. Для TIFF уточните, нужен ли многостраничный файл или отдельные страницы. Названия файлов формируйте без двусмысленных сокращений и с версией, например «договор_скан_master» и «договор_ocr_copy».
Для кого подходит
gscan2pdf оправдан в лаборатории оцифровки, архиве и у опытного пользователя, которому нужен контролируемый конвейер. Он менее удобен для человека, ожидающего одну большую кнопку: множество зависимостей и вариантов требует тестирования. Зато программа ясно разделяет сканирование, обработку, OCR и сохранение, что облегчает поиск ошибки. Если устройство не видно, проверяют SANE; если недоступно выравнивание — внешний пакет; если OCR пуст — движок и язык; если PDF неверен — параметры экспорта.
5. Skanpage: многостраничные документы в среде KDE
Skanpage предназначен для последовательного получения и сборки документов. Официально заявлены планшетные сканеры и устройства с автоподатчиком, настройка параметров, изменение порядка, поворот, удаление страниц и сохранение многостраничного PDF либо изображений. В рейтинге программа оценивается именно по этим подтверждённым функциям. OCR не считается обязательной базовой возможностью, пока он не представлен и не проверен в используемой версии.
Выбор устройства и режима
После запуска выберите сканер из доступного списка. Если список пуст, вернитесь к scanimage -L: Skanpage не заменяет backend. В параметрах задайте источник Flatbed или ADF, если драйвер его сообщает, затем размер страницы, разрешение и цвет. Для пачки A4 используйте 300 dpi и фактический размер, а не автоматическую область, если пробный лист обрезается. Для фотографии на стекле сделайте Preview и ограничьте рамку.
Сохраните контрольный лист и сравните его размеры с оригиналом. Неверно заданная область может не быть заметна на миниатюре, особенно если потерян узкий нижний край. Если присутствует ADF, проверьте две страницы и поведение при пустом лотке. Не делайте вывод о дуплексе только по поддержке автоподачи: односторонний ADF и двусторонний источник — разные возможности.

Сборка пачки
Запускайте сканирование после физической подготовки стопки: удалите скрепки, выровняйте края, расправьте загибы и выставьте направляющие. Полученные страницы появляются как миниатюры. Сверяйте первую, последнюю и каждую страницу-разделитель. Перетаскивание позволяет восстановить порядок, а поворот — исправить отдельные листы. Не применяйте общий поворот ко всей пачке, если обороты имеют другую ориентацию.
Если лист нужно повторить, сначала добавьте новый скан рядом со старым. На увеличении сравните все края, печати и номера, затем удалите дефектный. При замятии запишите последнюю полностью принятую страницу. Автоматическая подача иногда захватывает два тонких листа, поэтому отсутствие механической ошибки не гарантирует комплектность.

Сохранение PDF и контроль
Перед Save проверьте порядок миниатюр и выбранный формат. Многостраничный PDF подходит для договоров и корреспонденции; отдельные изображения удобны для последующей графической обработки. Если нужен поисковый слой, передайте сохранённый PDF в проверенный OCR-инструмент и оставьте исходную копию без распознавания. Не называйте файл «готовый», пока не проверены количество страниц, ориентация, читаемость и открытие после повторного запуска.
Skanpage хорошо подходит пользователю KDE, которому нужен современный интерфейс для многостраничного сканирования без сложной системы внешних обработчиков. Для развитых профилей, автоматического OCR и ручного чередования сторон NAPS2 и gscan2pdf дают больше средств. Для точной работы с фотографиями по выделенным областям удобнее Skanlite.
6. Skanlite: точный предпросмотр и сканирование выбранных областей
Skanlite ориентирован прежде всего на планшетное сканирование фотографий, отдельных документов, слайдов и плёнки — если соответствующий оригинал и режим поддерживает сам сканер. Программа умеет работать с локальными и сетевыми устройствами через доступный стек, показывает предварительный просмотр, позволяет выделять область и автоматически именовать сохранённые изображения. Это не офисный OCR-комбайн и не лучший выбор для сотен листов из ADF.
Предпросмотр вместо лишних полноразмерных проходов
Выберите устройство и нажмите Preview. Сканер быстро получает обзор всей доступной области. Мышью задайте прямоугольник вокруг фотографии или документа. Оставьте небольшой запас, особенно если оригинал лежит под углом: границу лучше уточнить после просмотра, чем срезать угол. Для нескольких небольших фотографий на стекле можно последовательно выделять области и сохранять отдельные файлы, не сканируя пустое пространство в полном разрешении.

Разрешение, цвет и формат
Для обычного листа установите 300 dpi. Для фотографии, которую планируется увеличивать или реставрировать, попробуйте 600 dpi и сравните реальную детализацию: оптическое разрешение устройства важнее максимального числа в списке. Выберите Color для цветного оригинала, Gray для монохромной фотографии с полутонами и Lineart только для контрастной штриховой графики. Перед длинной серией сохраните один файл и проверьте его размер, профиль цвета и отсутствие полос.
Автоматическое именование избавляет от постоянного ввода, но шаблон должен быть однозначным. Используйте папку проекта и последовательную нумерацию. Не сохраняйте мастер-фотографию в JPEG с сильным сжатием; PNG или TIFF лучше подходят для дальнейшей обработки. JPEG можно создать как отдельную копию для отправки. Если Skanlite предлагает только графические форматы, многостраничный PDF собирайте позже без повторного сжатия.
Сетевые устройства и ограничения
Сетевой сканер появится только при рабочем backend и доступной сети. Если устройство видно утром и исчезает после смены адреса, настройте стабильный сетевой идентификатор. При медленном канале уменьшите тестовое разрешение, но не делайте постоянный профиль по случайному 75 dpi. Сначала устраните сетевую причину, затем верните необходимое качество.
Skanlite выбирают для точного кадрирования на стекле и серии изображений. Для ADF, двусторонней подачи, удаления пустых страниц и OCR разумнее отдельное решение. Такое разделение задач полезно: фотографический процесс не перегружается офисными опциями, а оператор не ожидает от программы функций, которых она не заявляет.
7. XSane: прямой доступ к расширенным параметрам SANE
XSane — зрелый графический фронтенд SANE с многооконным интерфейсом. Он показывает основные и расширенные опции, предпросмотр, область сканирования, гистограмму и пакетный список. Сильная сторона XSane — близость к возможностям backend: если драйвер экспортирует нестандартный переключатель, его часто можно увидеть в расширенной панели. Обратная сторона — интерфейс требует понимания терминов и может отличаться для каждой модели.
Разбор окон
Главное окно содержит устройство, режим, разрешение, яркость и контраст. Окно Preview отвечает за обзор и рамку. Гистограмма помогает оценить тени и свет, но автоматическая коррекция не всегда подходит документам с печатями. Не закрывайте отдельное окно как «лишнее», пока не поняли его роль: в XSane рабочий процесс распределён между несколькими панелями.

Device-specific параметры
Откройте Advanced options. Набор формирует backend: один сканер покажет источник, сжатие и калибровку, другой — только несколько базовых значений. Параметр Compression на сетевом устройстве может влиять на полосы и артефакты, но его наличие не универсально. Изменяйте одну опцию за раз, сохраняйте тестовый файл и записывайте результат. Одновременная корректировка разрешения, гаммы и сжатия не позволяет понять причину улучшения или ухудшения.

Предпросмотр, область и пакетный список
Выполните Preview, выделите область и проверьте координаты. Для планшета это основной сценарий. Batch list позволяет подготовить несколько областей или заданий, но он не равен современному менеджеру документов с миниатюрами. При работе с ADF смотрите, какие batch-опции и Source доступны у текущего backend. Если драйвер не сообщает конец подачи корректно, пакет может завершаться сообщением, которое нужно оценить на тесте.
Сохраняйте настройки только после успешного контрольного прохода. Профиль с чужими координатами области способен незаметно обрезать все последующие листы. Для другого формата бумаги создайте отдельный набор. Перед сканированием фотографий сбросьте документные пороги и убедитесь, что выбран цветовой режим.
Формат и OCR
XSane может сохранять изображения и в доступных режимах формировать PDF или PostScript, но OCR обычно строится внешним инструментом. Не считайте наличие команды или скрипта достаточным: проверьте, создаётся ли текстовый слой, поддерживаются ли нужные языки и сохраняется ли исходное изображение. Для надёжного searchable PDF часто проще сохранить качественный TIFF/PNG или PDF, затем обработать его отдельным OCR-конвейером.
XSane полезен при диагностике старого или специфического устройства, когда важно увидеть максимум опций SANE. Для нового пользователя многооконная схема менее удобна, чем Document Scanner. Для повторяемых офисных профилей NAPS2 проще. Зато XSane не скрывает различия backend за единым упрощённым экраном, что ценно при настройке.
8. VueScan: собственная поддержка моделей, цвет и searchable PDF
VueScan — коммерческое кроссплатформенное приложение со своей базой поддерживаемых сканеров и развитой обработкой. Linux-сборки доступны в нескольких форматах. Программа умеет работать с планшетами, ADF и сетевыми устройствами в поддерживаемых конфигурациях, сохраняет PDF, TIFF и JPEG, а также создаёт поисковые PDF с OCR. Большое число заявленных моделей не отменяет проверки: точную модель и интерфейс нужно найти в списке совместимости и подтвердить пробным сканом.
Вкладка Input
Переключите Options в подходящий уровень, затем откройте Input. Выберите Source — конкретный сканер, Mode — Flatbed, Feeder или доступный двусторонний вариант, Media, Media size и Scan resolution. Для документов используйте 300 dpi; для плёнки и фотографий параметры определяются оптическими возможностями сканера и задачей. Не копируйте высокий DPI из чужого профиля: интерполированное разрешение создаст большой файл без новой детали.

ADF и ручное чередование
Если устройство имеет аппаратный дуплекс и VueScan поддерживает этот режим для модели, выберите соответствующий источник и проверьте четыре стороны. Для одностороннего ADF программа может помочь с ручным двухпроходным процессом и чередованием, но оператор обязан соблюдать направление переворота. Используйте тест из трёх листов с пометками. Неверная схема создаёт порядок 1, 3, 5, 6, 4, 2 вместо 1, 2, 3, 4, 5, 6.
При сетевом подключении проверьте автоматическое обнаружение mDNS/eSCL и возможность указать адрес, если сеть не пропускает широковещательные объявления. Стабильная работа одного планшетного скана ещё не подтверждает ADF: сделайте пачку минимум из пяти листов и оцените паузы, завершение и восстановление после пустого лотка.
Output, многостраничный PDF и OCR
На вкладке Output включите PDF, задайте имя и многостраничный режим. Параметр PDF OCR Text включает распознаваемый слой в соответствующей конфигурации. Следите, чтобы изображения не сохранялись одновременно в ненужных форматах, иначе папка быстро заполнится несколькими копиями каждой страницы. Для мастер-архива можно отдельно сохранить TIFF, а компактный searchable PDF использовать для поиска и обмена.

После Scan нажмите View или откройте файл отдельно. Найдите редкое слово, выделите строку и скопируйте. Затем проверьте изображение при увеличении: OCR не должен заменять оригинал неотредактированным текстом. На многоязычном документе укажите корректные языки, если версия и лицензия это позволяют. Ошибки в фамилиях и номерах остаются возможными, поэтому поисковый слой не используют как единственный источник данных.

Цвет и сканирование фотографий
Для фотографий VueScan предлагает больше настроек цвета, экспозиции и восстановления, чем простые документные фронтенды. Начинайте с нейтрального скана и сохраняйте мастер-копию до сильной коррекции. Автоматическое восстановление выцветания может изменить важные оттенки; для исторического материала фиксируйте исходный вариант. Плёнка требует совместимого сканера, держателя и режима прозрачных оригиналов — программа не добавляет подсветку обычному планшету.
Лицензия и выбор
VueScan оправдан для старой модели, которую неудобно поддерживать через стандартный backend, для фотографий и для пользователя, которому нужен единый интерфейс на разных ОС. До покупки проверьте точный индекс сканера, требуемые функции и ограничения пробной версии. Не переносите совместимость между похожими индексами одной серии: аппаратная ревизия и интерфейс могут отличаться. Для полностью открытого SANE-конвейера и бесплатных профилей NAPS2 или gscan2pdf практичнее.
Сценарии выбора: какая программа подходит конкретному процессу
Домашний планшетный сканер и несколько документов в месяц
Для редких задач важнее простота, чем сложный профиль. Сначала добейтесь, чтобы scanimage -L устойчиво показывал устройство. В GNOME используйте Document Scanner: выберите текстовый или цветной режим, 300 dpi, получите страницу, поверните и сохраните PDF. В KDE аналогичный быстрый процесс даёт Skanlite, особенно если нужно точно выделить фотографию. NAPS2 пригодится, когда хочется один раз сохранить параметры и больше их не восстанавливать после каждого запуска.
Не храните результат только в папке «Загрузки». Создайте отдельный каталог по проекту, сохраните исходный скан и проверенную копию. Для квитанций и чеков используйте цвет или серый режим: термопечать и бледные отметки могут исчезнуть в Lineart. Через несколько месяцев повторно откройте выборочные файлы — это выявит ошибочные имена и повреждённые копии раньше, чем документ понадобится срочно.
Офисный ADF на 20–100 листов
Здесь выигрывает NAPS2 с профилем или gscan2pdf с контролируемым проектом. Профиль должен содержать точное устройство, Feeder или Duplex, A4, 300 dpi, цвет, правила OCR и папку. Перед каждой сменой бумаги выполните тест на двух листах. Физически пересчитайте листы и сравните ожидаемое число страниц. При дуплексе обороты с полезным содержанием удваивают число, но удаление пустых страниц может изменить итог, поэтому фиксируйте правило заранее.
Для документов разных людей не складывайте всё в одну бесконечную пачку. Разделяйте задания физическими листами-маркерами или запускайте отдельный проект на каждый комплект. Автосохранение удобно только при безопасном шаблоне имени. Номер скана должен однозначно соответствовать бумажному комплекту; имя «scan001.pdf» без журнала быстро теряет смысл.
Двусторонние документы на одностороннем ADF
Сначала определите схему переворота на трёх листах с крупными номерами сторон. Получите лицевые стороны, не меняя порядок, затем переверните стопку и получите обороты. В NAPS2 используйте доступный механизм чередования, в gscan2pdf переставьте страницы по проверенной схеме. После сборки проверьте не только начало: просмотрите пары в середине и конце. Ошибка направления часто сохраняет первые две страницы правдоподобными, но разрушает весь дальнейший порядок.
Не удаляйте пустые обороты до завершения чередования. Пустая страница занимает место в последовательности; её раннее удаление сдвигает все пары. Сначала соберите полный порядок, затем пометьте действительно пустые страницы и удалите их, проверяя соседей. Бледная подпись или штамп не считаются пустым листом.
Сетевое МФУ по eSCL
Выберите NAPS2 с eSCL или SANE-фронтенд через sane-airscan. Проверьте, что устройство находится по стабильному адресу и не изолировано точкой доступа. Создайте отдельный сетевой профиль, даже если имя совпадает с USB. Для конфиденциальных документов сверяйте адрес и расположение МФУ. Если сканирование замедлилось, сначала измерьте сеть и размер одной страницы, затем меняйте DPI; постоянное снижение качества скрывает инфраструктурную проблему.
Старый сканер или редкая модель
Начните с базы поддерживаемых устройств SANE и фирменных пакетов. XSane полезен, когда нужно увидеть максимум опций backend. VueScan стоит проверить, если стандартный стек не поддерживает модель или не раскрывает нужный режим. Но похожее название серии не считается подтверждением. Пробный проход должен проверить планшет, ADF, дуплекс, максимальное реальное разрешение и стабильность нескольких страниц.
Фотографии, открытки и негативы
Для фотографий удобны Skanlite и VueScan. Очистите стекло и оригинал безопасным способом, сделайте Preview, выделите область с запасом и выберите оптическое разрешение. Сохраните мастер в TIFF или PNG, а коррекцию выполняйте над копией. Негативы и слайды требуют подсветки и держателя; обычный документный планшет не превращается в фильм-сканер от выбора пункта в программе.
Архив с обязательным полнотекстовым поиском
NAPS2, gscan2pdf или VueScan дают прямой путь к OCR. Сначала создайте качественный мастер, затем поисковую копию. Сформируйте набор контрольных запросов: фамилия, дата, номер договора, слово с буквой «ё», латинский индекс. Поиск должен находить каждый пример на ожидаемой странице. Для таблиц и двух колонок дополнительно скопируйте текст и проверьте порядок. OCR облегчает поиск, но не заменяет визуальную сверку юридически значимых реквизитов.
Тип исходного PDF: что можно и нельзя исправить после сканирования
Текстовый PDF
Текстовый PDF уже содержит символы и обычно не требует повторного сканирования или OCR. Если добавить его в растровый скан-проект, страницы могут быть преобразованы в изображения, а исходный текст — потерян. Такой файл лучше объединять с новыми сканами инструментом, который сохраняет структуру. Перед операцией проверьте выделение текста и свойства шрифтов, а после — повторите поиск и копирование.
PDF со сканами без текстового слоя
Это типичный результат сканера: каждая страница является изображением. Его можно повернуть, кадрировать, очистить и распознать. OCR следует выполнять после геометрической коррекции. Сохраняйте исходный вариант, потому что автоматическая бинаризация, удаление фона и сжатие необратимы. Если страница уже размыта или обрезана, распознавание не восстановит утраченное; нужен повторный скан.
Защищённый PDF
Защита может запрещать изменение, копирование текста или печать. Программа сканирования не должна использоваться для обхода ограничений. Работайте только в рамках имеющихся прав и доступного пароля. Если документ принадлежит организации, запросите разрешённую копию у владельца. Даже при возможности открыть страницы не заменяйте защищённый оригинал новой версией без согласования.
Подписанный PDF
Любое изменение страниц, OCR-слоя, метаданных или порядка обычно нарушает криптографическую целостность подписи. Подписанный файл храните неизменным. Если требуется добавить скан приложений, создайте отдельный комплект или новую версию и оформите подписание заново по правилам организации. Визуальное изображение штампа или подписи не равно действительной электронной подписи.
PDF-форма
Интерактивная форма содержит поля, флажки, вычисления и иногда скрипты. Растеризация превращает её в неподвижное изображение. Если задача — приложить отсканированную страницу, не прогоняйте всю форму через сканирующий конвейер. Сохраните исходную форму, отдельно создайте скан и объедините средствами, которые сохраняют поля, затем проверьте их заполнение и табуляцию.
PDF с повреждённой структурой
Признаки повреждения — ошибки открытия, пустые страницы, неверное число листов, зависание при переходе или сбой сохранения. Сначала сделайте копию и проверьте файл в другом просмотрщике. Не используйте повторную печать или сканирование как универсальный «ремонт»: оно может уничтожить текст, ссылки, формы и подписи. Если нужно сохранить хотя бы визуальный вид, создавайте отдельную восстановительную копию и фиксируйте, какие элементы потеряны.
Смешанный PDF
В одном файле могут находиться цифровые страницы, сканы, формы и подписанные вложения. Общий OCR для всех страниц способен ухудшить цифровой текст или изменить структуру. Разделите диапазоны по типу. Распознавайте только растровые страницы, не трогайте подписанные части и проверяйте формы после объединения. Такой процесс требует больше времени, но сохраняет функции документа.
Ошибки сканирования в Linux и точная диагностика
Программа не видит устройство
Сравните три уровня. Если lsusb не видит USB-устройство, проверяйте аппаратное подключение. Если sane-find-scanner видит интерфейс, а scanimage -L пуст, ищите backend, firmware и права. Если scanimage -L работает, а конкретная программа — нет, проверяйте способ установки, sandbox-права Flatpak, выбранный драйвер и занятость устройства. Эта последовательность исключает бессистемную переустановку.
Device busy или ресурс занят
Закройте все фронтенды, включая фоновые утилиты производителя. Устройство может удерживаться зависшим процессом после отмены задания. Подождите завершения механики, выключите и включите сканер по инструкции, затем повторите одностраничный тест. Не запускайте два задания одновременно из разных приложений: это создаёт дубли, обрывы и неопределённое состояние ADF.
ADF не подаёт или берёт два листа
Проверьте выбранный Source, положение направляющих, состояние роликов и бумагу. Слипшиеся, влажные, мятые и слишком тонкие листы нужно разделить. Не загружайте скрепки, стикеры и оригиналы нестандартной толщины без проверки руководства устройства. Если механика работает из другого приложения, сравните device-specific опции; если не работает нигде, причина не в интерфейсе.
Получается только одна сторона
Убедитесь, что сканер действительно имеет аппаратный дуплекс, а backend показывает Duplex. Пункт Feeder означает только подачу. Проверьте четырёхсторонним тестом. При отсутствии аппаратного режима используйте документированный ручной двухпроходный процесс и не удаляйте пустые страницы до чередования.
Обороты перевёрнуты или идут в неверном порядке
Определите закономерность на двух-трёх листах. Если все обороты повернуты на 180 градусов, примените пакетный поворот только к ним. Если порядок сначала все лицевые, затем все обороты, используйте чередование с прямым или обратным вторым набором. Не переставляйте большую пачку вручную без контрольных номеров: одна ошибка сместит все последующие пары.
Обрезаны края
Проверьте Paper size и геометрию области. Автоматическое определение может ошибаться на тонкой бумаге или чёрной рамке. На планшете сделайте Preview и оставьте запас. В ADF убедитесь, что направляющие не сдвигают лист. Повторный скан обязателен, если потеряно содержимое; расширение холста после факта создаст пустой край, но не вернёт текст.
Файл слишком большой
Сначала оцените исходные параметры: цветной A4 при 600 dpi занимает значительно больше, чем серый 300 dpi. Для текста уменьшайте разрешение до 300 dpi и выбирайте разумное сжатие, но сохраняйте мастер сложных страниц. Не применяйте сильное JPEG-сжатие к мелкому шрифту. Сравнивайте читаемость, OCR и размер на одном и том же наборе из пяти страниц.
OCR даёт ошибки или пустой результат
Проверьте, установлен ли нужный язык, выбраны ли правильные страницы и не повёрнут ли текст. Увеличьте исходное качество до 300 dpi, исправьте перекос и удалите широкие тёмные поля. Для таблиц и колонок проверьте сегментацию. Если символы копируются в неверном порядке, сохраните изображение как мастер, а текстовый слой пересоздайте с другими настройками.
В PDF пропали страницы
Сверьте физическое число листов, миниатюры до сохранения и страницы после повторного открытия. Пропуск мог возникнуть при двойном захвате, удалении «пустого» листа, ошибочном диапазоне экспорта или сбое сохранения. Восстанавливайте по журналу и контрольным меткам. Никогда не уничтожайте бумажный комплект до проверки итогового файла и резервной копии.
Безопасный рабочий процесс: мастер-копия, проверка и резервирование
Разделить мастер и рабочую версию
Сразу после сканирования сохраните мастер-копию с минимальной обработкой. Она нужна для повторного OCR, сравнения спорной печати и восстановления после неудачного сжатия. Рабочую версию можно кадрировать, очищать, уменьшать и распознавать. Имена должны различаться явно, например суффиксами master, processed и ocr, а не словами «новый» и «финал2». Такая схема особенно важна для архивов, подписей и бледных оригиналов.
Не перезаписывать единственный файл
Команда Save As безопаснее обычного Save при первом экспорте после обработки. Проверьте путь и расширение. Если программа предлагает автоматически сохранить в ранее выбранную папку, выполните пробное задание и откройте файл из этой папки, а не из списка недавних документов. Сетевой каталог может быть временно недоступен; локальная мастер-копия защищает от частичного файла и разрыва соединения.
Контрольный чек-лист результата
- Сверить число физических листов, ожидаемых сторон и страниц в PDF.
- Просмотреть первую, последнюю и случайные страницы из середины; отдельно проверить места замятия и повторного сканирования.
- Увеличить мелкий текст и печати, убедиться в отсутствии обрезанных краёв, полос и сильных артефактов.
- Проверить ориентацию лицевых и оборотных сторон и логический порядок разделов.
- В поисковом PDF найти несколько редких слов и скопировать абзац в текстовый редактор.
- Закрыть приложение, открыть файл заново и повторить переход к последней странице.
- Создать резервную копию и только после этого считать задание завершённым.
Для большого архива полезно вычислять контрольную сумму мастер-файла и хранить её рядом с журналом. Контрольная сумма не доказывает правильность содержания, но показывает, изменились ли байты после передачи или хранения. Если файл подписан электронной подписью, его исходная версия и проверка подписи имеют приоритет над любыми улучшениями внешнего вида.
Дополнительные приёмы работы с файлами разумно сверять с разделом пошаговых инструкций, но конкретный сканер всё равно тестируют на собственной системе. Универсальная последовательность — диагностика backend, контрольный проход, мастер-копия, обработка, OCR и повторная проверка — надёжнее случайного набора кнопок.
Специализированные и фирменные инструменты вне основного рейтинга
scanimage и sane-airscan
scanimage — эталонный диагностический и сценарный инструмент SANE. Он полезен для списка устройств, просмотра опций и автоматизации, но не заменяет визуальную проверку страниц. sane-airscan добавляет доступ к eSCL/WSD-устройствам и может раскрыть планшет, ADF и дуплекс, которые публикует сетевой сервис. Эти компоненты оценивают как инфраструктуру, а не как полноценные редакторы многостраничных PDF.
HPLIP
HPLIP полезен владельцам поддерживаемых устройств HP: пакет включает драйверы и утилиты, а таблица поддерживаемых моделей позволяет проверить конкретный индекс. Нельзя переносить поддержку с похожего МФУ на своё. Перед установкой сверяют дистрибутив, версию пакета и точное устройство; после — всё равно выполняют scanimage -L и тест ADF.
Canon ScanGear MP
ScanGear MP выпускается для определённых моделей и дистрибутивных форматов. Версия пакета и список устройств важнее общего бренда Canon. Такой драйвер может быть правильным решением для конкретного МФУ, но не становится универсальной программой для Linux. Сначала сверяют официальный пакет, архитектуру и зависимости, затем проверяют, какие источники он передаёт приложению.
Epson Image Scan
Старые руководства Image Scan описывают работу через SANE, выбор источника, режима, разрешения и, для поддерживаемых устройств, ADF с одной или двумя сторонами. Эти сведения полезны для уже работающей конфигурации, но устаревший пакет не следует рекомендовать как современное универсальное решение. Для новой установки нужна проверка текущей страницы поддержки точной модели и дистрибутива.
RiDocLNX
RiDocLNX — специализированный Linux-продукт для сканирования, многостраничных PDF/TIFF и OCR с зависимостями SANE и Tesseract. Он может быть интересен в средах российских дистрибутивов, однако перед внедрением требуется отдельная проверка поддерживаемой версии ОС, лицензии, устройства, ADF и стабильности на реальной пачке. Отсутствие подтверждённого публичного описания аппаратного дуплекса не позволяет обещать его для произвольного сканера.
ScanDoc и узкоспециализированные решения
Кроссплатформенные и корпоративные продукты рассматривают после проверки редакции для Linux и конкретного канала подключения. Наличие слова Linux на странице загрузки не отвечает на вопросы о SANE, eSCL, ADF, дуплексе и OCR. Для тендера или массового развёртывания составляют матрицу моделей и функций и принимают решение только после испытания пилотного рабочего места.
Частые вопросы
Какая программа лучше всего поддерживает SANE?
NAPS2, Document Scanner, gscan2pdf и XSane используют SANE явно, но поддержка конкретного сканера определяется backend. XSane показывает много device-specific опций, NAPS2 удобнее профилями, Document Scanner проще, gscan2pdf сильнее в обработке. Начните с scanimage -L, затем выбирайте интерфейс по процессу.
Можно ли включить дуплекс программой, если сканер односторонний?
Аппаратный дуплекс добавить нельзя. Можно выполнить два односторонних прохода и чередовать лицевые и оборотные страницы. Для этого нужна тестовая схема переворота и сохранение пустых страниц до сборки. NAPS2, gscan2pdf и VueScan удобнее для такого процесса, но результат обязательно проверяют в середине и конце пачки.
Почему ADF есть в паспорте, а в программе только Flatbed?
Возможность может не передаваться текущим backend, выбран не тот экземпляр устройства или установлен неполный драйвер. Сравните вывод опций scanimage для USB и сети. Пункт Feeder должен появиться на уровне драйвера; смена темы интерфейса или OCR-пакета не поможет.
Какое разрешение выбрать для документов?
Для большинства печатных документов — 300 dpi. 150 dpi подходит только после проверки крупного текста и неидеален для OCR. 600 dpi используют для мелких деталей, бледных оригиналов и отдельных фрагментов, учитывая рост времени и размера. Цвет выбирают, если важны печати, маркеры и оттенки.
Нужен ли цвет для чёрно-белого договора?
Если лист действительно контрастный и не содержит серых элементов, оттенки серого могут быть достаточны. Lineart уменьшает размер, но может стереть тонкие линии и подписи. Сделайте тест страницы с самой бледной отметкой и сравните при увеличении и в OCR.
Как понять, что OCR встроен, а не просто установлен Tesseract?
В программе должна быть команда распознавания и понятный результат: текстовый вывод или searchable PDF. После сохранения найдите слово и скопируйте строку. Если Tesseract установлен, но интерфейс не предлагает OCR либо создаёт только изображение, встроенного конвейера нет.
Что делать, если Flatpak-приложение не видит USB-сканер?
Сначала подтвердите работу устройства в системном scanimage. Затем проверьте разрешения sandbox, доступ к устройствам и способ установки приложения. Сравните с пакетной версией из репозитория, не удаляя рабочую конфигурацию. Если системный тест тоже пуст, проблема ниже уровня Flatpak.
Можно ли сканировать сразу в сетевую папку?
Да, если приложение умеет сохранять туда и сетевой ресурс стабилен. Для надёжности сначала сохраните локальную мастер-копию, затем синхронизируйте. Прямое автосохранение на нестабильный ресурс может оставить неполный файл. Права доступа и уникальное имя проверяют на тестовом документе.
Почему после удаления пустых страниц нарушился порядок?
При ручном дуплексе пустой оборот занимает позицию в последовательности. Если удалить его до чередования, все последующие пары сдвинутся. Сначала соберите полный порядок лицевых и оборотов, затем удаляйте только проверенные пустые страницы.
Как проверить, что сетевой сканер действительно работает через eSCL?
Сравните выбранный драйвер в NAPS2 или идентификатор устройства в SANE, отключив USB на время теста. Проверьте скан с планшета, затем ADF и дуплекс. Сам факт обнаружения по сети не подтверждает все источники. Зафиксируйте адрес и профиль после успешного прохода.
Можно ли распознать уже готовый скан-PDF без повторного сканирования?
Да. Импортируйте копию в программу с OCR или используйте отдельный распознаватель. Не растрируйте цифровые страницы без необходимости. Перед OCR исправьте поворот и перекос, затем сохраните новую версию и проверьте поиск. Исходный файл оставьте неизменным.
Какая программа лучше для фотографий?
Skanlite удобен предпросмотром и точным выделением области; VueScan предлагает больше цветовых и плёночных настроек для поддерживаемого оборудования. Сохраняйте мастер в TIFF или PNG, проверяйте оптическое разрешение и не применяйте сильную коррекцию к единственной копии.
Что выбрать для стандартного рабочего места в GNOME или KDE?
В GNOME начните с Document Scanner, в KDE — со Skanpage для документов или Skanlite для изображений. Если нужны именованные профили, OCR и повторяемый ADF, установите NAPS2 независимо от среды. Для сложной пакетной обработки используйте gscan2pdf.
Как не потерять страницу после замятия?
Запомните последнюю полностью появившуюся миниатюру, устраните замятие по инструкции устройства и повторно отсканируйте небольшой диапазон с перекрытием. Новые страницы поставьте рядом со старыми, сравните и только затем удалите дубли. В конце сверьте общее число и логические переходы.
Нужно ли хранить вариант без OCR?
Для важных документов — да. OCR и оптимизация могут изменить размер, структуру и качество. Мастер без агрессивной обработки позволяет пересоздать поисковую копию с другим языком или движком. Подписанный PDF вообще сохраняют неизменным, иначе подпись может стать недействительной.
Итоговый выбор
Для повторяемого офисного сканирования через SANE/eSCL, профилей ADF, дуплекса и OCR наиболее универсален NAPS2. gscan2pdf подходит сложным проектам с внешней обработкой и выборочным распознаванием. Document Scanner и Skanpage удобны для простого многостраничного процесса в GNOME и KDE, Skanlite — для планшета и фотографий, XSane — для доступа к расширенным опциям backend, VueScan — для поддерживаемых старых моделей и развитой работы с цветом.
PDF Commander полезен, когда скан нужно сразу превратить в аккуратно собранный и распознанный PDF в поддерживаемой Linux-системе. Его используют после практической проверки конкретного сканера и не приписывают SANE, ADF или аппаратный дуплекс без подтверждения. Такой же принцип применяется ко всем участникам: решает не список обещаний, а контрольный проход с реальным устройством.
Перед окончательным выбором выполните одну и ту же тестовую пачку в двух подходящих программах, сравните обнаружение, источники, порядок сторон, время, размер, качество текста и восстановление после остановки. Результат такой проверки полезнее абстрактного места в таблице. Другие тематические подборки собраны в разделе рейтингов программ.

