capture2text - скачать полную версию бесплатно на русском

capture2text: программа для распознавания текста с экрана

capture2text: программа для распознавания текста с экрана

Capture2Text OCR — это портативная программа для Windows, которая распознаёт текст прямо с экрана и отправляет результат в буфер обмена. Её основная задача — быстро превратить видимый фрагмент изображения, интерфейса, PDF-файла, видеокадра, комикса или веб-страницы в редактируемый текст. Программа не заменяет полноценные редакторы документов, системы сканирования или большие OCR-пакеты. Её сильная сторона — скорость: пользователь выделяет нужную область экрана, запускает OCR с помощью горячей клавиши, получает текст и сразу вставляет его в заметку, письмо, таблицу, переводчик или рабочий документ.

Выбор редакции

Скачать capture2text бесплатно

Рекомендуем

PDF Commander

  • Редактирование PDF
  • Конвертация и OCR
  • Объединение и разделение
  • Защита документов

capture2text

  • Сложнее простых редакторов
  • Нужно время на настройку OCR
  • Может быть избыточна для просмотра
  • Не все функции нужны новичку

Capture2Text особенно полезна в ситуациях, когда текст невозможно выделить обычной мышью. Это может быть надпись на изображении, скриншот в инструкции, фрагмент старой программы, строка из видеоролика, субтитры, текст внутри комиксного облака, системное сообщение, PDF без текстового слоя, защищённая веб-страница, окно удалённого рабочего стола или интерфейс приложения, где копирование отключено. Программа работает как OCR с экрана: она не требует предварительно сохранять скриншот отдельным файлом, потому что область захвата выбирается непосредственно поверх текущего изображения.

Главная логика Capture2Text строится вокруг трёх действий: выбрать область, распознать символы, получить текст. По умолчанию результат помещается в буфер обмена, поэтому после распознавания достаточно нажать Ctrl + V в любом редакторе. При включённом popup-окне программа дополнительно показывает результат в отдельном окне Capture2Text — OCR Text, где текст можно проверить перед дальнейшим использованием.

Общая схема работы Capture2Text: пользователь выделяет область экрана, программа выполняет OCR и сохраняет результат в буфер обмена

В обычной работе Capture2Text почти не отвлекает пользователя. У неё нет большого стартового окна, панели проектов, ленты инструментов или встроенного редактора. После запуска она находится в системном трее Windows, а основные команды вызываются через горячие клавиши и контекстное меню значка. Такой подход делает программу удобной для быстрых операций: она не занимает место на экране, не требует открывать отдельное рабочее пространство и подходит для сценариев, где нужно распознать короткий фрагмент текста за несколько секунд.

Capture2Text использует OCR-движок для оптического распознавания символов. В программе есть языковые словари, переключение OCR-языков, настройки whitelist и blacklist, предварительная обработка изображения, коррекция наклона, удаление лишних полей, режимы распознавания строк, специальный режим для комиксных облаков, сохранение результатов в файл, автоматические замены, перевод, озвучивание текста и отдельная командная утилита Capture2Text_CLI.exe. Благодаря этому программа остаётся простой в базовом использовании, но при необходимости позволяет настраивать поведение довольно подробно.

Для каких задач подходит Capture2Text

Capture2Text лучше всего раскрывается как инструмент для точечного распознавания текста. Она не предназначена для вёрстки, пакетного восстановления документов или сложной обработки сканов с таблицами, но хорошо решает повседневные задачи, где нужно быстро скопировать текст из изображения или окна программы.

Типичные сценарии:

  • распознать текст на скриншоте;

  • скопировать фразу из изображения в браузере;

  • извлечь текст из PDF-файла, где обычное выделение не работает;

  • переписать номер заказа, код ошибки, серийный номер или дату без ручного ввода;

  • скопировать текст из старой программы, где нет выделения мышью;

  • распознать фрагмент интерфейса удалённого рабочего стола;

  • взять текст из обучающего видео или презентации;

  • распознать японский, китайский или корейский текст с экрана;

  • быстро перевести фразу после OCR;

  • сохранить серию коротких распознаваний в лог-файл;

  • передать распознанный текст во внешний скрипт;

  • использовать OCR в автоматизации через командную строку.

Для офисной работы Capture2Text удобна тем, что результат сразу оказывается в буфере обмена. Пользователь может выделить блок текста в PDF без OCR-слоя, нажать горячую клавишу, завершить выделение и вставить распознанный результат в Word, Excel, блокнот, CRM или форму на сайте. Для студентов и исследователей программа полезна при работе с презентациями, скриншотами, учебными материалами и электронными книгами. Для переводчиков — при копировании текста из изображений, субтитров, игр, манги или приложений, где текст недоступен как обычный текстовый слой.

Отдельная категория — пользователи, которые работают с восточноазиатскими языками. Capture2Text умеет переключать направление текста для китайского и японского OCR, поддерживает горизонтальное и вертикальное распознавание, а также имеет специальные режимы Text Line Capture, Forward Text Line Capture и Bubble Capture. Эти функции полезны при чтении манги, визуальных новелл, сканов, комиксов и интерфейсов, где текст расположен не так, как в обычном документе.

При этом Capture2Text не стоит рассматривать как универсальное средство для сложного документооборота. Если нужно распознать многостраничный договор, сохранить исходное форматирование, восстановить таблицы, получить DOCX с сохранением структуры или обработать сотни сканов, лучше использовать специализированный OCR-редактор. Capture2Text сильна именно в быстрых экранных захватах: выделил область, получил текст, вставил результат.

Запуск и общая организация программы

Capture2Text работает без привычной установки. Пользователь распаковывает папку программы и запускает файл Capture2Text.exe. После запуска значок появляется в правой части панели задач Windows, в области уведомлений. Если значок не виден сразу, он может находиться в скрытых значках трея, которые открываются через стрелку Show hidden icons.

Главная особенность интерфейса — отсутствие классического основного окна. Программа не открывает рабочее поле, не показывает список файлов и не предлагает создать проект. Она находится в фоне и ждёт горячую клавишу. Это удобно для постоянного использования: OCR доступен в любой момент поверх любой программы.

Через правый клик по значку в трее открывается меню Capture2Text. В нём расположены основные команды:

  • Settings… — открывает окно настроек;

  • Save to Clipboard — включает или отключает сохранение OCR-результата в буфер обмена;

  • Show Popup Window — включает или отключает окно с распознанным текстом;

  • OCR Language — открывает список языков распознавания;

  • Text Orientation — позволяет выбрать направление текста;

  • Help — открывает справочную информацию;

  • Exit — закрывает программу.

Меню Capture2Text в системном трее: Settings, Save to Clipboard, Show Popup Window, OCR Language, Text Orientation, Help и Exit

Такое меню выглядит простым, но в нём находятся самые важные переключатели. Например, если нужно, чтобы текст сразу копировался без дополнительного окна, достаточно оставить включённым Save to Clipboard и отключить Show Popup Window. Если нужно проверять результат перед вставкой, popup-окно лучше оставить включённым. Если распознавание выдаёт бессмысленные символы, первым делом нужно проверить пункт OCR Language и выбрать правильный язык.

Окно Settings… — главный центр настройки программы. В нём доступны вкладки:

  • Hotkeys;

  • OCR 1;

  • OCR 2;

  • Capture Box;

  • Preview;

  • Output;

  • Replace;

  • Translate;

  • Speech.

Каждая вкладка отвечает за отдельную часть работы: горячие клавиши, языки, качество OCR, рамку выделения, предпросмотр, вывод результата, исправление ошибок, перевод и озвучивание. В результате Capture2Text можно использовать как совсем простую OCR-утилиту по горячей клавише, а можно настроить под конкретные задачи: распознавание только цифр, японского вертикального текста, строк из комиксов, логирование всех захватов в файл или передачу результата в скрипт.

Интерфейс Capture2Text

Интерфейс Capture2Text минималистичен и построен вокруг системного трея. Это важно понимать до начала работы: программа не выглядит как редактор документов. У неё нет кнопки Open, списка изображений, панели слоёв, истории проектов или встроенного просмотрщика PDF. Вместо этого она работает поверх всего, что уже открыто на экране.

Основные элементы интерфейса:

Элемент Назначение
Значок в трее Доступ к меню программы и настройкам
Контекстное меню Быстрое включение буфера обмена, popup-окна, языка OCR и направления текста
Рамка OCR Capture Box Синяя область, которой пользователь выделяет текст на экране
Preview Box Предварительный показ распознаваемого текста во время захвата
Popup window Окно с готовым OCR-результатом
Settings Все параметры горячих клавиш, OCR, вывода, перевода и речи
Capture2Text_CLI.exe Командная версия для OCR файлов или области экрана

Окно настроек выглядит как компактный диалог с навигацией по разделам слева. Вкладки не перегружены визуальными эффектами: это стандартный утилитарный интерфейс Windows с чекбоксами, выпадающими списками, текстовыми полями и кнопками OK / Cancel. Такой внешний вид может показаться устаревшим, но он хорошо соответствует задаче программы: быстро настроить поведение и не тратить ресурсы на декоративную оболочку.

Окно Settings с вкладкой Hotkeys и списком действий для назначения горячих клавиш

С практической точки зрения в интерфейсе важнее не внешний вид, а предсказуемость. Все параметры находятся в одном месте. Горячие клавиши собраны на вкладке Hotkeys, языки и ограничения символов — на OCR 1, параметры автоматического захвата строк — на OCR 2, внешний вид рамки — на Capture Box, предпросмотр — на Preview, поведение результата — на Output. Благодаря этому пользователь быстро понимает, где искать нужную настройку.

Как распознать текст с экрана

Базовый сценарий Capture2Text строится вокруг горячей клавиши Windows Key + Q. Эта комбинация запускает стандартный OCR-захват прямоугольной области. Пользователь сам выбирает, какой участок экрана нужно распознать.

Порядок действий:

  1. Откройте на экране изображение, PDF, веб-страницу, окно программы или видеокадр с нужным текстом.

  2. Наведите указатель мыши на левый верхний угол текста.

  3. Нажмите Windows Key + Q.

  4. Переместите мышь так, чтобы синяя рамка накрыла весь фрагмент.

  5. При необходимости удерживайте правую кнопку мыши и перетаскивайте рамку целиком.

  6. Завершите OCR повторным нажатием Windows Key + Q, левой кнопкой мыши или клавишей Enter.

  7. Вставьте результат через Ctrl + V в нужную программу.

Выделение области стандартного OCR-захвата синей рамкой Capture2Text

Главное правило — рамка должна захватывать только нужный текст и как можно меньше лишних элементов. Если в область попали линии, иконки, фоновые рисунки, соседние колонки, обрезанные буквы или декоративные элементы, OCR может ошибиться. Для коротких фраз лучше выделять область плотно, но не обрезать верхние и нижние части символов. Для многострочного текста нужно захватить все строки целиком, оставив небольшой запас по краям.

Если включён Show Popup Window, после завершения распознавания появится окно Capture2Text — OCR Text. В нём отображается полученный текст. Кнопка OK закрывает окно. Чекбокс Topmost удерживает popup поверх других окон. Ссылка font позволяет изменить шрифт отображения текста в popup-окне.

Popup-окно Capture2Text с результатом распознавания и кнопкой OK

Если Save to Clipboard включён, результат уже находится в буфере обмена. Это значит, что popup-окно можно использовать только для проверки, а вставлять текст можно сразу. Если Save to Clipboard отключён, программа не будет автоматически отправлять результат в буфер, и пользователь будет работать с текстом через окно результата или другие настроенные способы вывода.

Для хорошего результата важно заранее выбрать правильный OCR-язык. Если на экране русский текст, активным должен быть русский язык. Если английский — английский. Если текст смешанный, например русский с английскими терминами, лучше выбирать язык, который преобладает в выбранном фрагменте. При неверном языке программа может выдавать похожие, но неверные символы, особенно в кириллице, японском, китайском и корейском тексте.

Горячие клавиши Capture2Text

Вкладка Hotkeys управляет всеми основными действиями программы. Здесь для каждого действия можно выбрать модификаторы Ctrl, Shift, Alt, Win и клавишу в выпадающем списке. Если какое-то действие не нужно, для него можно выбрать значение <Unmapped>.

Основные горячие клавиши:

Действие в настройках Стандартная комбинация Назначение
Start OCR Capture Windows Key + Q Запуск стандартного OCR-захвата прямоугольной области
Re-Capture Last Windows Key + R Повторное распознавание последней области
Text Line Capture Windows Key + E Захват ближайшей строки текста
Forward Text Line Capture Windows Key + W Захват строки от ближайшего символа вперёд
Bubble Capture Windows Key + S Захват текста внутри полностью замкнутого облака
Quick-Access Language 1 Windows Key + 1 Быстрое переключение на первый язык
Quick-Access Language 2 Windows Key + 2 Быстрое переключение на второй язык
Quick-Access Language 3 Windows Key + 3 Быстрое переключение на третий язык
Text Orientation Windows Key + O Переключение ориентации текста
Toggle Whitelist <Unmapped> Включение или отключение whitelist
Toggle Blacklist <Unmapped> Включение или отключение blacklist

Настройка горячих клавиш особенно важна, если стандартные сочетания уже заняты другими программами. Некоторые утилиты, менеджеры окон, игровые оверлеи и корпоративные приложения могут перехватывать клавиши Windows. В таком случае комбинацию Windows Key + Q можно заменить на другую. Главное — выбрать сочетание, которое удобно нажимать одной рукой и которое не конфликтует с системными действиями.

На вкладке Hotkeys для каждого действия есть чекбоксы модификаторов. Например, для стандартного OCR-захвата активен Win, а в выпадающем списке выбрана клавиша Q. Если нужно сделать комбинацию Ctrl + Shift + Q, пользователь отмечает Ctrl и Shift, снимает Win и оставляет Q. После применения настроек программа будет реагировать на новую комбинацию.

Отключение ненужных действий через <Unmapped> полезно в двух случаях. Первый — если пользователь случайно нажимает режимы, которыми не пользуется. Второй — если горячие клавиши конфликтуют с другими приложениями. Например, если не нужен Bubble Capture, его можно отключить и не держать лишнюю комбинацию активной.

Режимы захвата текста

Capture2Text поддерживает несколько способов OCR-захвата. Это не просто разные названия одной функции, а отдельные режимы для разных типов экранного текста.

Standard OCR Capture

Standard OCR Capture — основной режим работы. Он запускается через Windows Key + Q и позволяет выделить произвольную прямоугольную область экрана. Этот режим подходит для большинства задач:

  • текст на скриншоте;

  • абзац в PDF;

  • подпись на изображении;

  • строка из интерфейса;

  • фрагмент таблицы;

  • текст на веб-странице, который нельзя выделить;

  • сообщение об ошибке;

  • номер заказа;

  • фрагмент презентации;

  • субтитры в видео.

Преимущество стандартного режима — полный контроль над областью. Пользователь сам задаёт ширину и высоту рамки. Недостаток — нужно аккуратно выделять фрагмент вручную. Если текст мелкий или находится рядом с другими элементами, понадобится немного точности.

Re-Capture Last

Re-Capture Last повторяет OCR для последней области. Режим удобен, если на одном и том же месте экрана меняется текст. Например, пользователь просматривает видео с субтитрами, страницу документа, список ошибок или интерфейс программы, где новые значения появляются в одной области. Вместо того чтобы каждый раз выделять прямоугольник заново, можно один раз задать область, а затем использовать повторный захват.

Практический пример: в окне программы появляется серия кодов ошибок в одном месте. Пользователь один раз выделяет область через Start OCR Capture, затем при появлении нового кода нажимает Re-Capture Last и получает новое значение в буфере обмена.

Text Line Capture

Text Line Capture автоматически захватывает строку текста, ближайшую к указателю мыши. Стандартная комбинация — Windows Key + E. Пользователь не растягивает прямоугольник вручную, а просто ставит курсор рядом со строкой.

Пример Text Line OCR Capture: курсор ставится рядом со строкой, после горячей клавиши программа обводит распознанный текст

Этот режим удобен для коротких строк, где стандартная рамка будет лишним действием:

  • строка в интерфейсе;

  • фраза в комиксе;

  • одиночная строка субтитров;

  • номер или артикул;

  • строка в таблице;

  • подпись рядом с элементом;

  • японский или китайский текст в отдельной колонке.

На вкладке OCR 2 для Text Line Capture задаются параметры Length, Width, Look Ahead, Look Behind и Search Radius. Они определяют, насколько далеко программа ищет строку, какой ширины и длины область использовать и как учитывать символы рядом с курсором.

Forward Text Line Capture

Forward Text Line Capture распознаёт строку, начиная от символа рядом с курсором и двигаясь вперёд. Стандартная комбинация — Windows Key + W. В отличие от обычного Text Line Capture, этот режим не обязательно берёт всю строку целиком. Он полезен, когда нужно начать с определённого места.

Forward Text Line OCR Capture: захват строки начинается рядом с выбранным символом

Режим подходит для случаев, когда строка длинная, а нужен только хвост после определённого слова или символа. Например, в строке интерфейса есть метка Order ID:, а копировать нужно только значение после неё. Или в японском вертикальном тексте нужно начать распознавание с конкретного символа.

На вкладке OCR 2 у Forward Text Line Capture есть параметры Length, Width, Look Ahead, Look Behind, Start Offset, Search Radius и чекбокс First word only. Последний полезен, если нужно захватывать не всю строку, а только первое слово после начальной точки.

Bubble Capture

Bubble Capture предназначен для распознавания текста внутри полностью замкнутого комиксного облака. Стандартная комбинация — Windows Key + S. Пользователь ставит курсор в пустую часть облака, а программа пытается определить его границы и захватить текст внутри.

Bubble OCR Capture: распознавание текста внутри полностью замкнутого облака

Этот режим полезен для манги, комиксов, визуальных новелл, сканов с речевыми пузырями и иллюстраций, где текст окружён замкнутой областью. Важно, чтобы облако было действительно закрытым. Если контур разорван, фон сложный или текст выходит за границы, автоматическое определение может сработать хуже.

На вкладке OCR 2 для Bubble Capture задаются Width и Height. Эти параметры ограничивают область поиска облака вокруг курсора. Если значения слишком маленькие, программа может не захватить весь пузырь. Если слишком большие — в распознавание могут попасть лишние элементы.

Языки распознавания и русский OCR

Capture2Text поддерживает много языков OCR, включая English, French, German, Japanese, Korean, Russian и Spanish в базовом наборе. Активный язык выбирается через меню значка в трее: OCR Language → нужный язык. В этом же меню видно, какой язык используется в текущий момент.

Меню OCR Language в Capture2Text с выбором English, French, German, Japanese, Korean, Russian и Spanish

Для русского текста нужно выбирать Russian. Это особенно важно, потому что кириллические символы похожи на латинские только визуально. Если оставить English, программа может заменить русские буквы латинскими аналогами, пропустить часть символов или выдать набор похожих знаков. Для английских фраз, наоборот, лучше переключаться на English, потому что русская модель может ошибаться в латинице.

На вкладке OCR 1 есть блок Current OCR Language, где выбирается активный язык. Ниже расположен блок Quick-Access Languages со слотами Slot 1, Slot 2 и Slot 3. Эти слоты связаны с горячими клавишами Windows Key + 1, Windows Key + 2 и Windows Key + 3. Такой механизм удобен, если пользователь часто переключается между несколькими языками. Например:

  • Slot 1: Russian;

  • Slot 2: English;

  • Slot 3: Japanese.

Тогда для перехода на русский OCR достаточно нажать Windows Key + 1, для английского — Windows Key + 2, для японского — Windows Key + 3. Это быстрее, чем каждый раз открывать меню в трее.

Вкладка OCR 1 с выбором Current OCR Language, Quick-Access Languages, Whitelist, Blacklist и параметрами предварительной обработки

Качество русского OCR зависит не только от выбранного языка. На результат влияют:

  • размер шрифта;

  • контраст текста и фона;

  • отсутствие размытия;

  • ровное положение строки;

  • чёткость скриншота;

  • отсутствие декоративного фона;

  • правильное выделение области;

  • отсутствие соседних колонок;

  • отсутствие обрезанных букв;

  • масштаб изображения на экране.

Если текст мелкий, стоит увеличить масштаб окна или браузера перед распознаванием. OCR обычно лучше работает с крупными и чёткими символами. Если текст белый на тёмном фоне, Capture2Text всё равно может распознать его благодаря предварительной обработке, но сильный шум, тени, градиенты и полупрозрачность ухудшают результат. Если фрагмент наклонён, можно использовать Deskew capture. Если вокруг текста много пустых полей или лишнего фона, помогает Trim capture.

Настройки OCR 1

Вкладка OCR 1 отвечает за язык распознавания, быстрые языковые слоты, ограничения символов и предварительную обработку изображения. Это одна из самых важных вкладок программы.

Current OCR Language

Current OCR Language задаёт активный язык OCR. Именно этот язык используется при стандартном распознавании, захвате строки, повторном захвате и других OCR-режимах. Если результат выглядит как бессмысленный набор символов, первым делом нужно проверить этот список.

Additional Languages…

Ссылка Additional Languages… предназначена для перехода к работе с дополнительными языками. После добавления нужных языковых данных они появляются в списке OCR-языков. В повседневной работе пользователю обычно достаточно переключаться между уже установленными языками через Current OCR Language или меню OCR Language в трее.

Quick-Access Languages

Блок Quick-Access Languages содержит три слота:

  • Slot 1;

  • Slot 2;

  • Slot 3.

Каждый слот назначается на отдельную горячую клавишу. Это удобно для пользователей, которые регулярно работают с несколькими языками. Например, переводчик японских материалов может держать в слотах Japanese, English и Russian. Офисный пользователь может поставить Russian, English и German. После этого переключение OCR-языка занимает одно нажатие.

Whitelist

Whitelist сообщает OCR-движку, какие символы допустимы в результате. Когда включён чекбокс Enable, программа пытается распознавать только символы из заданного набора. Рядом расположены кнопки Add a-z, Add A-Z и Add 0-9, которые быстро добавляют латинские строчные буквы, латинские заглавные буквы и цифры.

Whitelist полезен для узких задач:

  • распознавание номера заказа;

  • извлечение только цифр;

  • распознавание серийного номера;

  • копирование кода подтверждения;

  • распознавание даты;

  • работа с артикулом;

  • извлечение суммы;

  • копирование индекса;

  • распознавание короткого буквенно-цифрового ID.

Например, если нужно распознавать только цифры, можно включить Whitelist, нажать Add 0-9 и не добавлять буквы. Тогда OCR будет меньше склонен принимать грязные элементы фона за буквы. Это не гарантирует идеальный результат, но помогает в задачах, где набор символов заранее ограничен.

Blacklist

Blacklist работает наоборот: он сообщает программе, какие символы не должны появляться в результате. При включённом Enable символы из blacklist исключаются из распознавания. Это удобно, если OCR регулярно добавляет ненужные знаки.

Примеры использования:

  • убрать кавычки, если они постоянно появляются ошибочно;

  • исключить латинские буквы при распознавании цифровых кодов;

  • запретить похожие символы, которые мешают распознаванию;

  • убрать знаки пунктуации при извлечении чистых чисел;

  • отфильтровать служебные символы.

Whitelist и blacklist не нужно включать без необходимости. Для обычного текста они могут ухудшить результат, если пользователь случайно исключит нужные символы. Их лучше использовать для коротких формализованных фрагментов: номеров, кодов, дат, артикулов и однотипных строк.

Text Orientation

Text Orientation задаёт ориентацию текста. Параметр особенно важен для китайского и японского текста. Доступны варианты горизонтального, вертикального и автоматического определения. При Auto программа выбирает ориентацию по форме области: если ширина значительно больше высоты, используется горизонтальное распознавание; если область узкая и высокая, применяется вертикальное.

Для русского и английского текста обычно используется горизонтальная ориентация. Для японской манги, вертикальных колонок и некоторых сканов нужно выбирать вертикальное направление или использовать переключение через горячую клавишу Text Orientation.

Tesseract Config File

Tesseract Config File — расширенная настройка для тех, кто хочет использовать отдельный конфигурационный файл Tesseract. В обычных сценариях это поле не нужно менять. Оно полезно, когда пользователь понимает параметры OCR-движка и хочет тонко управлять распознаванием.

Scale Factor

Scale Factor задаёт масштабирование изображения при предварительной обработке. Увеличение масштаба может улучшить распознавание мелкого текста, потому что OCR получает более крупные символы. Слишком высокое значение может усилить шум и сделать результат хуже. Практически этот параметр имеет смысл менять, если текст стабильно распознаётся плохо при правильном языке и хорошем выделении области.

Deskew capture

Deskew capture пытается компенсировать наклон текста. Параметр полезен для сканов, фотографий, наклонных фрагментов и изображений, где строки идут под углом. Для ровного интерфейсного текста этот чекбокс обычно не нужен.

Trim capture

Trim capture обрезает захваченное изображение до переднего плана и добавляет тонкую рамку. Это помогает, когда вокруг текста много пустого пространства или лишнего фона. Параметр может сделать OCR стабильнее, особенно на коротких строках и небольших фрагментах.

Настройки OCR 2

Вкладка OCR 2 отвечает за автоматические режимы захвата: Text Line Capture, Forward Text Line Capture и Bubble Capture. Эти параметры важны не для обычной прямоугольной рамки, а для специальных режимов, где программа сама ищет строку или область.

Вкладка OCR 2 с параметрами Text Line Capture, Forward Text Line Capture и Bubble Capture

Text Line Capture

Для Text Line Capture доступны параметры:

Параметр Что регулирует
Length Максимальная длина области, в которой ищется строка
Width Ширина области захвата строки
Look Ahead Насколько далеко смотреть вперёд от курсора
Look Behind Насколько далеко смотреть назад от курсора
Search Radius Радиус поиска текста рядом с указателем

Если строка не захватывается полностью, можно увеличить Length. Если в результат попадают соседние элементы, можно уменьшить Width или радиус поиска. Если программа начинает захват не там, где ожидается, стоит аккуратно менять Look Ahead и Look Behind.

Forward Text Line Capture

Для Forward Text Line Capture доступны:

Параметр Что регулирует
Length Длина области захвата вперёд
Width Ширина линии
Look Ahead Область поиска впереди курсора
Look Behind Область поиска позади курсора
Start Offset Смещение стартовой точки
Search Radius Радиус поиска ближайшего символа
First word only Захват только первого слова

Чекбокс First word only полезен, если нужно взять одно слово или короткое значение, а не всю строку. Например, при распознавании значения после подписи, кода в таблице или первого японского слова рядом с курсором.

Bubble Capture

Для Bubble Capture доступны параметры Width и Height. Они задают размер области, в которой программа ищет границы облака. Если облака крупные, значения нужно увеличить. Если рядом много других линий, рамок и графических элементов, слишком большая область может мешать.

Bubble Capture чувствителен к форме облака. Лучше всего он работает, когда:

  • контур облака полностью замкнут;

  • внутри достаточно пустого пространства;

  • текст не касается границы;

  • фон внутри облака светлый и ровный;

  • рядом нет других похожих контуров;

  • облако не пересекается с другими объектами.

Рамка захвата Capture Box

Вкладка Capture Box отвечает за внешний вид области выделения. Здесь можно настроить цвет фона рамки и цвет границы. В интерфейсе есть кнопки Background Color и Border Color, а также предпросмотр Sample, показывающий, как будет выглядеть область OCR-захвата.

Вкладка Capture Box с настройкой Background Color, Border Color и образцом синей области выделения

По умолчанию рамка заметная и хорошо видна на большинстве изображений. Но если пользователь часто работает с синими интерфейсами, картами, чертежами или изображениями, где рамка сливается с фоном, цвет можно изменить. Прозрачность настраивается через альфа-канал в диалоге выбора цвета. Более прозрачная рамка меньше мешает видеть текст, но может быть хуже заметна. Более плотная рамка лучше видна, но сильнее закрывает изображение.

Практический подход простой: рамка должна быть достаточно заметной, чтобы точно выделять область, но не должна закрывать символы настолько, чтобы мешать визуальной проверке. Для светлых документов хорошо подходит яркая граница. Для тёмных интерфейсов лучше выбирать более контрастный цвет.

Предпросмотр Preview

Вкладка Preview управляет блоком предварительного просмотра. Чекбокс Show Preview Box включает или отключает этот блок. Ниже доступны настройки Position, Background Color, Border Color, Text Color и Font. В центре вкладки отображается образец Sample Preview Text.

Вкладка Preview с параметрами Show Preview Box, Position, цветами и шрифтом предпросмотра

Preview помогает видеть, что программа распознаёт ещё до завершения захвата. Это удобно при точном выделении области: пользователь перемещает рамку, а предварительный текст показывает, попадает ли нужная строка в OCR. Если предпросмотр мешает, его можно выключить. Если он сливается с фоном, можно изменить фон, цвет текста и шрифт.

Параметр Position определяет, где появляется preview box. Фиксированное положение удобно, если пользователь не хочет, чтобы предпросмотр перекрывал область текста. Динамическое расположение полезно, когда нужно видеть результат рядом с выделяемым фрагментом. В реальной работе выбор зависит от размера экрана и типа материалов. На большом мониторе предпросмотр можно держать в углу. На небольшом ноутбуке иногда лучше отключить его, чтобы не закрывать документ.

Вывод результата: буфер обмена, popup, логирование и скрипты

Вкладка Output определяет, что происходит после распознавания. Это один из самых практичных разделов, потому что от него зависит поведение программы в ежедневной работе.

Вкладка Output с параметрами Save to clipboard, Show popup window, Keep line breaks, Logging, Debug и Call Executable

Save to clipboard

Save to clipboard сохраняет распознанный текст в буфер обмена. Это основной режим Capture2Text. После OCR пользователь просто вставляет результат в нужное место. Если программа используется для быстрого копирования текста из картинки, этот пункт должен быть включён.

Show popup window

Show popup window показывает окно с результатом. Оно удобно, если нужно проверять распознанный текст перед вставкой. В popup можно увидеть ошибки, лишние переносы, неправильные символы и результат перевода. Если пользователь работает с короткими кодами и уверен в качестве OCR, popup можно отключить, чтобы не закрывать экран лишним окном.

Keep line breaks

Keep line breaks сохраняет переносы строк. Если чекбокс включён, многострочный текст остаётся многострочным. Если выключен, переносы могут быть удалены или сглажены. Для абзацев, адресов, стихов, списков и таблиц переносы лучше сохранять. Для копирования одной фразы в поисковую строку или переводчик иногда удобнее получить текст одной строкой.

Logging

Блок Logging позволяет сохранять все распознавания в файл. Для этого используется чекбокс Log captures to file, поле Log File и поле Format. Формат может включать специальные токены:

Токен Назначение
${capture} Распознанный текст
${translation} Перевод
${timestamp} Время захвата
${linebreak} Перенос строки
${tab} Табуляция

Логирование полезно, если пользователь выполняет много однотипных захватов и хочет сохранить историю. Например, при разборе видеолекции можно распознавать важные фразы и автоматически складывать их в текстовый файл. При проверке интерфейсов можно собирать коды ошибок. При работе с таблицами можно сохранять значения построчно.

Пример формата для простого списка:

${capture}${linebreak}

Пример формата с временем:

${timestamp}${tab}${capture}${linebreak}

Такой вывод удобно открывать в текстовом редакторе или импортировать в таблицу.

Debug

Блок Debug предназначен для диагностики OCR. В нём есть параметры:

  • Save captured image;

  • Save enhanced image;

  • Append timestamp to image;

  • Prepend capture box coordinates to captured text.

Эти функции нужны не каждый день, но помогают понять, что именно программа отправляет на распознавание. Например, если пользователь видит плохой результат, можно сохранить исходное и обработанное изображение, а затем проверить, не слишком ли мелкий текст, не обрезаны ли буквы, не попали ли в область лишние элементы.

Call Executable

Call Executable позволяет вызвать внешнюю программу после завершения OCR. В поле можно указать путь к исполняемому файлу или скрипту и передать ему распознанный текст через токены ${capture}, ${translation} и ${timestamp}. Это расширенная функция для автоматизации.

Практические сценарии:

  • отправить OCR-результат в Python-скрипт;

  • сохранить текст в нестандартную базу;

  • передать строку в корпоративную утилиту;

  • автоматически очистить текст;

  • вызвать словарь;

  • выполнить поиск по распознанной фразе;

  • обработать перевод;

  • добавить результат в собственный журнал.

Пример команды:

C:\Anaconda3\python.exe "C:\Scripts\test.py" "${capture}" "${translation}"

Для обычного пользователя эта функция необязательна. Для технического специалиста она делает Capture2Text не просто OCR-утилитой, а источником текстовых данных для автоматизации.

Автоматическая замена текста после OCR

Вкладка Replace позволяет исправлять распознанный текст автоматически. В ней есть выпадающий список OCR Language, таблица с колонками Find (regex) и Replace With, а также кнопки Add Rows и Clear Selection.

Вкладка Replace с таблицей Find (regex) и Replace With для автоматических замен после OCR

Замену можно настроить отдельно для каждого OCR-языка. Это важно, потому что типичные ошибки у русского, английского, японского и китайского текста разные. Например, в одном языке нужно исправлять кавычки, в другом — похожие иероглифы, в третьем — лишние пробелы.

Поле Find (regex) поддерживает регулярные выражения. Это позволяет искать не только точные символы, но и шаблоны. Например, можно заменять несколько пробелов на один, удалять лишние символы в начале строки, нормализовать переносы или исправлять повторяющуюся ошибку OCR.

Примеры задач для Replace:

Проблема Что можно сделать
OCR постоянно путает похожие символы Добавить замену неправильного символа на правильный
В тексте появляются лишние пробелы Использовать регулярное выражение для нормализации пробелов
Кавычки распознаются в разном виде Привести их к одному формату
При распознавании кодов появляются лишние буквы Удалять ненужные символы заменой
В японском тексте повторяются типовые ошибки Настроить отдельный набор замен для Japanese
В результате нужны только чистые строки Удалять мусорные символы регулярными выражениями

Replace не нужно использовать как замену ручной вычитке. Это инструмент для повторяющихся ошибок. Если ошибка возникает один раз, проще поправить её вручную. Если она появляется постоянно, автоматическая замена экономит время.

Перевод текста в Capture2Text

Capture2Text умеет не только распознавать текст, но и отправлять его на перевод. Настройки перевода находятся на вкладке Translate. Здесь есть чекбоксы Append translation to clipboard и Show translation in popup window, параметр Separator, поле Server Timeout и таблица соответствия языков: OCR LanguageTranslate To (using Google Translate).

Вкладка Translate с настройкой Append translation to clipboard, Show translation in popup window и выбором языков перевода

Если включён Append translation to clipboard, перевод добавляется к тексту в буфере обмена. Разделитель задаётся через Separator. Это удобно, если нужно сразу вставить и оригинал, и перевод. Например, после распознавания японской фразы можно получить в буфере исходный текст и английский перевод.

Если включён Show translation in popup window, перевод отображается прямо в popup-окне под исходным текстом. В таком окне появляется кнопка Re-translate, позволяющая повторить перевод, и кнопка OK для закрытия.

Popup-окно Capture2Text с исходным текстом Good morning и переводом Guten Morgen

Перевод удобен для быстрых фраз, интерфейсных сообщений, коротких подписей, иностранных терминов и текстов из игр или манги. Но это не замена полноценной работе переводчика. Сначала программа выполняет OCR, затем переводит распознанный результат. Если OCR ошибся, перевод тоже будет ошибочным. Поэтому для важных текстов сначала нужно проверить исходное распознавание.

Пример практического использования:

  1. Выберите OCR Language: Japanese.

  2. На вкладке Translate укажите перевод Japanese → English.

  3. Включите Show translation in popup window.

  4. Наведите курсор на фразу в манге или игре.

  5. Выполните OCR-захват.

  6. Проверьте исходный текст и перевод в popup-окне.

Для коротких бытовых фраз этого достаточно. Для юридических, медицинских, финансовых или технически сложных текстов результат нужно проверять отдельно.

Озвучивание распознанного текста

Вкладка Speech отвечает за text-to-speech. Здесь можно включить озвучивание распознанного текста, выбрать голос и настроить параметры речи. Основные элементы вкладки:

  • Enable Text-to-speech;

  • Volume;

  • OCR Language;

  • Rate;

  • Pitch;

  • Voice;

  • Preview.

Вкладка Speech с настройками Enable Text-to-speech, Volume, Rate, Pitch, Voice и Preview

Чекбокс Enable Text-to-speech включает функцию озвучивания. Volume управляет общей громкостью. Через OCR Language выбирается язык, для которого настраивается голос. Параметры Rate и Pitch регулируют скорость и высоту речи. В списке Voice выбирается системный голос. Кнопка Preview позволяет проверить звучание на тестовой фразе.

Когда озвучивание включено и для выбранного языка задан голос, в popup-окне появляется кнопка Say. Она запускает чтение распознанного текста.

Popup-окно с кнопкой Say для озвучивания распознанного текста

Функция полезна в нескольких сценариях:

  • изучение иностранных языков;

  • проверка произношения коротких фраз;

  • озвучивание текста из изображения;

  • работа с японскими или английскими материалами;

  • контроль результата OCR на слух;

  • чтение небольших фрагментов без переключения в отдельную программу.

Качество озвучивания зависит от голосов, установленных в Windows. Если подходящего голоса нет, список Voice может быть ограничен. Для разных языков лучше выбирать соответствующий голос, иначе произношение будет некорректным.

Командная строка Capture2Text_CLI.exe

В комплекте Capture2Text есть командная утилита Capture2Text_CLI.exe. Она нужна для OCR из командной строки: можно распознавать изображения, область экрана, несколько файлов, выводить результат в файл, копировать текст в буфер обмена и использовать дополнительные параметры обработки.

Командная версия полезна не всем пользователям, но она важна для автоматизации. Через неё Capture2Text можно включать в скрипты, пакетные задачи, рабочие процессы обработки изображений и собственные инструменты.

Примеры команд:

Capture2Text_CLI.exe --screen-rect "400 200 600 300"

Эта команда распознаёт область экрана с координатами прямоугольника.

Capture2Text_CLI.exe --vertical -l "Chinese - Simplified" -i img1.png

Эта команда распознаёт вертикальный китайский текст из файла img1.png.

Capture2Text_CLI.exe -i img1.png -i img2.jpg -o result.txt

Эта команда распознаёт несколько изображений и сохраняет результат в result.txt.

Capture2Text_CLI.exe --show-languages

Эта команда показывает установленные OCR-языки.

Основные параметры CLI:

Параметр Назначение
-h, --help Показ справки
-v, --version Показ информации о версии
-b, --line-breaks Не удалять переносы строк
-d, --debug Сохранять изображения для отладки
-f, --images-file <file> Читать список изображений из файла
-i, --image <file> Распознать изображение
-l, --language <language> Выбрать OCR-язык
-o, --output-file <file> Сохранить текст в файл
--output-file-append Добавлять результат в конец файла
-s, --screen-rect <"x1 y1 x2 y2"> Распознать область экрана
-t, --vertical Распознавать вертикальный текст
-w, --show-languages Показать доступные языки
--output-format <format> Настроить формат вывода
--whitelist <characters> Распознавать только заданные символы
--blacklist <characters> Исключить заданные символы
--clipboard Отправить результат в буфер обмена
--trim-capture Обрезать изображение до переднего плана
--deskew Компенсировать наклон текста
--scale-factor <factor> Задать масштаб предварительной обработки
--tess-config-file <file> Использовать конфиг Tesseract

Параметр --output-format поддерживает токены:

Токен Значение
${capture} OCR-текст
${linebreak} Перенос строки
${tab} Табуляция
${timestamp} Время обработки
${file} Файл или экранная область

Пример вывода с именем файла и временем:

Capture2Text_CLI.exe -i img1.png -o result.txt --output-format "${timestamp}${tab}${file}${tab}${capture}${linebreak}"

CLI-режим особенно полезен, если нужно распознать серию изображений. Вместо ручного выделения области пользователь может передать список файлов через --images-file, сохранить результат в общий файл и дополнительно использовать --output-file-append.

При работе с CLI важно точно указывать язык. Название языка чувствительно к формату, поэтому для проверки установленных языков удобно использовать --show-languages. Если язык указан неверно, команда не сможет корректно выполнить OCR или даст неправильный результат.

Практические сценарии использования

Скопировать текст из картинки

Откройте изображение на экране, увеличьте масштаб так, чтобы символы были хорошо видны, наведите курсор на левый верхний угол текста и нажмите Windows Key + Q. Растяните рамку по тексту и завершите захват. Если Save to Clipboard включён, текст сразу можно вставить в редактор.

Для лучшего результата:

  • не захватывайте лишние изображения рядом с текстом;

  • избегайте обрезанных букв;

  • увеличьте масштаб, если текст мелкий;

  • выберите правильный OCR Language;

  • используйте Trim capture, если вокруг текста много пустого фона;

  • включите Show popup window, если нужно проверить результат.

Извлечь текст из PDF без текстового слоя

Если PDF является сканом, обычное выделение мышью не работает. Capture2Text решает это через экранный OCR. Откройте страницу PDF, увеличьте масштаб до комфортного размера и выделите нужный блок через Windows Key + Q. Для абзацев включите Keep line breaks, если нужно сохранить структуру строк. Если нужен текст одной строкой, переносы можно отключить.

При распознавании PDF важно не захватывать соседние колонки. Если документ двухколоночный, выделяйте одну колонку за раз. Если в область попадут обе колонки, OCR может объединить строки в неправильном порядке.

Скопировать текст из видео или субтитров

Поставьте видео на паузу, выберите язык OCR и выделите строку субтитров. Если субтитры находятся в одном и том же месте, сначала сделайте обычный захват, а затем используйте Re-Capture Last для повторного распознавания следующей строки. Это быстрее, чем каждый раз выделять область заново.

Для субтитров лучше:

  • ставить видео на паузу;

  • выбирать кадр без размытия движения;

  • выделять только строку субтитров;

  • избегать фона с сильным контрастом;

  • при необходимости увеличить масштаб видео.

Распознать номер заказа, код или дату

Для номеров, кодов и дат полезны Whitelist и Blacklist. Если нужно распознать только цифры, включите Whitelist и добавьте 0-9. Если код состоит из латинских букв и цифр, добавьте a-z, A-Z и 0-9. Это снижает вероятность появления случайных символов.

Пример: нужно распознать код A18-45X. В whitelist можно добавить латинские буквы, цифры и дефис. Тогда OCR будет меньше отвлекаться на кавычки, точки, случайные засечки и элементы фона.

Быстро перевести фразу с экрана

Выберите исходный язык через OCR Language, настройте перевод на вкладке Translate, включите Show translation in popup window и выполните OCR-захват. В popup-окне появятся исходный текст и перевод. Для иностранного интерфейса, коротких сообщений и фраз из изображения это удобнее, чем вручную перепечатывать текст в переводчик.

Распознать японский или китайский текст

Для японского и китайского текста важно правильно выбрать направление. Если текст горизонтальный, используйте горизонтальную ориентацию. Если вертикальный — вертикальную. Если программа должна выбирать сама, можно использовать Auto, но в сложных случаях ручной выбор стабильнее.

Для манги удобны:

  • Text Line Capture — когда нужно взять одну вертикальную строку;

  • Forward Text Line Capture — когда нужно начать с конкретного символа;

  • Bubble Capture — когда текст находится внутри замкнутого облака;

  • Text Orientation — для переключения горизонтального и вертикального режима;

  • Quick-Access Languages — для быстрого перехода между Japanese, English и Russian.

Использовать Capture2Text как журнал распознаваний

Если включить Log captures to file, программа будет сохранять все OCR-результаты. Это удобно для сбора цитат, кодов, ошибок, фрагментов лекций, субтитров, коротких карточек и заметок. Формат можно настроить так, чтобы каждая запись сохранялась с временем.

Пример формата:

${timestamp}${tab}${capture}${linebreak}

После этого текстовый файл можно открыть в редакторе или импортировать в таблицу.

Передавать результат во внешний скрипт

Через Call Executable можно связать Capture2Text с внешней автоматизацией. Например, после OCR Python-скрипт может очистить текст, отправить его в локальный словарь, сохранить в базу, выполнить поиск или дополнить заметку. Это удобно для пользователей, которые строят собственные рабочие процессы вокруг OCR с экрана.

Точность распознавания

Точность Capture2Text зависит от качества входного изображения и настроек OCR. Программа не понимает текст как человек. Она анализирует изображение символов и пытается сопоставить их с буквами выбранного языка. Поэтому даже хорошая OCR-утилита ошибается, если текст мелкий, размытый, наклонный, плохо контрастирует с фоном или захвачен с лишними элементами.

На точность сильнее всего влияют:

Фактор Как влияет
Язык OCR Неверный язык почти всегда ухудшает результат
Размер шрифта Слишком мелкие символы распознаются хуже
Контраст Чёткий текст на ровном фоне распознаётся лучше
Размытие Размытые буквы OCR часто путает
Наклон Наклонные строки требуют deskew
Фон Узоры, градиенты и картинки мешают символам
Область захвата Лишние элементы внутри рамки ухудшают результат
Переносы строк Могут влиять на порядок текста
Смешанные языки Требуют внимательного выбора OCR-языка
Вертикальное письмо Нужно правильно выбрать ориентацию

Для повышения точности используйте простой порядок действий:

  1. Увеличьте масштаб исходного текста.

  2. Выберите правильный OCR Language.

  3. Захватите только нужный фрагмент.

  4. Не обрезайте верх и низ букв.

  5. Включите Trim capture для коротких фрагментов.

  6. Включите Deskew capture для наклонного текста.

  7. Используйте Whitelist для кодов и цифр.

  8. Проверяйте результат в popup-окне.

  9. Настройте Replace для повторяющихся ошибок.

Capture2Text хорошо подходит для коротких и средних фрагментов: строк, абзацев, подписей, сообщений, кодов, отдельных блоков. Чем сложнее документ, тем больше ручной проверки потребуется. Таблицы, много колонок, мелкий сканированный текст, декоративные шрифты и плохие фотографии — сложные случаи для любого OCR.

История версий Capture2Text

История Capture2Text показывает, как программа развивалась от простой утилиты экранного OCR до более гибкого инструмента с настройками, CLI, переводом, автоматическими заменами, логированием и озвучиванием.

Версия Основные изменения
1.00 Первая версия программы
1.04 Появились меню выбора языка, параметры вывода, настройки рамки и масштабирования
1.06 Добавлены быстрые клавиши переключения языков
1.08 Улучшена работа с Tesseract, добавлен выбор направления текста для китайского и японского
1.10 Добавлен preview box
2.0 Появилось окно Preferences, многострочное popup-окно, сохранение переносов строк
2.1 Добавлены substitutions и командные параметры
2.2 Появился whitelist и обновлён Tesseract
2.4 Добавлены новые языки
3.0 Добавлена бинаризация захваченного изображения
3.1 Улучшена предварительная обработка изображения и распознавание текста на разных фонах
3.4 Добавлен режим Auto для направления текста и функция удаления furigana для японского
3.6 Исправлена проблема DPI scale с рамкой захвата
3.8 Обновлён Tesseract, расширена поддержка дополнительных языков
4.0 Полная переработка на Qt/C++, добавлены Translation, Re-Capture Last, Text Line Capture, Forward Text Line Capture, Bubble Capture, Replace, CLI, новые настройки preview и capture box
4.1 Добавлены toggle whitelist/blacklist, Tesseract config file, whitelist и blacklist для CLI
4.2 Добавлено логирование распознаваний в файл и форматирование вывода
4.3 Улучшен CLI-вывод после обработки файлов, добавлен токен ${file}
4.4 Добавлены portable option, trim capture, deskew и CLI-параметр --clipboard
4.5.0 Добавлена функция text-to-speech, scale factor в GUI и CLI, обновлены компоненты OCR
4.5.1 Исправлена проблема text-to-speech и сохранения некоторых данных
4.6.0 Добавлен Call Executable, улучшены замены, поддержка изображений в CLI, обновлён вид настроек
4.6.1 Исправлена ошибка с hex-символами в переводе
4.6.2 Исправлены проблемы CLI с некоторыми изображениями и текстовыми заменами
4.6.3 Улучшено отображение рамки и preview поверх окон, улучшен Text Line Capture, исправлен ${timestamp}, добавлена подсказка в трее, изменена обработка кавычек и текстовых файлов

Самый заметный перелом в развитии программы — ветка 4.0. В ней Capture2Text получила современную основу на Qt/C++, новые режимы захвата, встроенный перевод, отдельный CLI, вкладку Replace, popup по умолчанию и переработанное окно Settings. После этого развитие шло не столько в сторону изменения внешнего вида, сколько в сторону стабилизации функций: улучшались CLI-сценарии, логирование, замены, портативность, text-to-speech и обработка результатов.

Для пользователя это означает, что Capture2Text стала не просто горячей клавишей для OCR, а настраиваемой утилитой. В ней можно собрать очень разные сценарии: распознать, заменить ошибки, перевести, показать popup, сохранить в лог, вызвать скрипт.

Преимущества Capture2Text

Главное преимущество Capture2Text — быстрый OCR с экрана без лишних действий. Программа запускается в фоне, работает через горячую клавишу и по умолчанию сразу отправляет текст в буфер обмена. Для многих повседневных задач это быстрее, чем открывать скриншот в отдельном OCR-сервисе или загружать файл в большой редактор.

Сильные стороны:

  • портативный формат;

  • работа из системного трея;

  • быстрый запуск OCR через Windows Key + Q;

  • распознавание любой видимой области экрана;

  • автоматическое сохранение текста в буфер обмена;

  • popup-окно для проверки результата;

  • поддержка множества OCR-языков;

  • быстрые языковые слоты;

  • режимы Text Line Capture, Forward Text Line Capture и Bubble Capture;

  • настройка направления текста;

  • whitelist и blacklist;

  • предварительная обработка через Trim capture и Deskew capture;

  • настройка рамки захвата;

  • настройка preview box;

  • логирование результатов;

  • автоматические замены через Replace;

  • перевод через вкладку Translate;

  • text-to-speech через Speech;

  • командная утилита Capture2Text_CLI.exe;

  • возможность вызвать внешний исполняемый файл после OCR.

Особенно ценно, что Capture2Text не привязана к конкретному типу источника. Ей безразлично, открыт ли текст в браузере, PDF-просмотрщике, видеоплеере, игре, старой программе, удалённой сессии или окне настроек. Если текст виден на экране и достаточно чёткий, его можно попытаться распознать.

Недостатки и ограничения

У Capture2Text есть ограничения, которые важно понимать заранее. Это не программа для восстановления сложной структуры документов. Она не создаёт аккуратные DOCX-файлы из сканов, не сохраняет таблицы с форматированием, не управляет страницами PDF и не даёт полноценного редактора OCR-слоя. Её задача уже: быстро извлечь текст из выбранной области экрана.

Основные ограничения:

  • интерфейс выглядит утилитарно и может показаться устаревшим;

  • программа ориентирована на Windows;

  • нет полноценного редактора распознанного документа;

  • нет удобной пакетной обработки через графический интерфейс;

  • сложные таблицы распознаются как обычный текст;

  • качество зависит от исходного изображения;

  • неправильный OCR-язык резко ухудшает результат;

  • перевод требует интернет-доступа;

  • для тонкой настройки нужно разбираться во вкладках Settings;

  • CLI полезен, но рассчитан на технических пользователей;

  • popup-окно и preview требуют настройки под привычный сценарий;

  • для длинных документов ручное выделение областей неудобно.

Самая частая проблема — ожидание, что Capture2Text будет работать как профессиональный OCR-редактор. Это другая категория. Capture2Text лучше воспринимать как быстрый экранный инструмент: он берёт то, что видно сейчас, и превращает в текст. Для коротких фрагментов это удобно. Для длинных документов лучше использовать приложения, специально рассчитанные на документное OCR-распознавание.

Сравнение с аналогами

У Capture2Text есть несколько близких по назначению инструментов. Одни встроены в большие наборы утилит, другие ориентированы на кроссплатформенность, третьи сильнее в точности OCR или работе со скриншотами. Выбор зависит от того, что важнее: скорость, простота, точность, автоматизация, поддержка разных систем или дополнительные функции.

Инструмент Что умеет Сильные стороны Ограничения Когда выбирать
Microsoft PowerToys Text Extractor Копирует текст с экрана через OCR Современная интеграция с Windows, быстрый вызов, простой сценарий Меньше специализированных OCR-настроек, нет такой глубокой системы Replace/CLI внутри отдельной OCR-утилиты Когда нужен простой OCR с экрана в составе набора PowerToys
NormCap OCR-захват текста вместо скриншота Доступен для Windows, macOS и Linux, удобен как кроссплатформенный вариант Меньше ориентирован на специальные режимы вроде Bubble Capture Когда нужен экранный OCR не только на Windows
ShareX OCR OCR как часть программы для скриншотов и записи экрана Много инструментов захвата, автоматизация, работа с изображениями и публикацией OCR — одна из функций, а не центр всей программы Когда одновременно нужны скриншоты, запись, загрузка файлов и OCR
ABBYY Screenshot Reader Превращает текст с изображения экрана в редактируемый формат Сильная OCR-технология, широкая языковая поддержка, удобен для точного распознавания Коммерческая модель и меньше акцента на портативную горячую клавишу с тонкими режимами захвата строк Когда важнее качество распознавания и поддержка большого числа языков
Text Grab Извлекает текст с экрана средствами OCR Простой современный инструмент для Windows Меньше специализированных настроек для японского вертикального текста, bubble-захвата и старых сценариев Capture2Text Когда нужен минималистичный современный OCR-захват
OneNote Может извлекать текст из изображений внутри заметок Удобен, если материалы уже находятся в заметках Не предназначен для мгновенного OCR любой области экрана по горячей клавише Когда OCR нужен в составе системы заметок
Google Lens Распознаёт текст на изображениях и через камеру Удобен на мобильных устройствах, хорош для фото и переводов Менее удобен для локальной работы с произвольной областью Windows-экрана Когда текст нужно распознать с телефона или фотографии

Microsoft PowerToys Text Extractor — самый очевидный современный вариант для пользователей Windows. Он запускается горячей клавишей, позволяет выделить область и копирует текст в буфер обмена. Для простого копирования текста с экрана этого часто достаточно. Но в Capture2Text больше узких OCR-настроек: quick-access языки, отдельные режимы захвата строки, bubble capture, whitelist/blacklist, replacement rules, text-to-speech, логирование и CLI.

NormCap интересен кроссплатформенностью. Если рабочие машины включают Windows, macOS и Linux, единый подход к OCR-захвату через NormCap может быть удобнее. Но Capture2Text лучше подходит пользователю, который работает именно в Windows и хочет тонко настроить горячие клавиши, языки, область захвата и обработку результата.

ShareX сильнее как универсальный инструмент захвата экрана. Он подходит тем, кто делает скриншоты, записывает GIF, отправляет изображения на хостинги, настраивает сложные workflow и иногда использует OCR. Если нужна именно OCR-утилита, работающая в фоне по горячей клавише, Capture2Text проще и прямее.

ABBYY Screenshot Reader ориентирован на высокое качество распознавания и большое число языков. Это хороший выбор, если важнее точность и готовые форматы вывода. Capture2Text выигрывает в простоте портативного запуска, быстрых горячих клавишах, CLI и специальных режимах для строк и комиксных облаков.

Безопасность, лицензия и приватность

Capture2Text распространяется как свободная программа под лицензией GNU General Public License. Для пользователя это означает, что программа относится к open-source инструментам, а её исходный код доступен для проверки и изучения. В рабочем сценарии распознавание текста выполняется локально на компьютере, а результат сохраняется в буфер обмена, popup-окно, файл лога или передаётся во внешний исполняемый файл — в зависимости от настроек.

С точки зрения приватности важно разделять OCR и перевод. Само распознавание области экрана выполняется локально. Перевод на вкладке Translate использует интернет-доступ, потому что текст отправляется на переводческий сервис. Поэтому для конфиденциальных документов, внутренних корпоративных данных, персональных сведений и закрытых материалов перевод лучше не включать. Если нужен только локальный OCR, достаточно отключить перевод и не использовать внешние скрипты в Call Executable.

На безопасность также влияют пользовательские настройки:

  • Log captures to file сохраняет историю распознаваний, поэтому лог может содержать чувствительный текст;

  • Call Executable передаёт распознанные данные внешней программе;

  • Append translation to clipboard добавляет перевод в буфер обмена;

  • Show popup window отображает текст на экране;

  • Save captured image и Save enhanced image могут сохранять изображения с исходными данными.

Если программа используется с конфиденциальной информацией, нужно внимательно настроить вывод. Для приватного сценария обычно достаточно включить Save to clipboard, отключить логирование, не использовать перевод, не включать debug-сохранение изображений и не вызывать внешние исполняемые файлы.

Частые проблемы и решения

Значок Capture2Text не виден в трее

Значок может быть скрыт в области Show hidden icons. Нужно открыть стрелку скрытых значков на панели задач и найти значок Capture2Text. Для постоянного доступа его можно закрепить в видимой части трея средствами Windows.

Левый клик по значку ничего не делает

Меню программы открывается правым кликом по значку. Через него доступны Settings…, OCR Language, Text Orientation, Save to Clipboard, Show Popup Window и Exit.

OCR выдаёт бессмысленные символы

Проверьте OCR Language. Если распознаётся русский текст, должен быть выбран Russian. Для английского — English, для японского — Japanese. Затем проверьте качество исходного изображения и область захвата. Если текст мелкий, увеличьте масштаб. Если текст наклонён, включите Deskew capture. Если вокруг много фона, попробуйте Trim capture.

Текст копируется без переносов строк

Откройте Settings…Output и включите Keep line breaks. После этого многострочные фрагменты будут сохранять переносы.

Popup-окно не появляется

Проверьте пункт Show Popup Window в меню трея или на вкладке Output. Если он отключён, результат будет отправляться в буфер обмена без отдельного окна.

Результат не попадает в буфер обмена

Проверьте Save to Clipboard в меню трея или на вкладке Output. Если чекбокс отключён, текст не будет автоматически копироваться.

Горячая клавиша не работает

Откройте Settings…Hotkeys и проверьте назначение Start OCR Capture. Если комбинация занята другой программой, назначьте новую. Если действие отключено через <Unmapped>, выберите клавишу заново.

Рамка захвата плохо видна

Откройте Settings…Capture Box и измените Background Color или Border Color. Для светлого фона лучше использовать контрастную границу. Для тёмного интерфейса можно выбрать более яркий цвет рамки.

Preview мешает выделять текст

Откройте Settings…Preview и отключите Show Preview Box либо измените Position. Если предпросмотр нужен, но плохо читается, настройте Background Color, Text Color и Font.

В OCR попадают лишние символы

Сузьте область захвата. Если распознаётся код или номер, используйте Whitelist. Если конкретные символы появляются ошибочно, добавьте их в Blacklist или настройте вкладку Replace.

Нужно распознать только цифры

Откройте Settings…OCR 1, включите Whitelist, нажмите Add 0-9 и убедитесь, что лишние буквы не добавлены. После этого OCR будет ориентироваться на цифры.

Нужно быстро переключаться между русским и английским

На вкладке OCR 1 задайте Slot 1: Russian, Slot 2: English. Затем используйте Windows Key + 1 для русского и Windows Key + 2 для английского.

Нужен вертикальный японский текст

Выберите Japanese как OCR-язык и установите подходящий Text Orientation. Для быстрого переключения используйте горячую клавишу Windows Key + O.

Нужно убрать повторяющуюся ошибку OCR

Откройте Settings…Replace, выберите нужный OCR Language, добавьте строку через Add Rows, укажите ошибочный шаблон в Find (regex) и правильную замену в Replace With.

Нужно сохранить все распознавания

Откройте Settings…Output, включите Log captures to file, выберите Log File и настройте Format. Для простого журнала подходит ${capture}${linebreak}. Для журнала со временем — ${timestamp}${tab}${capture}${linebreak}.

Нужно восстановить настройки

Настройки можно сбросить через ссылки Reset to defaults в окне Settings. Если требуется полный сброс, можно удалить файл настроек программы, после чего Capture2Text создаст настройки заново.

Полезные настройки для разных сценариев

Для обычного копирования текста с экрана

Рекомендуемые параметры:

  • Save to clipboard — включено;

  • Show popup window — по желанию;

  • Keep line breaks — включено для абзацев, отключено для коротких фраз;

  • Current OCR Language — язык текста;

  • Trim capture — включить при нестабильном результате;

  • Deskew capture — включать только для наклонного текста.

Для распознавания кодов и номеров

Рекомендуемые параметры:

  • включить Whitelist;

  • добавить Add 0-9 для цифровых кодов;

  • добавить Add A-Z и Add a-z для буквенно-цифровых кодов;

  • добавить вручную дефис, слэш или другие допустимые символы;

  • отключить Keep line breaks, если нужен результат одной строкой;

  • включить popup для проверки.

Для японской манги

Рекомендуемые параметры:

  • Current OCR Language — Japanese;

  • настроить Text Orientation;

  • использовать Text Line Capture для отдельных строк;

  • использовать Bubble Capture для замкнутых облаков;

  • задать Japanese в один из Quick-Access Languages;

  • включить перевод на вкладке Translate, если нужен быстрый смысловой перевод;

  • использовать Replace для повторяющихся ошибок.

Для сбора цитат и заметок

Рекомендуемые параметры:

  • Save to clipboard — включено;

  • Show popup window — включено;

  • Keep line breaks — включено;

  • Log captures to file — включено;

  • Format${timestamp}${tab}${capture}${linebreak};

  • Preview Box — включить, если нужно контролировать результат до завершения OCR.

Для автоматизации

Рекомендуемые параметры:

  • использовать Capture2Text_CLI.exe;

  • задавать язык через --language;

  • сохранять результат через --output-file;

  • использовать --output-format;

  • применять --whitelist или --blacklist для формализованных данных;

  • включать --trim-capture и --deskew при необходимости;

  • использовать Call Executable для передачи результата во внешний скрипт.

Итоговая оценка

Capture2Text OCR — практичная программа для быстрого распознавания текста с экрана. Её главная ценность не в красивом интерфейсе и не в сложной работе с документами, а в скорости: нажать горячую клавишу, выделить область, получить текст в буфере обмена. Для коротких фрагментов, скриншотов, PDF без текстового слоя, интерфейсных сообщений, субтитров, кодов, японского и китайского текста это очень удобный инструмент.

Программа особенно хороша для пользователей, которым нужен портативный OCR с экрана Windows без лишних действий. Она работает из трея, поддерживает горячие клавиши, позволяет настраивать языки, направление текста, рамку захвата, preview, popup, логирование, замены, перевод, озвучивание и CLI. При грамотной настройке Capture2Text закрывает много ежедневных задач: от простого копирования текста с картинки до автоматизированной обработки OCR-результатов.

Ограничения тоже понятны. Capture2Text не заменяет профессиональные OCR-редакторы для сложных документов, не восстанавливает вёрстку многостраничных файлов и не гарантирует идеальную точность на плохих изображениях. Её нужно воспринимать как быстрый экранный OCR-инструмент. В этой роли программа остаётся сильной: она компактная, конкретная, настраиваемая и хорошо подходит для тех случаев, когда текст виден на экране, но недоступен для обычного копирования.