Перейти к содержимому

Распознать текст в PDF: OCR для отсканированных документов

xFormat.space распознаёт текст в отсканированных PDF внутри вашего браузера: отрисовывает каждую страницу и читает её моделью распознавания на устройстве, так что вы получаете текст постранично без загрузки документа на сервер.

Работает в браузере — файлы не покидают ваше устройство.

Как это работает

Если в PDF нельзя выделить или скопировать текст, скорее всего, это скан — просто картинки страниц. Этот инструмент отрисовывает каждую страницу, распознаёт на ней текст локально на вашем устройстве и выдаёт обычный текст, который можно скопировать или сохранить. PDF не покидает ваш компьютер.

  1. 1

    Перетащите отсканированный PDF на страницу и откройте OCR.

  2. 2

    Выберите язык документа.

  3. 3

    Нажмите «Распознать текст», дождитесь обработки всех страниц, затем скопируйте текст или скачайте его как файл TXT.

Что вы получите, а что нет

На выходе — обычный текст, где каждая страница отмечена строкой «--- Page N ---», плюс оценка уверенности и число текстовых областей. Это не PDF с поиском: инструмент не записывает скрытый текстовый слой обратно в файл, так что исходный PDF остаётся как был. Если в вашем PDF уже можно выделить текст, OCR вообще не нужен — просто скопируйте его.

Как повысить точность для сканов

Перед распознаванием страницы отрисовываются в масштабе 2x, так что потолок задаёт качество скана. Скан около 300 dpi, ровный и контрастный, читается гораздо лучше, чем перекошенный, серый или в низком разрешении. Выберите правильный язык: китайский и английский, английский, японский, корейский, французский и немецкий — отдельные варианты, и за один запуск можно использовать только один. Русский язык не поддерживается. Таблицы, колонки и сноски читаются как строки текста, поэтому вёрстка не сохраняется, и порядок, возможно, придётся поправить.

Обработка идёт на вашем устройстве по одной странице, поэтому длинные документы занимают время — сколько именно, зависит от устройства и числа страниц. Не закрывайте вкладку, пока работа не закончится. При первом запуске скачивается модель примерно на 15 MB, которая затем кешируется. Вычитывайте имена, числа и всё важное.

Частые вопросы

Как распознать текст в отсканированном PDF?

Перетащите PDF на страницу xFormat.space, выберите язык документа и нажмите «Распознать текст». Текст появится постранично — его можно скопировать или скачать как файл TXT.

Получится ли PDF с поиском по тексту?

Нет. Инструмент выдаёт только обычный текст и не добавляет текстовый слой в PDF. Исходный файл остаётся без изменений.

Загружается ли отсканированный PDF на сервер?

Нет. Страницы отрисовываются и распознаются в браузере. Скачивается только модель распознавания текста — около 15 MB в первый раз, — а PDF остаётся на вашем устройстве.

Какие языки поддерживаются для OCR в PDF?

Китайский и английский (включая традиционный китайский), английский, японский, корейский, французский и немецкий — по одному за запуск. Русский язык не поддерживается.

Почему результат OCR неточный?

Обычно дело в скане: низкое разрешение, перекошенные страницы, тени или неверно выбранный язык. Используйте чёткий скан около 300 dpi, проверьте язык и вычитайте результат.