Распознать текст в PDF: OCR для отсканированных документов
xFormat.space распознаёт текст в отсканированных PDF внутри вашего браузера: отрисовывает каждую страницу и читает её моделью распознавания на устройстве, так что вы получаете текст постранично без загрузки документа на сервер.
Работает в браузере — файлы не покидают ваше устройство.
Как это работает
Если в PDF нельзя выделить или скопировать текст, скорее всего, это скан — просто картинки страниц. Этот инструмент отрисовывает каждую страницу, распознаёт на ней текст локально на вашем устройстве и выдаёт обычный текст, который можно скопировать или сохранить. PDF не покидает ваш компьютер.
- 1
Перетащите отсканированный PDF на страницу и откройте OCR.
- 2
Выберите язык документа.
- 3
Нажмите «Распознать текст», дождитесь обработки всех страниц, затем скопируйте текст или скачайте его как файл TXT.
Что вы получите, а что нет
На выходе — обычный текст, где каждая страница отмечена строкой «--- Page N ---», плюс оценка уверенности и число текстовых областей. Это не PDF с поиском: инструмент не записывает скрытый текстовый слой обратно в файл, так что исходный PDF остаётся как был. Если в вашем PDF уже можно выделить текст, OCR вообще не нужен — просто скопируйте его.
Как повысить точность для сканов
Перед распознаванием страницы отрисовываются в масштабе 2x, так что потолок задаёт качество скана. Скан около 300 dpi, ровный и контрастный, читается гораздо лучше, чем перекошенный, серый или в низком разрешении. Выберите правильный язык: китайский и английский, английский, японский, корейский, французский и немецкий — отдельные варианты, и за один запуск можно использовать только один. Русский язык не поддерживается. Таблицы, колонки и сноски читаются как строки текста, поэтому вёрстка не сохраняется, и порядок, возможно, придётся поправить.
Обработка идёт на вашем устройстве по одной странице, поэтому длинные документы занимают время — сколько именно, зависит от устройства и числа страниц. Не закрывайте вкладку, пока работа не закончится. При первом запуске скачивается модель примерно на 15 MB, которая затем кешируется. Вычитывайте имена, числа и всё важное.
Частые вопросы
Как распознать текст в отсканированном PDF?
Перетащите PDF на страницу xFormat.space, выберите язык документа и нажмите «Распознать текст». Текст появится постранично — его можно скопировать или скачать как файл TXT.
Получится ли PDF с поиском по тексту?
Нет. Инструмент выдаёт только обычный текст и не добавляет текстовый слой в PDF. Исходный файл остаётся без изменений.
Загружается ли отсканированный PDF на сервер?
Нет. Страницы отрисовываются и распознаются в браузере. Скачивается только модель распознавания текста — около 15 MB в первый раз, — а PDF остаётся на вашем устройстве.
Какие языки поддерживаются для OCR в PDF?
Китайский и английский (включая традиционный китайский), английский, японский, корейский, французский и немецкий — по одному за запуск. Русский язык не поддерживается.
Почему результат OCR неточный?
Обычно дело в скане: низкое разрешение, перекошенные страницы, тени или неверно выбранный язык. Используйте чёткий скан около 300 dpi, проверьте язык и вычитайте результат.