OCR de PDF: Extrair Texto de PDF Escaneado
O xFormat.space faz OCR em PDFs escaneados dentro do seu navegador, renderizando cada página e lendo com um modelo de reconhecimento no próprio aparelho, para você ter o texto página por página sem enviar o documento.
Roda no seu navegador — os arquivos nunca saem do seu aparelho.
Como funciona
Se você não consegue selecionar nem copiar o texto de um PDF, ele provavelmente é uma digitalização, ou seja, só imagens das páginas. Esta ferramenta renderiza cada página, reconhece o texto localmente no seu aparelho e devolve texto simples para você copiar ou salvar. O PDF nunca sai do seu computador.
- 1
Solte um PDF escaneado na página e abra o OCR.
- 2
Escolha o idioma do documento.
- 3
Clique em Reconhecer texto, espere todas as páginas terminarem e copie o texto ou baixe como arquivo TXT.
O que você recebe e o que não recebe
A saída é texto simples, com cada página marcada por uma linha "--- Page N ---", além de uma pontuação de confiança e da contagem de regiões de texto. Não é um PDF pesquisável: a ferramenta não grava uma camada de texto oculta de volta no arquivo, então seu PDF original fica como estava. Se o seu PDF já deixa selecionar o texto, você nem precisa de OCR; é só copiar.
Dicas de precisão para PDF escaneado
As páginas são renderizadas em escala 2x antes do reconhecimento, então a qualidade da digitalização define o teto. Uma digitalização de cerca de 300 dpi, reta e com bom contraste, é lida muito melhor do que uma torta, acinzentada ou de baixa resolução. Escolha o idioma certo, já que chinês e inglês, inglês, japonês, coreano, francês e alemão são opções separadas e só dá para usar uma por vez. Tabelas, colunas e notas de rodapé são lidas como linhas de texto, então o layout não é preservado e talvez você precise arrumar a ordem.
O processamento acontece no seu aparelho, uma página por vez, então documentos longos demoram, e o tempo depende do seu hardware e do número de páginas. Deixe a aba aberta até terminar. Na primeira vez, o modelo de cerca de 15 MB é baixado e depois fica em cache. Revise nomes, números e tudo o que for importante.
Perguntas frequentes
Como extrair o texto de um PDF escaneado?
Solte o PDF na página, selecione o idioma do documento e clique em Reconhecer texto. O texto aparece página por página, e você pode copiar ou baixar um arquivo TXT.
Isso cria um PDF pesquisável?
Não. A saída é só texto simples e não acrescenta uma camada de texto ao seu PDF. Seu arquivo original fica inalterado.
Meu PDF escaneado é enviado para um servidor?
Não. As páginas são renderizadas e reconhecidas no navegador. Só o modelo de reconhecimento de texto é baixado, cerca de 15 MB na primeira vez, e o PDF fica no seu aparelho.
Quais idiomas funcionam no OCR de PDF?
Chinês e inglês (incluindo chinês tradicional), inglês, japonês, coreano, francês e alemão, um por vez.
Por que o resultado do OCR saiu errado?
Geralmente por causa da digitalização: baixa resolução, páginas tortas, sombras ou o idioma errado. Use uma digitalização nítida de cerca de 300 dpi, confira se o idioma bate e revise a saída.