OCR de PDF: pasar un PDF escaneado a texto
xFormat.space hace OCR de PDF escaneados dentro de tu navegador, renderizando cada página y leyéndola con un modelo de reconocimiento en tu dispositivo, así que obtienes el texto página por página sin subir el documento.
Funciona en tu navegador: los archivos nunca salen de tu dispositivo.
Cómo funciona
Si no puedes seleccionar ni copiar el texto de un PDF, seguramente es un escaneo, es decir, solo imágenes de páginas. Esta herramienta renderiza cada página, reconoce el texto localmente en tu dispositivo y te devuelve texto plano que puedes copiar o guardar. El PDF nunca sale de tu computadora.
- 1
Suelta un PDF escaneado en la página y abre OCR.
- 2
Elige el idioma del documento.
- 3
Haz clic en Reconocer texto, espera a que terminen todas las páginas y luego copia el texto o descárgalo como archivo TXT.
Qué obtienes y qué no
El resultado es texto plano, con cada página marcada con una línea "--- Página N ---", además de una puntuación de confianza y el número de zonas de texto. No es un PDF con texto buscable: la herramienta no escribe una capa de texto oculta dentro del archivo, así que tu PDF original queda como estaba. Si tu PDF ya te deja seleccionar el texto, no necesitas OCR; simplemente cópialo.
Consejos de precisión para PDF escaneados
Las páginas se renderizan a escala 2x antes del reconocimiento, así que la calidad del escaneo marca el techo. Un escaneo de unos 300 dpi, derecho y con buen contraste se lee mucho mejor que uno torcido, grisáceo o de baja resolución. Elige el idioma correcto, ya que chino e inglés, inglés, japonés, coreano, francés y alemán son opciones separadas y solo puedes usar una por reconocimiento; el español no aparece como opción propia. Las tablas, columnas y notas al pie se leen como líneas de texto, así que el diseño no se conserva y puede que tengas que ordenar el texto.
El proceso se hace en tu dispositivo, página por página, así que los documentos largos tardan un rato, y cuánto depende de tu equipo y del número de páginas. Deja la pestaña abierta hasta que termine. La primera vez se descarga el modelo, unos 15 MB, que después queda en caché. Revisa los nombres, los números y todo lo importante.
Preguntas frecuentes
¿Cómo saco el texto de un PDF escaneado?
En xFormat.space suelta el PDF en la página, elige el idioma del documento y haz clic en Reconocer texto. El texto aparece página por página, y puedes copiarlo o descargarlo como archivo TXT.
¿Esto crea un PDF con texto buscable?
No. Solo genera texto plano y no añade una capa de texto a tu PDF. Tu archivo original no cambia.
¿Mi PDF escaneado se sube a un servidor?
No. Las páginas se renderizan y se reconocen en tu navegador. Solo se descarga el modelo de reconocimiento de texto, unos 15 MB la primera vez, y el PDF se queda en tu dispositivo.
¿Qué idiomas funcionan con el OCR de PDF?
Chino e inglés (incluido el chino tradicional), inglés, japonés, coreano, francés y alemán, uno por cada reconocimiento. El español no está entre las opciones.
¿Por qué el resultado del OCR tiene errores?
Normalmente por el escaneo: baja resolución, páginas torcidas, sombras o el idioma equivocado. Usa un escaneo nítido de unos 300 dpi, comprueba que el idioma coincide y revisa el resultado.