PDF-Texterkennung: gescannte PDF in Text umwandeln
xFormat.space führt OCR auf gescannten PDFs in deinem Browser aus, rendert jede Seite und liest sie mit einem Erkennungsmodell auf deinem Gerät, sodass du Text Seite für Seite bekommst, ohne das Dokument hochzuladen.
Läuft in deinem Browser – Dateien verlassen dein Gerät nicht.
So funktioniert’s
Kannst du in einer PDF keinen Text markieren oder kopieren, ist sie vermutlich ein Scan – also nur Bilder von Seiten. Dieses Tool rendert jede Seite, erkennt den Text darauf lokal auf deinem Gerät und gibt reinen Text zurück, den du kopieren oder speichern kannst. Die PDF verlässt deinen Computer nie – gut für den Datenschutz bei Verträgen, Bescheiden und Rechnungen.
- 1
Zieh eine gescannte PDF auf die Seite und öffne OCR.
- 2
Wähle die Sprache des Dokuments.
- 3
Klick auf Erkennung starten, warte, bis jede Seite fertig ist, und kopiere den Text oder lade ihn als TXT-Datei herunter.
Was du bekommst – und was nicht
Die Ausgabe ist reiner Text, jede Seite markiert durch eine Zeile „--- Seite N ---“, dazu eine Konfidenz und die Zahl der Textbereiche. Es ist keine durchsuchbare PDF: Das Tool schreibt keine versteckte Textebene in die Datei zurück, deine Original-PDF bleibt also, wie sie war. Kannst du in deiner PDF bereits Text markieren, brauchst du gar keine OCR – kopier ihn einfach heraus.
Tipps für genauere Ergebnisse bei Scans
Seiten werden vor der Erkennung in doppelter Größe gerendert, die Qualität des Scans setzt also die Obergrenze. Ein Scan mit etwa 300 dpi, gerade und kontrastreich, liest sich weit besser als ein schiefer, grauer oder niedrig aufgelöster. Wähle die richtige Sprache, denn Chinesisch & Englisch, Englisch, Japanisch, Koreanisch, Französisch und Deutsch sind getrennte Optionen und pro Durchgang geht nur eine. Tabellen, Spalten und Fußnoten werden als Textzeilen gelesen, das Layout bleibt also nicht erhalten und du musst die Reihenfolge eventuell nachbessern.
Die Verarbeitung passiert auf deinem Gerät, eine Seite nach der anderen – lange Dokumente dauern also eine Weile, abhängig von deiner Hardware und der Seitenzahl. Lass den Tab offen, bis alles fertig ist. Beim ersten Mal wird das Modell geladen, etwa 15 MB, das dann zwischengespeichert bleibt. Lies Namen, Zahlen und alles Wichtige gegen.
Häufige Fragen
Wie bekomme ich den Text aus einer gescannten PDF?
Zieh die PDF bei xFormat.space auf die Seite, wähle die Sprache des Dokuments und klick auf Erkennung starten. Der Text erscheint Seite für Seite, du kannst ihn kopieren oder als TXT-Datei herunterladen.
Macht das Tool meine PDF durchsuchbar?
Nein. Es gibt nur reinen Text aus und fügt deiner PDF keine Textebene hinzu. Deine Originaldatei bleibt unverändert.
Wird meine gescannte PDF auf einen Server hochgeladen?
Nein. Die Seiten werden in deinem Browser gerendert und erkannt. Heruntergeladen wird nur das Texterkennungsmodell, beim ersten Mal etwa 15 MB, die PDF bleibt auf deinem Gerät.
Welche Sprachen funktionieren bei der PDF-OCR?
Chinesisch & Englisch (inklusive traditionellem Chinesisch), Englisch, Japanisch, Koreanisch, Französisch und Deutsch, jeweils eine pro Durchgang.
Warum ist mein OCR-Ergebnis ungenau?
Meist liegt es am Scan: niedrige Auflösung, schiefe Seiten, Schatten oder die falsche Sprache. Nimm einen klaren Scan mit etwa 300 dpi, achte auf die passende Sprache und lies die Ausgabe gegen.