Naar de inhoud

PDF OCR: tekst uit gescande PDF's halen

xFormat.space voert OCR uit op gescande PDF's in je browser, geeft elke pagina weer en leest die met een herkenningsmodel op je apparaat, zodat je per pagina tekst krijgt zonder het document te uploaden.

Draait in je browser — bestanden verlaten je apparaat nooit.

Zo werkt het

Kun je in een PDF geen tekst selecteren of kopiëren, dan is het waarschijnlijk een scan: gewoon afbeeldingen van pagina's. Deze tool geeft elke pagina weer, herkent de tekst erop lokaal op je apparaat en levert platte tekst op die je kunt kopiëren of opslaan. De PDF verlaat je computer nooit.

  1. 1

    Sleep een gescande PDF op de pagina.

  2. 2

    Kies de taal van het document.

  3. 3

    Klik op Herkenning starten, wacht tot elke pagina klaar is en kopieer de tekst of download hem als TXT-bestand.

Wat je wel en niet krijgt

De uitvoer is platte tekst, met elke pagina gemarkeerd door een regel "--- Page N ---", plus een betrouwbaarheidsscore en het aantal tekstgebieden. Het is geen doorzoekbare PDF: de tool schrijft geen verborgen tekstlaag terug in het bestand, dus je originele PDF blijft zoals hij was. Kun je in je PDF al tekst selecteren, dan heb je helemaal geen OCR nodig; kopieer de tekst dan gewoon.

Tips voor nauwkeurigheid bij gescande PDF's

Pagina's worden vóór de herkenning op 2x schaal weergegeven, dus de kwaliteit van de scan bepaalt het plafond. Een scan van ongeveer 300 dpi, rechtop en met veel contrast, leest veel beter dan een scheve, grijze of lage-resolutiescan. Kies de juiste taal, want Chinees en Engels, Engels, Japans, Koreaans, Frans en Duits zijn aparte keuzes en je kunt er per keer maar één gebruiken. Tabellen, kolommen en voetnoten worden als tekstregels gelezen, dus de opmaak blijft niet behouden en je moet de volgorde misschien opschonen.

De verwerking gebeurt op je apparaat, één pagina tegelijk, dus lange documenten duren even, afhankelijk van je hardware en het aantal pagina's. Houd het tabblad open tot het klaar is. De eerste keer wordt het model van ongeveer 15 MB gedownload, dat daarna wordt bewaard. Controleer namen, cijfers en alles wat belangrijk is.

Veelgestelde vragen

Hoe haal ik tekst uit een gescande PDF?

Sleep de PDF op de pagina van xFormat.space, kies de taal van het document en klik op Herkenning starten. De tekst verschijnt per pagina, en je kunt hem kopiëren of als TXT-bestand downloaden.

Maakt dit een doorzoekbare PDF?

Nee. De uitvoer is alleen platte tekst en er wordt geen tekstlaag aan je PDF toegevoegd. Je originele bestand blijft ongewijzigd.

Wordt mijn gescande PDF naar een server geüpload?

Nee. De pagina's worden in je browser weergegeven en herkend. Alleen het tekstherkenningsmodel wordt gedownload, de eerste keer ongeveer 15 MB, en de PDF blijft op je apparaat.

Welke talen werken voor PDF OCR?

Chinees en Engels (inclusief traditioneel Chinees), Engels, Japans, Koreaans, Frans en Duits, één per keer.

Waarom is mijn OCR-resultaat onnauwkeurig?

Meestal door de scan: lage resolutie, scheve pagina's, schaduwen of de verkeerde taal. Gebruik een heldere scan van ongeveer 300 dpi, zorg dat de taal klopt en lees de uitvoer na.