Przejdź do treści

OCR PDF: wyciągnij tekst z zeskanowanego PDF

xFormat.space wykonuje OCR zeskanowanych plików PDF w przeglądarce, renderując każdą stronę i odczytując ją modelem rozpoznawania działającym na urządzeniu, dzięki czemu dostajesz tekst strona po stronie bez wysyłania dokumentu.

Działa w przeglądarce — pliki nie opuszczają urządzenia.

Jak to działa

Jeśli w PDF nie da się zaznaczyć ani skopiować tekstu, to prawdopodobnie skan, czyli po prostu zdjęcia stron. To narzędzie renderuje każdą stronę, rozpoznaje na niej tekst lokalnie na twoim urządzeniu i zwraca zwykły tekst, który skopiujesz lub zapiszesz. PDF nigdy nie opuszcza twojego komputera.

  1. 1

    Przeciągnij zeskanowany PDF na stronę i otwórz OCR.

  2. 2

    Wybierz język dokumentu.

  3. 3

    Kliknij Rozpoznaj tekst, poczekaj na wszystkie strony, a potem skopiuj tekst albo pobierz go jako plik TXT.

Co dostajesz, a czego nie

Wynikiem jest zwykły tekst, w którym każda strona jest oznaczona linią „--- Page N ---”, plus wynik pewności i liczba obszarów tekstu. To nie jest przeszukiwalny PDF: narzędzie nie zapisuje do pliku ukrytej warstwy tekstowej, więc twój oryginalny PDF pozostaje bez zmian. Jeśli w twoim PDF da się już zaznaczyć tekst, OCR w ogóle nie jest potrzebny — po prostu go skopiuj.

Jak poprawić dokładność przy zeskanowanych PDF

Przed rozpoznawaniem strony są renderowane w skali 2x, więc jakość skanu wyznacza górną granicę. Skan ok. 300 dpi, prosty i kontrastowy, czyta się dużo lepiej niż krzywy, szary lub w niskiej rozdzielczości. Wybierz właściwy język, bo chiński i angielski, angielski, japoński, koreański, francuski i niemiecki to osobne opcje, a w jednym uruchomieniu możesz użyć tylko jednej. Tabele, kolumny i przypisy są czytane jako linie tekstu, więc układ nie jest zachowany i może trzeba będzie uporządkować kolejność.

Przetwarzanie odbywa się na twoim urządzeniu, strona po stronie, więc długie dokumenty trochę trwają, a czas zależy od sprzętu i liczby stron. Nie zamykaj karty, dopóki nie skończy. Przy pierwszym uruchomieniu pobiera się model, ok. 15 MB, który potem zostaje w pamięci podręcznej. Sprawdzaj nazwiska, liczby i wszystko, co ważne.

Najczęściej zadawane pytania

Jak wyciągnąć tekst z zeskanowanego PDF?

Przeciągnij PDF na stronę xFormat.space, wybierz język dokumentu i kliknij Rozpoznaj tekst. Tekst pojawi się strona po stronie i możesz go skopiować albo pobrać jako plik TXT.

Czy to tworzy przeszukiwalny PDF?

Nie. Wynikiem jest tylko zwykły tekst, a do PDF-a nie jest dodawana warstwa tekstowa. Twój oryginalny plik pozostaje bez zmian.

Czy mój zeskanowany PDF jest wysyłany na serwer?

Nie. Strony są renderowane i rozpoznawane w przeglądarce. Pobierany jest tylko model rozpoznawania tekstu, za pierwszym razem ok. 15 MB, a PDF zostaje na twoim urządzeniu.

Jakie języki działają w OCR PDF?

Chiński i angielski (także chiński tradycyjny), angielski, japoński, koreański, francuski i niemiecki, jeden na uruchomienie.

Dlaczego wynik OCR jest niedokładny?

Zwykle winny jest skan: niska rozdzielczość, krzywe strony, cienie albo zły język. Użyj wyraźnego skanu ok. 300 dpi, upewnij się, że język się zgadza, i sprawdź wynik.

Czy mogę wybrać język polski dla zeskanowanego dokumentu?

Nie ma osobnej opcji dla polskiego. OCR PDF w xFormat.space obsługuje chiński i angielski, angielski, japoński, koreański, francuski i niemiecki, po jednym na uruchomienie, a rozpoznany tekst zawsze sprawdź przed użyciem.