OCR PDF: wyciągnij tekst z zeskanowanego PDF
xFormat.space wykonuje OCR zeskanowanych plików PDF w przeglądarce, renderując każdą stronę i odczytując ją modelem rozpoznawania działającym na urządzeniu, dzięki czemu dostajesz tekst strona po stronie bez wysyłania dokumentu.
Działa w przeglądarce — pliki nie opuszczają urządzenia.
Jak to działa
Jeśli w PDF nie da się zaznaczyć ani skopiować tekstu, to prawdopodobnie skan, czyli po prostu zdjęcia stron. To narzędzie renderuje każdą stronę, rozpoznaje na niej tekst lokalnie na twoim urządzeniu i zwraca zwykły tekst, który skopiujesz lub zapiszesz. PDF nigdy nie opuszcza twojego komputera.
- 1
Przeciągnij zeskanowany PDF na stronę i otwórz OCR.
- 2
Wybierz język dokumentu.
- 3
Kliknij Rozpoznaj tekst, poczekaj na wszystkie strony, a potem skopiuj tekst albo pobierz go jako plik TXT.
Co dostajesz, a czego nie
Wynikiem jest zwykły tekst, w którym każda strona jest oznaczona linią „--- Page N ---”, plus wynik pewności i liczba obszarów tekstu. To nie jest przeszukiwalny PDF: narzędzie nie zapisuje do pliku ukrytej warstwy tekstowej, więc twój oryginalny PDF pozostaje bez zmian. Jeśli w twoim PDF da się już zaznaczyć tekst, OCR w ogóle nie jest potrzebny — po prostu go skopiuj.
Jak poprawić dokładność przy zeskanowanych PDF
Przed rozpoznawaniem strony są renderowane w skali 2x, więc jakość skanu wyznacza górną granicę. Skan ok. 300 dpi, prosty i kontrastowy, czyta się dużo lepiej niż krzywy, szary lub w niskiej rozdzielczości. Wybierz właściwy język, bo chiński i angielski, angielski, japoński, koreański, francuski i niemiecki to osobne opcje, a w jednym uruchomieniu możesz użyć tylko jednej. Tabele, kolumny i przypisy są czytane jako linie tekstu, więc układ nie jest zachowany i może trzeba będzie uporządkować kolejność.
Przetwarzanie odbywa się na twoim urządzeniu, strona po stronie, więc długie dokumenty trochę trwają, a czas zależy od sprzętu i liczby stron. Nie zamykaj karty, dopóki nie skończy. Przy pierwszym uruchomieniu pobiera się model, ok. 15 MB, który potem zostaje w pamięci podręcznej. Sprawdzaj nazwiska, liczby i wszystko, co ważne.
Najczęściej zadawane pytania
Jak wyciągnąć tekst z zeskanowanego PDF?
Przeciągnij PDF na stronę xFormat.space, wybierz język dokumentu i kliknij Rozpoznaj tekst. Tekst pojawi się strona po stronie i możesz go skopiować albo pobrać jako plik TXT.
Czy to tworzy przeszukiwalny PDF?
Nie. Wynikiem jest tylko zwykły tekst, a do PDF-a nie jest dodawana warstwa tekstowa. Twój oryginalny plik pozostaje bez zmian.
Czy mój zeskanowany PDF jest wysyłany na serwer?
Nie. Strony są renderowane i rozpoznawane w przeglądarce. Pobierany jest tylko model rozpoznawania tekstu, za pierwszym razem ok. 15 MB, a PDF zostaje na twoim urządzeniu.
Jakie języki działają w OCR PDF?
Chiński i angielski (także chiński tradycyjny), angielski, japoński, koreański, francuski i niemiecki, jeden na uruchomienie.
Dlaczego wynik OCR jest niedokładny?
Zwykle winny jest skan: niska rozdzielczość, krzywe strony, cienie albo zły język. Użyj wyraźnego skanu ok. 300 dpi, upewnij się, że język się zgadza, i sprawdź wynik.
Czy mogę wybrać język polski dla zeskanowanego dokumentu?
Nie ma osobnej opcji dla polskiego. OCR PDF w xFormat.space obsługuje chiński i angielski, angielski, japoński, koreański, francuski i niemiecki, po jednym na uruchomienie, a rozpoznany tekst zawsze sprawdź przed użyciem.