Langsung ke konten

OCR PDF: Ambil Teks dari PDF Hasil Scan

xFormat.space menjalankan OCR pada PDF hasil scan di dalam browser Anda, merender setiap halaman dan membacanya dengan model pengenal di perangkat, sehingga Anda mendapat teks per halaman tanpa mengunggah dokumen.

Berjalan di browser — file tidak pernah keluar dari perangkat Anda.

Cara pakai

Jika teks di PDF tidak bisa dipilih atau disalin, kemungkinan besar itu hasil scan, yang isinya hanya gambar halaman. Alat ini merender setiap halaman, mengenali teksnya secara lokal di perangkat Anda, dan menghasilkan teks biasa yang bisa disalin atau disimpan. PDF tidak pernah keluar dari komputer Anda.

  1. 1

    Taruh PDF hasil scan di halaman ini lalu buka OCR.

  2. 2

    Pilih bahasa dokumen.

  3. 3

    Klik Mulai Pengenalan, tunggu sampai semua halaman selesai, lalu salin teksnya atau unduh sebagai file TXT.

Apa yang Anda dapat, dan apa yang tidak

Hasilnya berupa teks biasa, dengan setiap halaman ditandai baris "--- Page N ---", ditambah skor keyakinan dan jumlah area teks. Ini bukan PDF yang bisa dicari: alat tidak menulis lapisan teks tersembunyi kembali ke file, jadi PDF asli Anda tetap seperti semula. Jika teks di PDF Anda sudah bisa dipilih, Anda sama sekali tidak butuh OCR; cukup salin langsung.

Tips akurasi untuk PDF hasil scan

Halaman dirender pada skala 2x sebelum dikenali, jadi kualitas scan menentukan batas atasnya. Scan sekitar 300 dpi yang tegak dan kontrasnya tinggi terbaca jauh lebih baik daripada yang miring, abu-abu, atau resolusinya rendah. Pilih bahasa yang tepat, karena Tionghoa & Inggris, Inggris, Jepang, Korea, Prancis, dan Jerman adalah pilihan terpisah dan Anda hanya bisa memakai satu per proses. Tabel, kolom, dan catatan kaki dibaca sebagai baris teks, jadi tata letak tidak dipertahankan dan Anda mungkin perlu merapikan urutannya.

Pemrosesan terjadi di perangkat Anda, satu halaman demi satu halaman, jadi dokumen panjang butuh waktu, dan lamanya tergantung perangkat keras dan jumlah halaman. Biarkan tab terbuka sampai selesai. Pemakaian pertama mengunduh model sekitar 15 MB, yang lalu disimpan di cache. Periksa ulang nama, angka, dan apa pun yang penting.

Pertanyaan yang sering diajukan

Bagaimana cara mengambil teks dari PDF hasil scan?

Taruh PDF di halaman xFormat.space ini, pilih bahasa dokumen, lalu klik Mulai Pengenalan. Teks muncul per halaman, dan bisa Anda salin atau unduh sebagai file TXT.

Apakah ini membuat PDF yang bisa dicari?

Tidak. Hasilnya hanya teks biasa dan tidak menambahkan lapisan teks ke PDF Anda. File asli tidak berubah.

Apakah PDF hasil scan saya diunggah ke server?

Tidak. Halaman dirender dan dikenali di browser Anda. Yang diunduh hanya model pengenal teks, sekitar 15 MB saat pertama kali, dan PDF tetap di perangkat Anda.

Bahasa apa saja yang bisa dipakai untuk OCR PDF?

Tionghoa & Inggris (termasuk Tionghoa tradisional), Inggris, Jepang, Korea, Prancis, dan Jerman, satu bahasa per proses.

Kenapa hasil OCR saya tidak akurat?

Biasanya karena hasil scan-nya: resolusi rendah, halaman miring, bayangan, atau bahasa yang salah. Gunakan scan yang jelas sekitar 300 dpi, pastikan bahasanya sesuai, dan periksa ulang hasilnya.