OCR PDF: แปลง PDF สแกนเป็นข้อความ
xFormat.space ทำ OCR กับ PDF สแกนภายในเบราว์เซอร์ โดยเรนเดอร์ทีละหน้าแล้วอ่านด้วยโมเดลอ่านข้อความบนอุปกรณ์ คุณจึงได้ข้อความทีละหน้าโดยไม่ต้องอัปโหลดเอกสาร
ทำงานในเบราว์เซอร์ — ไฟล์ไม่ออกจากเครื่องของคุณ
วิธีใช้
ถ้าเลือกหรือคัดลอกข้อความใน PDF ไม่ได้ ไฟล์นั้นน่าจะเป็นเอกสารสแกน ซึ่งก็คือรูปภาพของหน้ากระดาษ เครื่องมือนี้เรนเดอร์แต่ละหน้า อ่านข้อความบนอุปกรณ์ของคุณ แล้วให้ข้อความธรรมดาที่คัดลอกหรือบันทึกได้ PDF ไม่ออกจากคอมของคุณ ข้อควรรู้: ตอนนี้ยังอ่านภาษาไทยไม่ได้
- 1
ลาก PDF สแกนมาวางบนหน้านี้
- 2
เลือกภาษาของเอกสาร
- 3
กดเริ่มอ่านข้อความ รอจนครบทุกหน้า แล้วคัดลอกข้อความหรือดาวน์โหลดเป็นไฟล์ TXT
สิ่งที่ได้ และสิ่งที่ไม่ได้
ผลลัพธ์เป็นข้อความธรรมดา แต่ละหน้ามีบรรทัด "--- หน้า N ---" กำกับ พร้อมค่าความมั่นใจและจำนวนบริเวณข้อความ ไม่ใช่ PDF ที่ค้นหาได้ เครื่องมือไม่ได้เขียนชั้นข้อความที่ซ่อนอยู่กลับลงไฟล์ PDF ต้นฉบับจึงยังเหมือนเดิม ถ้า PDF ของคุณเลือกข้อความได้อยู่แล้ว ก็ไม่ต้องทำ OCR เลย คัดลอกได้ทันที
เคล็ดลับให้ OCR PDF สแกนแม่นยำ
หน้าจะถูกเรนเดอร์ที่สเกล 2 เท่าก่อนอ่าน คุณภาพของการสแกนจึงเป็นเพดาน การสแกนราว 300 dpi ที่ตั้งตรงและคอนทราสต์สูงอ่านได้ดีกว่าหน้าที่เอียง สีเทา หรือความละเอียดต่ำมาก เลือกภาษาให้ถูก เพราะจีนและอังกฤษ อังกฤษ ญี่ปุ่น เกาหลี ฝรั่งเศส และเยอรมันเป็นตัวเลือกแยกกัน และใช้ได้หนึ่งภาษาต่อการอ่านหนึ่งครั้ง ตาราง คอลัมน์ และเชิงอรรถจะถูกอ่านเป็นบรรทัดข้อความ เลย์เอาต์จึงไม่ถูกรักษาไว้ และคุณอาจต้องจัดลำดับใหม่
การประมวลผลเกิดขึ้นบนอุปกรณ์ของคุณทีละหน้า เอกสารยาวจึงใช้เวลาสักพัก และนานแค่ไหนขึ้นกับฮาร์ดแวร์และจำนวนหน้า เปิดแท็บไว้จนเสร็จ ครั้งแรกจะดาวน์โหลดโมเดลประมาณ 15 MB แล้วเก็บแคชไว้ ตรวจทานชื่อ ตัวเลข และทุกอย่างที่สำคัญ
คำถามที่พบบ่อย
แปลง PDF สแกนเป็นข้อความยังไง?
ลาก PDF มาวางบนหน้านี้ เลือกภาษาของเอกสาร แล้วกดเริ่มอ่านข้อความ xFormat.space จะแสดงข้อความทีละหน้า ซึ่งคัดลอกหรือดาวน์โหลดเป็นไฟล์ TXT ได้
ได้ PDF ที่ค้นหาข้อความได้ไหม?
ไม่ได้ เครื่องมือให้แค่ข้อความธรรมดา ไม่ได้เพิ่มชั้นข้อความลงใน PDF และไฟล์ต้นฉบับไม่ถูกเปลี่ยนแปลง
PDF สแกนถูกอัปโหลดขึ้นเซิร์ฟเวอร์ไหม?
ไม่ หน้าถูกเรนเดอร์และอ่านในเบราว์เซอร์ สิ่งที่ดาวน์โหลดมีแค่โมเดลอ่านข้อความ ประมาณ 15 MB ในครั้งแรก และ PDF อยู่บนอุปกรณ์ของคุณ
OCR PDF ใช้กับภาษาอะไรได้บ้าง?
จีนและอังกฤษ (รวมจีนตัวเต็ม) อังกฤษ ญี่ปุ่น เกาหลี ฝรั่งเศส และเยอรมัน ใช้ได้หนึ่งภาษาต่อครั้ง ตอนนี้ยังไม่รองรับภาษาไทย
ทำไมผล OCR ไม่แม่นยำ?
ส่วนใหญ่เป็นเพราะการสแกน เช่น ความละเอียดต่ำ หน้าเอียง มีเงา หรือเลือกภาษาผิด ใช้การสแกนที่ชัดราว 300 dpi เลือกภาษาให้ตรง และตรวจทานผลลัพธ์