Chuyển đến nội dung

OCR PDF: chuyển PDF scan thành văn bản

xFormat.space chạy OCR trên file PDF scan ngay trong trình duyệt, dựng từng trang và đọc bằng mô hình nhận dạng chạy trên thiết bị, cho bạn văn bản theo từng trang mà không tải tài liệu lên.

Chạy trên trình duyệt – file không rời khỏi thiết bị.

Cách sử dụng

Nếu bạn không bôi đen hay sao chép được chữ trong PDF, có lẽ đó là bản scan – chỉ là ảnh chụp các trang. Công cụ này dựng từng trang, nhận dạng chữ ngay trên thiết bị và trả về văn bản thuần để bạn sao chép hoặc lưu lại. File PDF không bao giờ rời khỏi máy tính của bạn.

  1. 1

    Thả file PDF scan vào trang và mở OCR.

  2. 2

    Chọn ngôn ngữ của tài liệu.

  3. 3

    Bấm Bắt đầu nhận dạng, chờ mọi trang xong, rồi sao chép văn bản hoặc tải về dạng file TXT.

Bạn nhận được gì, và không nhận được gì

Kết quả là văn bản thuần, mỗi trang được đánh dấu bằng một dòng "--- Page N ---", kèm điểm tin cậy và số vùng chữ. Đây không phải PDF tìm kiếm được: công cụ không ghi lớp chữ ẩn vào file, nên PDF gốc vẫn giữ nguyên. Kết quả cũng không phải file Word. Nếu PDF của bạn vốn đã chọn được chữ, bạn không cần OCR; cứ sao chép trực tiếp.

Mẹo để OCR PDF scan chính xác

Các trang được dựng ở tỉ lệ 2x trước khi nhận dạng, nên chất lượng bản scan quyết định giới hạn trên. Bản scan khoảng 300 dpi, thẳng và tương phản cao sẽ đọc tốt hơn nhiều so với bản bị nghiêng, xám hay độ phân giải thấp. Chọn đúng ngôn ngữ, vì Tiếng Trung & tiếng Anh, Tiếng Anh, Tiếng Nhật, Tiếng Hàn, Tiếng Pháp và Tiếng Đức là các lựa chọn riêng và mỗi lần chạy chỉ dùng một. Tiếng Việt hiện không có trong danh sách. Bảng, cột và chú thích được đọc thành các dòng chữ, nên bố cục không được giữ và bạn có thể phải sắp lại thứ tự.

Việc xử lý diễn ra trên thiết bị, từng trang một, nên tài liệu dài sẽ mất thời gian, tùy phần cứng và số trang. Hãy giữ tab mở đến khi xong. Lần chạy đầu tải mô hình khoảng 15 MB, sau đó được lưu lại. Hãy soát lại tên riêng, số liệu và mọi thứ quan trọng.

Câu hỏi thường gặp

Làm sao lấy chữ từ file PDF scan?

Trên xFormat.space, thả file PDF vào trang, chọn ngôn ngữ của tài liệu và bấm Bắt đầu nhận dạng. Văn bản hiện ra theo từng trang, bạn có thể sao chép hoặc tải file TXT.

Công cụ có tạo PDF tìm kiếm được không?

Không. Nó chỉ xuất văn bản thuần và không thêm lớp chữ vào PDF. File gốc của bạn giữ nguyên.

File PDF scan có bị tải lên máy chủ không?

Không. Các trang được dựng và nhận dạng trong trình duyệt. Chỉ mô hình nhận dạng chữ được tải về, khoảng 15 MB ở lần đầu, còn PDF ở lại trên thiết bị của bạn.

OCR PDF hỗ trợ những ngôn ngữ nào?

Tiếng Trung & tiếng Anh (gồm cả tiếng Trung phồn thể), tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Pháp và tiếng Đức, mỗi lần chạy một ngôn ngữ. Tiếng Việt hiện chưa được hỗ trợ.

Vì sao kết quả OCR không chính xác?

Thường do bản scan: độ phân giải thấp, trang bị nghiêng, có bóng đổ hoặc chọn sai ngôn ngữ. Hãy dùng bản scan rõ khoảng 300 dpi, chọn đúng ngôn ngữ và soát lại kết quả.