PDF 文字辨識:把掃描 PDF 轉成文字
xFormat.space 在瀏覽器裡對掃描 PDF 做 OCR,逐頁轉譯後用裝置上的辨識模型讀取,逐頁輸出文字,文件完全不上傳。
在瀏覽器本機執行,檔案不會離開你的裝置。
使用步驟
如果 PDF 裡的文字選不起來、也複製不了,多半是掃描檔,本質上只是一頁頁的圖片。這個工具會逐頁轉譯,在你的裝置上辨識文字,最後給你可以複製或儲存的純文字。PDF 不會離開你的電腦。
- 1
把掃描 PDF 拖進頁面,打開 OCR。
- 2
選擇文件使用的語言。
- 3
按「開始辨識」,等所有頁面處理完畢,再複製文字或下載成 TXT 檔。
你會得到什麼、不會得到什麼
輸出是純文字,每頁以一行「--- Page N ---」標示,並附上信賴度和文字區塊數量。它不是可搜尋的 PDF:工具不會把隱藏的文字層寫回檔案,所以你的原始 PDF 維持原樣。如果你的 PDF 本來就能選取文字,就完全不需要 OCR,直接複製就好。
提高掃描 PDF 辨識準確度的訣竅
頁面在辨識前會以 2 倍比例轉譯,所以掃描品質決定了上限。約 300 dpi、擺正、對比清楚的掃描檔,辨識效果遠比歪斜、灰濛或低解析度的好。語言要選對:中英文、英文、日文、韓文、法文和德文是各自獨立的選項,每次只能用一種。表格、分欄和註腳會被當成一行行文字讀取,版面不會保留,可能需要自己整理順序。
處理在你的裝置上逐頁進行,頁數多的文件會花一段時間,實際多久取決於你的硬體和頁數。完成之前請保持分頁開著。第一次使用會下載約 15 MB 的模型,之後會快取。姓名、數字和重要內容請務必校對。
常見問題
掃描的 PDF 要怎麼轉成文字?
把 PDF 拖進 xFormat.space 的頁面,選擇文件語言,按「開始辨識」。文字會逐頁顯示,可以複製,也能下載 TXT 檔。
這樣會產生可搜尋的 PDF 嗎?
不會。它只輸出純文字,不會在 PDF 裡加入文字層,你的原始檔案不會被更動。
掃描 PDF 會被上傳到伺服器嗎?
不會。頁面轉譯和辨識都在你的瀏覽器裡完成。只有文字辨識模型需要下載(第一次約 15 MB),PDF 一直留在你的裝置上。
PDF OCR 支援哪些語言?
中英文(含繁體中文)、英文、日文、韓文、法文和德文,每次辨識選一種。
為什麼 OCR 結果不準確?
通常是掃描的問題:解析度低、頁面歪斜、有陰影,或語言選錯。請使用約 300 dpi 的清晰掃描檔,確認語言相符,並校對輸出內容。