PDF OCR:スキャンした PDF の文字をテキスト化
xFormat.space はスキャンした PDF の OCR をブラウザ内で行い、各ページを描画して端末上の文字認識モデルで読み取るため、書類をアップロードせずにページごとのテキストが得られます。
ブラウザで動作 — ファイルは端末から出ません。
使い方
PDF の文字を選択・コピーできないなら、それはおそらくスキャンで、ページの画像にすぎません。このツールは各ページを描画し、端末内で文字を認識して、コピーや保存ができるプレーンテキストを返します。PDF がパソコンの外に出ることはありません。
- 1
スキャンした PDF をページにドロップし、OCR を開きます。
- 2
書類の言語を選びます。
- 3
「文字認識を開始」を押し、すべてのページが終わるのを待ってから、テキストをコピーするか TXT ファイルとしてダウンロードします。
できること・できないこと
出力はプレーンテキストで、各ページは「--- Page N ---」の行で区切られ、信頼度とテキスト領域の数も表示されます。検索可能な PDF は作りません。ファイルに透明なテキストレイヤーを書き戻さないので、元の PDF はそのままです。PDF の文字がすでに選択できるなら OCR は必要なく、そのままコピーすれば済みます。
スキャン PDF の精度を上げるコツ
ページは 2 倍の倍率で描画してから認識するので、スキャンの品質が精度の上限を決めます。300 dpi 前後で、まっすぐ、コントラストの高いスキャンは、傾いたり、グレーだったり、解像度が低いスキャンよりはるかによく読めます。正しい言語を選んでください。中国語・英語、英語、日本語、韓国語、フランス語、ドイツ語は別々の選択肢で、1 回に使えるのは 1 つだけです。表、段組み、脚注はテキストの行として読まれるので、レイアウトは保たれず、順番を整える必要があるかもしれません。
処理は端末上で 1 ページずつ行われるため、長い書類は時間がかかり、どれくらいかかるかは端末の性能とページ数によります。終わるまでタブを開いたままにしてください。初回は約 15 MB のモデルをダウンロードし、その後はキャッシュされます。名前、数字、重要な部分は見直してください。
よくある質問
スキャンした PDF の文字をテキストにするには?
xFormat.space に PDF をドロップし、書類の言語を選んで「文字認識を開始」を押します。テキストはページごとに表示され、コピーするか TXT ファイルとしてダウンロードできます。
検索可能な PDF(透明テキスト付き PDF)を作れますか?
いいえ。出力はプレーンテキストのみで、PDF にテキストレイヤーは追加しません。元のファイルはそのままです。
スキャンした PDF はサーバーにアップロードされますか?
いいえ。ページの描画と認識はブラウザ内で行われます。ダウンロードされるのは文字認識モデル(初回約 15 MB)だけで、PDF は端末に残ります。
PDF OCR はどの言語に対応していますか?
中国語・英語(繁体字を含む)、英語、日本語、韓国語、フランス語、ドイツ語で、1 回につき 1 つです。
OCR の結果が不正確なのはなぜ?
たいていはスキャンが原因です。低解像度、ページの傾き、影、言語の選択違いなどです。300 dpi 程度のきれいなスキャンを使い、言語が合っているか確認し、出力を見直してください。