本文へスキップ

PDF OCR:スキャンした PDF の文字をテキスト化

xFormat.space はスキャンした PDF の OCR をブラウザ内で行い、各ページを描画して端末上の文字認識モデルで読み取るため、書類をアップロードせずにページごとのテキストが得られます。

ブラウザで動作 — ファイルは端末から出ません。

使い方

PDF の文字を選択・コピーできないなら、それはおそらくスキャンで、ページの画像にすぎません。このツールは各ページを描画し、端末内で文字を認識して、コピーや保存ができるプレーンテキストを返します。PDF がパソコンの外に出ることはありません。

  1. 1

    スキャンした PDF をページにドロップし、OCR を開きます。

  2. 2

    書類の言語を選びます。

  3. 3

    「文字認識を開始」を押し、すべてのページが終わるのを待ってから、テキストをコピーするか TXT ファイルとしてダウンロードします。

できること・できないこと

出力はプレーンテキストで、各ページは「--- Page N ---」の行で区切られ、信頼度とテキスト領域の数も表示されます。検索可能な PDF は作りません。ファイルに透明なテキストレイヤーを書き戻さないので、元の PDF はそのままです。PDF の文字がすでに選択できるなら OCR は必要なく、そのままコピーすれば済みます。

スキャン PDF の精度を上げるコツ

ページは 2 倍の倍率で描画してから認識するので、スキャンの品質が精度の上限を決めます。300 dpi 前後で、まっすぐ、コントラストの高いスキャンは、傾いたり、グレーだったり、解像度が低いスキャンよりはるかによく読めます。正しい言語を選んでください。中国語・英語、英語、日本語、韓国語、フランス語、ドイツ語は別々の選択肢で、1 回に使えるのは 1 つだけです。表、段組み、脚注はテキストの行として読まれるので、レイアウトは保たれず、順番を整える必要があるかもしれません。

処理は端末上で 1 ページずつ行われるため、長い書類は時間がかかり、どれくらいかかるかは端末の性能とページ数によります。終わるまでタブを開いたままにしてください。初回は約 15 MB のモデルをダウンロードし、その後はキャッシュされます。名前、数字、重要な部分は見直してください。

よくある質問

スキャンした PDF の文字をテキストにするには?

xFormat.space に PDF をドロップし、書類の言語を選んで「文字認識を開始」を押します。テキストはページごとに表示され、コピーするか TXT ファイルとしてダウンロードできます。

検索可能な PDF(透明テキスト付き PDF)を作れますか?

いいえ。出力はプレーンテキストのみで、PDF にテキストレイヤーは追加しません。元のファイルはそのままです。

スキャンした PDF はサーバーにアップロードされますか?

いいえ。ページの描画と認識はブラウザ内で行われます。ダウンロードされるのは文字認識モデル(初回約 15 MB)だけで、PDF は端末に残ります。

PDF OCR はどの言語に対応していますか?

中国語・英語(繁体字を含む)、英語、日本語、韓国語、フランス語、ドイツ語で、1 回につき 1 つです。

OCR の結果が不正確なのはなぜ?

たいていはスキャンが原因です。低解像度、ページの傾き、影、言語の選択違いなどです。300 dpi 程度のきれいなスキャンを使い、言語が合っているか確認し、出力を見直してください。