跳到正文

PDF OCR:提取扫描件中的文字

xFormat.space 在浏览器里对扫描版 PDF 做 OCR,逐页渲染后用本地识别模型识别,按页输出文字,文档不会上传。

在浏览器本地运行——文件不会离开你的设备。

使用步骤

PDF 里的文字选不中、复制不了,多半是扫描件,本质上只是页面的图片。这个工具会逐页渲染,在你的设备上识别文字,最后给出可复制、可保存的纯文本。PDF 不会离开你的电脑。

  1. 1

    把扫描版 PDF 拖进页面,打开 OCR 功能。

  2. 2

    选择文档所用的语言。

  3. 3

    点击“开始识别”,等所有页面处理完毕后复制文字,或下载为 TXT 文件。

能得到什么,不能得到什么

输出是纯文本,每页以“--- Page N ---”分隔,另附置信度和文字区域数量。它不是可搜索 PDF:工具不会把隐藏的文字层写回文件,所以你的原始 PDF 保持原样。如果你的 PDF 本来就能选中文字,根本不需要 OCR,直接复制即可。

提高扫描件识别准确率的建议

识别前页面会按 2 倍比例渲染,所以扫描件本身的质量决定了上限。分辨率约 300dpi、摆正、对比度高的扫描件,识别效果远好于歪斜、发灰或低分辨率的。语言要选对:中英文、英语、日语、韩语、法语、德语是各自独立的选项,每次只能选一个。表格、分栏和脚注会被当作一行行文字读取,版面不会保留,可能需要自己整理顺序。

处理在你的设备上逐页进行,文档页数多时会花一些时间,具体多久取决于你的硬件和页数。完成之前请保持标签页打开。首次使用会下载约 15 MB 的模型,之后缓存复用。人名、数字和重要内容请务必人工校对。

常见问题

怎么提取扫描版 PDF 里的文字?

把 PDF 拖进页面,选择文档语言,点“开始识别”。文字会按页显示,可以复制,也可以下载 TXT 文件。

这样能生成可搜索的 PDF 吗?

不能。它只输出纯文本,不会给 PDF 添加文字层,你的原文件不会被改动。

扫描版 PDF 会被上传到服务器吗?

不会。页面渲染和识别都在你的浏览器里完成,只有文字识别模型需要下载(首次约 15 MB),PDF 始终留在本机。

PDF OCR 支持哪些语言?

中英文(含繁体中文)、英语、日语、韩语、法语和德语,每次识别选择其中一种。

为什么识别结果不准确?

多半是扫描质量的问题:分辨率低、页面歪斜、有阴影,或者语言选错了。请使用约 300dpi 的清晰扫描件,确认语言匹配,并对输出结果进行校对。

相关教程