PDF工坊
在转换服务器处理 · 完成后立即删除

扫描 PDF 文字识别

识别扫描件里的文字,让 PDF 可以搜索。

请上传要识别文字的扫描 PDF

由扫描或照片生成的 PDF · 最大 30MB

什么时候需要识别扫描 PDF 的文字

想在扫描的合同里找一个金额,只能从头用眼睛看。扫描件整页是一张照片,在电脑看来这份文档一个字也没有,既搜不到也复制不了。

本工具会读出照片里的文字,作为一层看不见的文字铺在下面。外观和原来一模一样,但从此可以用 Ctrl+F 查找、拖选复制。文件会送到转换服务器处理,完成后立即删除。

使用方法

  1. 1上传扫描的 PDF,最大 30MB。
  2. 2点击「识别文字」,服务器会逐页读取。页数多时可能需要几分钟。
  3. 3打开结果,试试搜索或选中文字。

常见问题

准确度如何?
我们用韩文报价单做了多种条件的测试。干净的扫描件自不必说,即使做成「手机照片」的样子——倾斜两度、有噪点、发虚并经过强压缩——六行也一字不差。不过这些都是有利条件:有阴影的照片、纸张翘曲、字迹发淡的小票,效果都会差一些。
外观会变吗?
不会。原图保持不变,识别出的文字放在它下面,看不见。屏幕上没有任何变化,只有当你拖选时才会出现选中区域。
识别后能转成 Word 吗?
目前还不行。PDF 转 Word 使用的工具会跳过这种隐藏文字层,结果是空的。而「PDF → Excel」能读取这一层,如果扫描件是表格,请走那条路。
支持哪些语言?
韩文和英文,包括混在韩文文档里的英文公司名和数字。不支持日文和中文文档。
可以用在已经有文字的 PDF 上吗?
可以,但不划算。它会丢弃原有文字、把页面变成图片再重新识别,准确的文字会变成识别结果,体积也会变大。已经能搜索的 PDF 就别动了。