SABLELANE PDF 指南
扫描 PDF 无法复制文字?用 OCR 添加可搜索文字层
区分扫描图片和文字 PDF,了解 OCR 的操作步骤、语言选择、额度,以及识别完成后如何检查金额和编号。
本文提供英文和简体中文版本。
为什么能看到文字,却无法选中
扫描仪或手机拍摄生成的 PDF,页面可能只是图片。阅读器显示了文字的外观,却没有能搜索或复制的文字层。可以先尝试选中一段文字,再搜索页面上一个清楚的词:如果整页只能作为图片选择,可能需要 OCR。
无法复制也可能与文件权限、字体编码或阅读器有关,并非所有情况都靠 OCR 解决。请使用自己有权处理的文件,先确认原稿类型;如果来源可以重新导出文字版 PDF,通常应优先取得那个版本。
上传前先检查扫描质量
检查页面是否完整、方向是否正确,以及小字是否清楚。严重模糊、反光、折痕和倾斜都会增加识别错误。能重新扫描时,优先改善原稿,不要期待 OCR 自动补回缺失的笔画。
Sablelane 当前单次 OCR 最多 50 页,每份文件最多 20 MB。可先提取几页代表性内容试做;包含可填写字段的文档需先固定字段内容。
选择语言并开始识别
登录工作台,上传 PDF 并选择扫描件识别。按原稿选择英文、简体中文、繁体中文或提供的中英文组合,检查页数和预计额度,再提交任务。网站的界面语言数量不等于 OCR 支持的识别语言数量。
OCR 按每个输入页 5 额度计算,10 页需要 50 额度。已有文字的页面可能跳过识别,但不要据此自行按扫描页数估价:先核对工作台的任务报价。任务完成后下载生成的 PDF。
怎样判断识别结果可用
先搜索原稿中的一个词,确认能够定位;再复制一小段内容到文本编辑器,检查阅读顺序和字符;最后逐项对照重要金额、日期、姓名及编号。特别留意 0 与 O、1 与 I 等容易混淆的字符。
输出仍然是 PDF,页面保留可见内容并增加识别文字层。能搜索不等于每个字都正确,也不代表表格已经恢复成 Excel 单元格。手写内容、复杂版式及低质量扫描不能保证准确识别,重要文件需要人工复核。
什么时候还需要其他工具
需要编辑段落时,可在核对识别结果后考虑文字导出;需要处理表格时,应先确认表格结构能否被工具识别。OCR 本身不直接交付 Word 或 Excel,不自动还原表格结构,也不会把扫描表格变成可填写的表单。
先用少量代表性页面验证效果,再决定是否处理整份文件。这样可以更早发现语言、扫描质量或版式的问题,避免在不合适的原稿上重复提交任务。