先确定你真正需要的输出
单张图片需要文字、逐行置信度和 JSON 时,使用高级图片 OCR;需要保留 PDF 并让文字可搜索、可复制时,使用 PDF OCR;需要可编辑 DOCX 草稿时,使用扫描 PDF 转 Word。它们都不能替代人工核对,尤其是姓名、金额、编号、法律文本和表格。
本教程选择高级图片 OCR,是因为它会同时提供 TXT、结构化 JSON、识别行数和平均置信度,适合观察“识别出了什么”以及“先检查哪里”。
上传前让扫描件更容易识别
尽量使用最清晰的源文件。页面保持正向,避免阴影和反光,裁掉过大的空白边缘,并让最小字号仍有足够分辨率。清晰、正对页面的扫描件通常比体积更大但模糊的照片更可靠。
下面这张样例特意保留了中文、数字、状态词和表格线条,方便识别后回到原图逐项比较。练习时不要为了测试上传证件、合同或私人照片。
- 优先使用原始扫描件,而不是截图的截图。
- 手机拍摄时压平页面、均匀补光,并避免透视变形。
- 页面混合语言时选择最接近的语言选项,并手动检查混合语言段落。
- 先处理一页有代表性的难页,再决定是否批量处理档案。
上传图片,选择语言和预处理
打开上方的高级图片 OCR。教程截图来自真实中文版桌面界面;屏幕较窄时布局会变成上下排列,但操作顺序不变。
选择一张图片。
在图片输入区域选择 mvtools-ocr-scan.png。选中文件本身不会开始识别。
选择最匹配的 OCR 语言。
本例选择“简体中文”。语言会影响识别模型和字符解释;混合语言文件应在结果中重点检查另一种语言的段落。
在拍摄或光线不均时开启预处理。
本例保持“图像预处理”开启。它可以帮助处理低对比度、光线不均或拍摄页面,但不能修复原图已经丢失的细节。
运行 OCR,读懂结果面板
点击“运行 PaddleOCR”并等待任务完成。处理中不要重复提交;完成后先看状态、语言、行数和平均置信度,再下载文本或 JSON。
确认任务已完成。
COMPLETED 表示服务产出了结果文件,不表示所有字符都正确。
把置信度当作排序线索。
本例平均置信度为 93.6%。先检查低对比度的小字、数字、符号和表格边缘,再检查其余内容。
下载两个结果。
TXT 适合快速阅读和编辑;JSON 保留逐行置信度、框坐标和结构化信息,适合进一步检查。
对照原图复核文字和结构
打开 TXT,先通读识别文本,再打开 JSON 查看每一行的 confidence、box 和 polygon。把原图与输出并排比较,重点查看最容易影响实际工作的区域。
本例的 OCR 文本预览如下。网页中的预览不能代替完整文件检查;文章顶部可以下载原图、TXT 和 JSON。
- 文字内容:没有漏字、重复字、错别字或异常空格。
- 数字与符号:编号、日期、小数点、连字符和单位逐个核对。
- 结构关系:表格行列、段落顺序、印章、签名和手写内容没有被误读。
- 实际用途:确认输出满足编辑、检索或归档目的;重要内容保留原始扫描件。
了解限制、隐私和下一步工具
高级图片 OCR 支持单张最大 25 MB 的 JPG、PNG、TIFF、BMP、WebP 图片,默认处理超时为五分钟。PDF OCR 支持最大 100 MB、100 页的 PDF;扫描 PDF 转 Word 支持最大 100 MB、50 页的 PDF。加密或损坏的 PDF 可能失败。
这些任务会把文件上传到服务器,默认保留 30 分钟并定期清理。请及时下载结果,不要把任务链接当作云盘或永久分享地址;只上传你有权在线处理的文件。
| 遇到的情况 | 下一步操作 |
|---|---|
| 小字、数字或表格错误 | 回到原图改善清晰度、方向和光线,再用一页代表性样例重试。 |
| PDF 已有可选文字 | 通常不需要 OCR;直接使用文字层可以避免引入新的识别错误。 |
| 需要可搜索 PDF | 使用 PDF OCR,并在输出中检查文字层是否覆盖正确页面。 |
| 需要编辑草稿 | 使用扫描 PDF 转 Word,再把 DOCX 当作草稿逐段核对。 |
常见问题
置信度高是否代表文字一定正确?
不代表。置信度是安排检查顺序的信号,不能保证语义、姓名、数字或版面结构正确。
有文字层的电子 PDF 还需要 OCR 吗?
通常不需要。OCR 主要用于扫描件或图片型页面,对已有文字层再次识别可能引入新错误。
为什么表格顺序会错?
OCR 读取的是视觉区域,不是原始文档结构。请核对列顺序;如果目标是电子表格,应使用表格专用工具。