MV Tools

OCR 图文实操

扫描件 OCR 前如何提升识别准确度

从一张包含中文、数字和表格的演示扫描页开始,走完上传、预处理、语言选择、结果下载和人工核对流程。

MV Tools 编辑团队更新于 约 8 分钟阅读

打开高级图片 OCR

先确定你真正需要的输出

单张图片需要文字、逐行置信度和 JSON 时,使用高级图片 OCR;需要保留 PDF 并让文字可搜索、可复制时,使用 PDF OCR;需要可编辑 DOCX 草稿时,使用扫描 PDF 转 Word。它们都不能替代人工核对,尤其是姓名、金额、编号、法律文本和表格。

本教程选择高级图片 OCR,是因为它会同时提供 TXT、结构化 JSON、识别行数和平均置信度,适合观察“识别出了什么”以及“先检查哪里”。

自制扫描样例。页面包含中文段落、数字、状态和表格线条,适合在 OCR 后逐项复核。
自制扫描样例。页面包含中文段落、数字、状态和表格线条,适合在 OCR 后逐项复核。

上传前让扫描件更容易识别

尽量使用最清晰的源文件。页面保持正向,避免阴影和反光,裁掉过大的空白边缘,并让最小字号仍有足够分辨率。清晰、正对页面的扫描件通常比体积更大但模糊的照片更可靠。

下面这张样例特意保留了中文、数字、状态词和表格线条,方便识别后回到原图逐项比较。练习时不要为了测试上传证件、合同或私人照片。

  • 优先使用原始扫描件,而不是截图的截图。
  • 手机拍摄时压平页面、均匀补光,并避免透视变形。
  • 页面混合语言时选择最接近的语言选项,并手动检查混合语言段落。
  • 先处理一页有代表性的难页,再决定是否批量处理档案。

上传图片,选择语言和预处理

打开上方的高级图片 OCR。教程截图来自真实中文版桌面界面;屏幕较窄时布局会变成上下排列,但操作顺序不变。

  1. 选择一张图片。

    在图片输入区域选择 mvtools-ocr-scan.png。选中文件本身不会开始识别。

  2. 选择最匹配的 OCR 语言。

    本例选择“简体中文”。语言会影响识别模型和字符解释;混合语言文件应在结果中重点检查另一种语言的段落。

  3. 在拍摄或光线不均时开启预处理。

    本例保持“图像预处理”开启。它可以帮助处理低对比度、光线不均或拍摄页面,但不能修复原图已经丢失的细节。

图 1 · 先核对文件名,再选择语言并决定是否开启预处理。
图 1 · 先核对文件名,再选择语言并决定是否开启预处理。

运行 OCR,读懂结果面板

点击“运行 PaddleOCR”并等待任务完成。处理中不要重复提交;完成后先看状态、语言、行数和平均置信度,再下载文本或 JSON。

  1. 确认任务已完成。

    COMPLETED 表示服务产出了结果文件,不表示所有字符都正确。

  2. 把置信度当作排序线索。

    本例平均置信度为 93.6%。先检查低对比度的小字、数字、符号和表格边缘,再检查其余内容。

  3. 下载两个结果。

    TXT 适合快速阅读和编辑;JSON 保留逐行置信度、框坐标和结构化信息,适合进一步检查。

图 2 · 真实运行结果:125 KB 图片识别出 18 行,平均置信度 93.6%。
图 2 · 真实运行结果:125 KB 图片识别出 18 行,平均置信度 93.6%。

对照原图复核文字和结构

打开 TXT,先通读识别文本,再打开 JSON 查看每一行的 confidence、box 和 polygon。把原图与输出并排比较,重点查看最容易影响实际工作的区域。

本例的 OCR 文本预览如下。网页中的预览不能代替完整文件检查;文章顶部可以下载原图、TXT 和 JSON。

图 3 · TXT 预览适合快速阅读,但数字、符号和表格关系仍要回看原图。
图 3 · TXT 预览适合快速阅读,但数字、符号和表格关系仍要回看原图。
  • 文字内容:没有漏字、重复字、错别字或异常空格。
  • 数字与符号:编号、日期、小数点、连字符和单位逐个核对。
  • 结构关系:表格行列、段落顺序、印章、签名和手写内容没有被误读。
  • 实际用途:确认输出满足编辑、检索或归档目的;重要内容保留原始扫描件。
自制扫描样例。页面包含中文段落、数字、状态和表格线条,适合在 OCR 后逐项复核。
自制扫描样例。页面包含中文段落、数字、状态和表格线条,适合在 OCR 后逐项复核。
识别文本面板。点击可放大,实际复核应同时打开完整 TXT 或 JSON。
识别文本面板。点击可放大,实际复核应同时打开完整 TXT 或 JSON。

了解限制、隐私和下一步工具

高级图片 OCR 支持单张最大 25 MB 的 JPG、PNG、TIFF、BMP、WebP 图片,默认处理超时为五分钟。PDF OCR 支持最大 100 MB、100 页的 PDF;扫描 PDF 转 Word 支持最大 100 MB、50 页的 PDF。加密或损坏的 PDF 可能失败。

这些任务会把文件上传到服务器,默认保留 30 分钟并定期清理。请及时下载结果,不要把任务链接当作云盘或永久分享地址;只上传你有权在线处理的文件。

遇到的情况下一步操作
小字、数字或表格错误回到原图改善清晰度、方向和光线,再用一页代表性样例重试。
PDF 已有可选文字通常不需要 OCR;直接使用文字层可以避免引入新的识别错误。
需要可搜索 PDF使用 PDF OCR,并在输出中检查文字层是否覆盖正确页面。
需要编辑草稿使用扫描 PDF 转 Word,再把 DOCX 当作草稿逐段核对。

常见问题

置信度高是否代表文字一定正确?

不代表。置信度是安排检查顺序的信号,不能保证语义、姓名、数字或版面结构正确。

有文字层的电子 PDF 还需要 OCR 吗?

通常不需要。OCR 主要用于扫描件或图片型页面,对已有文字层再次识别可能引入新错误。

为什么表格顺序会错?

OCR 读取的是视觉区域,不是原始文档结构。请核对列顺序;如果目标是电子表格,应使用表格专用工具。