MV Tools

表格提取实操

如何将图片和扫描 PDF 中的表格提取到 Excel

通过本地化操作截图,把图片表格转换为可复核的电子表格草稿,并系统检查结构与数值。

MV Tools 编辑团队更新于 约 9 分钟阅读

打开图片表格转 Excel

先根据源文件选择工具

表格来自截图、扫描图片或照片时,使用“图片表格转 Excel”;表格位于 PDF 内,并且可能只需处理部分页面时,使用“PDF 表格转 Excel”。即使 PDF 可以选择文字,其视觉行列与内部文本顺序也可能不同,生成的工作簿仍需复核。

本篇把同一份简单表格制成 PNG 和纯图片 PDF。它包含一行表头、五行数据和四列;已知第一季度合计为 751,第二季度合计为 787,方便在提取后做有意义的校验。

PNG 与纯图片 PDF 使用同一份自制中文表格,便于公平比较两条提取流程。
PNG 与纯图片 PDF 使用同一份自制中文表格,便于公平比较两条提取流程。

准备更容易识别的源文件

优先使用原始导出文件或扫描件。页面保持正向,为最小字号保留足够分辨率,并裁掉无关文字和过大空白。拍照时应压平纸张,避免反光、阴影与透视变形。

OCR 语言应与大多数单元格一致。无边框表格、合并单元格、多行内容、模糊线条、手写字、货币符号和混合语言都更难判断,因为行列结构是根据文字位置推断出来的。

  • 使用清晰原图,不要使用“截图的截图”。
  • 确保表头和网格边界清晰可见。
  • 处理长报告前,先测试一页最有代表性的复杂表格。
  • 不要为了试用流程而上传机密材料。

用图片表格转 Excel 处理 PNG

打开上方的图片表格转 Excel,按截图设置。手机端控件会纵向排列,但含义和操作顺序相同。

  1. 选择对应语言的示例 PNG。

    选择 mvtools-table-sample.png。选中文件不会自动开始处理。

  2. 匹配语言与预处理设置。

    本例选择简体中文并开启图片预处理;如果清晰原图处理后反而变差,应与关闭预处理的结果比较。

  3. 确认首行是否真是表头。

    “工作项目、区域、第一季度、第二季度”都是列名,因此本例开启表头;报告标题或第一条数据不应这样处理。

  4. 只提交一次并等待结果。

    开始提取后等待任务完成,避免重复提交同一文件。

图 1 · 选择图片、匹配 OCR 语言,再判断预处理与表头选项是否符合源文件。
图 1 · 选择图片、匹配 OCR 语言,再判断预处理与表头选项是否符合源文件。

下载前先读懂图片提取结果

这次真实任务从 52 KB PNG 中识别出 6 行、4 列和 24 个单元格,平均置信度为 100.0%。这是清晰自制样例的结果,不能推导到拍摄票据或密集报表。

先在预览中检查错列、漏行和表头,再下载两种格式:XLSX 便于用电子表格核对,JSON 则保留提取结构与识别信息。

  1. 先核对行列数量。

    预期为 6 × 4;数量异常时,应立即检查源文件和选项。

  2. 用置信度安排复核顺序。

    即使平均值很高,也要优先检查小字、标点、编号和低对比度区域。

  3. 对照可见预览。

    预览应按源图顺序显示四个表头和五个工作项目。

    图 3 · 打开完整 XLSX 或 JSON 前,先用最多 20 行的预览检查结构。
    图 3 · 打开完整 XLSX 或 JSON 前,先用最多 20 行的预览检查结构。
图 2 · 实际任务识别出 6 × 4 网格,共 24 个单元格。
图 2 · 实际任务识别出 6 × 4 网格,共 24 个单元格。

从扫描 PDF 提取指定页面

PDF 示例把同一表格放在单页纯图片 PDF 中。选择文件与简体中文,开启预处理和表头,并输入第 1 页。长文档可输入 1,3-5 只处理指定页面;留空则在上限内处理全部页面。

PDF 表格转 Excel 会为每个处理页面创建一个工作表。本次处理一页,生成 1 个工作表,平均置信度为 100.0%。跨页连续表格因此需要人工合并。

  1. 先测试有代表性的页面。

    测试页应包含表头、数字以及文档中最难处理的布局。

  2. 保留期望的页码顺序。

    按想要的处理顺序输入页码;重复页码会被忽略。

  3. 核对页数和工作表数量。

    本例处理一页,结果应恰好有一个工作表。

    图 5 · PDF 实际任务处理一页,并生成一个工作表。
    图 5 · PDF 实际任务处理一页,并生成一个工作表。
图 4 · 这个样例明确选择第 1 页;长文档可使用页码和范围语法。
图 4 · 这个样例明确选择第 1 页;长文档可使用页码和范围语法。

审核工作簿,而不只看预览

打开 XLSX,逐格与源图比较,并验证第一季度合计 751、第二季度合计 787。还要检查日期、小数点与千分位、负号、前导零、编号、空单元格、列顺序和行对齐。

OCR 返回的是识别值,而不是原始表格逻辑。公式、数据类型、合并表头和格式都应按需重建。重要数据应始终保留源文件,并在决策或发布前对照。

发现的问题建议处理方式
多出或缺少一列裁掉干扰内容、校正方向或增强网格后,只重试一张表。
数字看起来合理但实际错误先比对合计,再逐字核对高影响数值。
合并或多行单元格错位在工作簿中按源表手动恢复结构。
表格延续到下一页逐个核对工作表,确认无误后再合并。

了解限制和临时文件规则

图片表格转 Excel 支持单张最大 25 MB 的 JPG、PNG、TIFF、BMP 或 WebP,默认超时五分钟。PDF 表格转 Excel 支持单个最大 100 MB、最多 50 页的 PDF,会拒绝加密或受密码保护的文件,默认超时十分钟。两个工具均支持英语、简体中文、日语、德语、法语、西班牙语和葡萄牙语。

在线工具会把源文件和结果上传到服务器,通常在 30 分钟后清理。请及时下载 XLSX 与 JSON,并自行保存原件。本指南提供的练习文件是公开的自制静态样例,不属于用户任务的临时留存。

常见问题

平均置信度高,能保证每个 Excel 单元格都正确吗?

不能。它只能概括识别信心并帮助安排复核顺序;数字、编号、合计和表格结构仍需与源文件对照。

第一行应该标记为表头吗?

只有第一行确实包含列名时才开启。报告标题或第一条数据应关闭该选项。

可以只处理 PDF 的部分页面吗?

可以。输入 1,3-5 这样的页码与范围;留空则处理上限 50 页以内的全部页面。