开始前
- 使用清晰扫描件,并保留 PDF 作为视觉参考。
- 尤其是复杂版式,转换后应预留 Word 编辑时间。
PDF OCR
使用 高级文字识别 将扫描 PDF 页面识别成可编辑的 Word 文档。
只处理需要的页码,并把 DOCX 当作待校对的 OCR 草稿,而不是扫描版的完全还原。
PDF 与生成的 DOCX、TXT、JSON 都是临时服务器文件。默认 30 分钟清理,处理超时为十分钟。
大多数服务器文件工具的默认保留期为 30 分钟。过期文件会由定时任务清理,因此这不是精确的删除时间点。
扫描件 OCR 前如何提升识别准确度注意限制: OCR 生成可编辑文字,不能保证保留原始页面设计或每一处表格关系。
使用 OCR 将扫描 PDF 页面识别为可编辑 DOCX 文档。
上传扫描 PDF、选择语言和页面范围后,OCR 会识别文字并生成可编辑 DOCX,同时提供 TXT 和 JSON 供检查。
这个工具需要服务器端处理。上传的文件、提交的 URL 或生成的结果只会临时保存,并会按保留策略自动清理。
是的,当前工具可以直接在线使用。
这个工具需要服务器端处理。上传的文件、提交的 URL 或生成的结果只会临时保存,并会按保留策略自动清理。
不建议。服务器端和临时服务类工具更适合测试、转换和临时工作流。