功能说明 #
“扫描件提取”用于从公文扫描件中自动提取元数据,包括题名、责任者、日期、文号等字段,直接用于档案著录,省去人工录入。它面向的是已经数字化、带文字层的”双层 PDF”。
自动提取字段 #
| 字段 | 含义 | 示例 |
|---|---|---|
| 题名 | 文件标题 | 关于印发 2024 年度工作计划的通知 |
| 责任者 | 发文机关 | 呼和浩特市农牧业局 |
| 日期 | 成文日期 | 20240315 |
| 文号 | 发文字号 | 呼农牧发〔2024〕1 号 |
支持格式 #
- 文件类型:PDF
- 单文件大小上限:200 MB
AI 辅助提取 #
建议启用 AI 辅助:当 OCR 识别置信度较低时,系统会自动调用大模型补全提取结果,提升弱清晰度扫描件的字段命中率。
重要前提:必须是双层 PDF #
该功能仅支持双层 PDF(含文字层)。对于纯扫描件(只有图像、无可识别文字层)、JPG、PNG 等格式,系统无法提取,会返回错误说明。如果手头是纯图片扫描件,需先用 OCR 工具生成带文字层的 PDF 后再上传。
常见问题 #
上传后提示不支持该文件? #
多半是文件没有文字层(纯图片 PDF / JPG / PNG)。请用 OCR 工具转成双层 PDF 后再提取。
提取的日期格式是怎样的? #
成文日期统一输出为 8 位纯数字(如 20240315),便于后续系统化和排序。