扫描件元数据提取

< 1 min read

功能说明 #

“扫描件提取”用于从公文扫描件中自动提取元数据,包括题名、责任者、日期、文号等字段,直接用于档案著录,省去人工录入。它面向的是已经数字化、带文字层的”双层 PDF”。

自动提取字段 #

字段 含义 示例
题名 文件标题 关于印发 2024 年度工作计划的通知
责任者 发文机关 呼和浩特市农牧业局
日期 成文日期 20240315
文号 发文字号 呼农牧发〔2024〕1 号

支持格式 #

  • 文件类型:PDF
  • 单文件大小上限:200 MB

AI 辅助提取 #

建议启用 AI 辅助:当 OCR 识别置信度较低时,系统会自动调用大模型补全提取结果,提升弱清晰度扫描件的字段命中率。

重要前提:必须是双层 PDF #

该功能仅支持双层 PDF(含文字层)。对于纯扫描件(只有图像、无可识别文字层)、JPG、PNG 等格式,系统无法提取,会返回错误说明。如果手头是纯图片扫描件,需先用 OCR 工具生成带文字层的 PDF 后再上传。

常见问题 #

上传后提示不支持该文件? #

多半是文件没有文字层(纯图片 PDF / JPG / PNG)。请用 OCR 工具转成双层 PDF 后再提取。

提取的日期格式是怎样的? #

成文日期统一输出为 8 位纯数字(如 20240315),便于后续系统化和排序。

更新 2026年7月30日

您的感觉是什么

  • Happy
  • 常规
  • Sad