Hi LLMllm.hi.cn

长文档分段处理,怎样做才便于复核与回填?

把长文档处理成“可定位、可比对、可回填”的记录,比单纯按篇幅切块更便于核查。关键做法是:按内容边界分段,为每段保留来源位置,将提取结果与回填目标分开记录,并对不确定内容单独标记。

OpenAI 提醒,扫描文件、基于图像的表格或视觉布局复杂的文件,其中包含的准确数值可能无法被可靠提取。因此,原文与提取结果不能只保留一份:文字需要可回指,图像和复杂表格需要保留原图位置。

分段时保留可回溯关系

优先在标题、段落和表格边界处分段,让每个片段保留完整语义。表格应连同表头、注释及相邻说明一起处理,避免只剩下一段脱离上下文的文字。

每个片段可以记录以下信息:

记录项 用途
分段标识 准确定位具体片段
来源位置 记录页码、章节、段落或表格名称
原文依据 保存对应文字;视觉内容保留原图或截图位置
待回填字段 说明该片段对应哪个目标字段
提取结果 保存模型生成的值、摘要或整理结果
风险标记 标出模糊、缺少上下文或无法确认之处
核对记录 记录回填位置、核对状态和复核意见

如果调整了片段顺序,也应能通过分段标识重新找到原出处,而不是只依赖当前文本顺序。

把提取与回填分开

先形成独立的提取记录,再把确认后的内容写入目标文件。这样可以逐项对照原文,也便于发现错填、漏填或回填到错误字段的情况。

复核时按以下顺序处理:

  1. 打开来源位置,确认原文实际表达了什么。
  2. 将原文与待回填字段逐项对照,不只检查大致意思。
  3. 核对数值是否来自清晰可见的原图或文字。
  4. 检查相邻段落、表头和注释是否改变了字段含义。
  5. 确认无误后再回填,并保留核对记录。

数值和模型输出要重点复核

对于扫描表格、图像或复杂版式中的数值,应优先查看原图。若数值无法在原文中直接确认,就保留“待核对”标记,不把推测写成确定结果。

OpenAI 还建议,在依赖数据分析结果前审查生成的代码、输出和假设。表达流畅、格式完整,都不能代替这一步核查。

哪些内容仍需自己确认

回填前仍应确认:

  • 每个结果能否追溯到明确的原文位置;
  • 图像中的数值是否清晰,表头和注释是否齐全;
  • 跨段整理是否遗漏了限定条件;
  • 提取结果与原文不一致时,采用了哪一处依据;
  • 最终写入的字段是否与原片段对应;
  • 生成的代码、输出和假设是否已经检查。

最终应保留一套能沿“回填结果—目标字段—原文片段”反向查找的记录。模型可以协助提取和整理,但无法直接取回的数值,以及无法从原貌确认的关系,仍需人工判断。

资料来源