把长文档处理成“可定位、可比对、可回填”的记录,比单纯按篇幅切块更便于核查。关键做法是:按内容边界分段,为每段保留来源位置,将提取结果与回填目标分开记录,并对不确定内容单独标记。
OpenAI 提醒,扫描文件、基于图像的表格或视觉布局复杂的文件,其中包含的准确数值可能无法被可靠提取。因此,原文与提取结果不能只保留一份:文字需要可回指,图像和复杂表格需要保留原图位置。
分段时保留可回溯关系
优先在标题、段落和表格边界处分段,让每个片段保留完整语义。表格应连同表头、注释及相邻说明一起处理,避免只剩下一段脱离上下文的文字。
每个片段可以记录以下信息:
| 记录项 | 用途 |
|---|---|
| 分段标识 | 准确定位具体片段 |
| 来源位置 | 记录页码、章节、段落或表格名称 |
| 原文依据 | 保存对应文字;视觉内容保留原图或截图位置 |
| 待回填字段 | 说明该片段对应哪个目标字段 |
| 提取结果 | 保存模型生成的值、摘要或整理结果 |
| 风险标记 | 标出模糊、缺少上下文或无法确认之处 |
| 核对记录 | 记录回填位置、核对状态和复核意见 |
如果调整了片段顺序,也应能通过分段标识重新找到原出处,而不是只依赖当前文本顺序。
把提取与回填分开
先形成独立的提取记录,再把确认后的内容写入目标文件。这样可以逐项对照原文,也便于发现错填、漏填或回填到错误字段的情况。
复核时按以下顺序处理:
- 打开来源位置,确认原文实际表达了什么。
- 将原文与待回填字段逐项对照,不只检查大致意思。
- 核对数值是否来自清晰可见的原图或文字。
- 检查相邻段落、表头和注释是否改变了字段含义。
- 确认无误后再回填,并保留核对记录。
数值和模型输出要重点复核
对于扫描表格、图像或复杂版式中的数值,应优先查看原图。若数值无法在原文中直接确认,就保留“待核对”标记,不把推测写成确定结果。
OpenAI 还建议,在依赖数据分析结果前审查生成的代码、输出和假设。表达流畅、格式完整,都不能代替这一步核查。
哪些内容仍需自己确认
回填前仍应确认:
- 每个结果能否追溯到明确的原文位置;
- 图像中的数值是否清晰,表头和注释是否齐全;
- 跨段整理是否遗漏了限定条件;
- 提取结果与原文不一致时,采用了哪一处依据;
- 最终写入的字段是否与原片段对应;
- 生成的代码、输出和假设是否已经检查。
最终应保留一套能沿“回填结果—目标字段—原文片段”反向查找的记录。模型可以协助提取和整理,但无法直接取回的数值,以及无法从原貌确认的关系,仍需人工判断。