先把材料整理成“任务说明、术语表、可核对原文、数据字段和待确认项”,再交给模型;涉及关键数值时,尽量同时提供可复制文本或原始数据,并保留原图用于复核,不要只上传扫描件。OpenAI 提醒,扫描版表格、图像或复杂版式中的准确数值可能无法被可靠提取。
先明确要模型完成什么
不要只写“分析这份文件”,而应说明:
- 具体任务:解释术语、提取字段、比较差异,还是整理成某种格式。
- 材料范围:使用哪些文件、章节或数据,哪些内容不纳入本次任务。
- 输出形式:需要摘要、表格、清单,还是逐项判断。
- 核对要求:哪些数值、定义和结论必须附原文位置。
与当前任务无关的内容可以先排除;相关段落则应保留标题、前后文和表格字段,避免只剩零散句子后失去含义。
为术语建立材料内的定义表
专业术语和缩写应按当前材料分别整理,至少注明:
- 术语或缩写的完整写法;
- 这份材料采用的具体含义;
- 定义所在的章节、页码或表格位置;
- 是否存在缩写相同、含义不同或尚未解释的情况。
同一缩写不能仅凭常识直接展开。如果材料中的定义不完整,应标为“待确认”,不要让模型自行补成确定结论。
把重要原文变成可定位、可复制的内容
长材料不必全部无差别上传,可以先提取与任务直接相关的部分,同时保留:
- 原标题和段落关系;
- 表格的列名、单位及必要说明;
- 定义、结论和关键数值所在的位置;
- 与原文件对应的来源信息。
对于扫描表格、图片和复杂版式,应另外提供关键内容的文字转写,并将转写结果与原图逐项对照。需要引用时,要求模型标出原文位置;无法辨认或无法定位的内容,应明确写成“无法确认”。
数据和计算规则也要写进上下文
如果任务涉及数据处理,应说明字段含义、单位、筛选条件、缺失值的处理方式,以及是否需要执行计算。不要只给出结果要求,却让模型自行猜测表格结构。
可以让模型按以下方式工作:
先摘录与任务直接相关的原文,再给出分析。每个关键结论或数值都应注明材料位置;看不清、缺失或存在歧义的内容标记为“无法确认”,不要自行补齐。
这样可以把材料中明确写出的内容与模型的解释、推断分开。
依赖结果前,检查代码、输出和假设
如果让模型生成代码或分析数据,OpenAI 建议在依赖结果前审查生成的代码、输出和假设。核对时重点看:
- 代码读取的字段是否与原表一致;
- 筛选、排序、合并和缺失值处理是否符合任务要求;
- 输出中的关键数值能否在原材料中找到;
- 分析是否依赖未经确认的术语定义或计算假设。
模型提供了代码和计算过程,不等于这些步骤已经正确。关键结果仍要回到原文件验证。
哪些内容必须自己确认
以下内容不应仅凭模型的整理结果作最终判断:
- 扫描件、图片和复杂版式中的关键数值;
- 含义不明确或在不同语境中可能变化的术语;
- 与当前任务相关的定义、单位、日期和版本信息;
- 存在冲突、缺页或字迹不清的材料;
- 将用于重要决策的代码输出、分析结论和隐含假设。
最实用的准备顺序是:限定任务,补齐术语和材料结构,保留可核对的原文与数据,让模型标明出处和不确定项,再逐项检查原文件。上下文越容易追溯,模型给出的整理、比对和草拟就越便于核查,但不能替代对关键内容的人工确认。