Hi LLMllm.hi.cn

专业术语密集的材料,交给模型前应怎样准备上下文?

先把材料整理成“任务说明、术语表、可核对原文、数据字段和待确认项”,再交给模型;涉及关键数值时,尽量同时提供可复制文本或原始数据,并保留原图用于复核,不要只上传扫描件。OpenAI 提醒,扫描版表格、图像或复杂版式中的准确数值可能无法被可靠提取。

先明确要模型完成什么

不要只写“分析这份文件”,而应说明:

  • 具体任务:解释术语、提取字段、比较差异,还是整理成某种格式。
  • 材料范围:使用哪些文件、章节或数据,哪些内容不纳入本次任务。
  • 输出形式:需要摘要、表格、清单,还是逐项判断。
  • 核对要求:哪些数值、定义和结论必须附原文位置。

与当前任务无关的内容可以先排除;相关段落则应保留标题、前后文和表格字段,避免只剩零散句子后失去含义。

为术语建立材料内的定义表

专业术语和缩写应按当前材料分别整理,至少注明:

  • 术语或缩写的完整写法;
  • 这份材料采用的具体含义;
  • 定义所在的章节、页码或表格位置;
  • 是否存在缩写相同、含义不同或尚未解释的情况。

同一缩写不能仅凭常识直接展开。如果材料中的定义不完整,应标为“待确认”,不要让模型自行补成确定结论。

把重要原文变成可定位、可复制的内容

长材料不必全部无差别上传,可以先提取与任务直接相关的部分,同时保留:

  • 原标题和段落关系;
  • 表格的列名、单位及必要说明;
  • 定义、结论和关键数值所在的位置;
  • 与原文件对应的来源信息。

对于扫描表格、图片和复杂版式,应另外提供关键内容的文字转写,并将转写结果与原图逐项对照。需要引用时,要求模型标出原文位置;无法辨认或无法定位的内容,应明确写成“无法确认”。

数据和计算规则也要写进上下文

如果任务涉及数据处理,应说明字段含义、单位、筛选条件、缺失值的处理方式,以及是否需要执行计算。不要只给出结果要求,却让模型自行猜测表格结构。

可以让模型按以下方式工作:

先摘录与任务直接相关的原文,再给出分析。每个关键结论或数值都应注明材料位置;看不清、缺失或存在歧义的内容标记为“无法确认”,不要自行补齐。

这样可以把材料中明确写出的内容与模型的解释、推断分开。

依赖结果前,检查代码、输出和假设

如果让模型生成代码或分析数据,OpenAI 建议在依赖结果前审查生成的代码、输出和假设。核对时重点看:

  • 代码读取的字段是否与原表一致;
  • 筛选、排序、合并和缺失值处理是否符合任务要求;
  • 输出中的关键数值能否在原材料中找到;
  • 分析是否依赖未经确认的术语定义或计算假设。

模型提供了代码和计算过程,不等于这些步骤已经正确。关键结果仍要回到原文件验证。

哪些内容必须自己确认

以下内容不应仅凭模型的整理结果作最终判断:

  • 扫描件、图片和复杂版式中的关键数值;
  • 含义不明确或在不同语境中可能变化的术语;
  • 与当前任务相关的定义、单位、日期和版本信息;
  • 存在冲突、缺页或字迹不清的材料;
  • 将用于重要决策的代码输出、分析结论和隐含假设。

最实用的准备顺序是:限定任务,补齐术语和材料结构,保留可核对的原文与数据,让模型标明出处和不确定项,再逐项检查原文件。上下文越容易追溯,模型给出的整理、比对和草拟就越便于核查,但不能替代对关键内容的人工确认。

资料来源