先看任务目标,再看上下文。任务目标规定回答要解决什么,上下文提供回答所依据的信息和限制;两者冲突时,应先判断输出有没有完成目标,再检查上下文是否足以支持该目标。简言之,上下文不能悄悄替代任务目标。
怎样快速判断是否切题?
可以把检查过程拆成两步:
| 检查顺序 | 要问的问题 | 常见的不切题表现 |
|---|---|---|
| 先看任务目标 | 回答是否完成了明确要求? | 要求比较,模型只做概括;要求给结论,模型只复述材料 |
| 再看上下文 | 回答是否使用了相关背景,正确处理了限定条件? | 偏离重点、遗漏限制,或者把上下文中的次要信息当成主要问题 |
例如,任务要求“只比较两份文件的发布日期”,模型却详细评价了内容质量,即使内容本身正确,也没有完全切题。相反,如果任务要求“根据这份记录列出待办事项”,模型忽略了记录中的时间限制,就可能虽然理解了材料,却没有满足具体要求。
上下文很多时,任务目标会不会被淹没?
会,因此需要先提取任务中的核心动作和交付形式:是解释、比较、总结、分类,还是给出判断;交付的是一句结论、一张清单,还是一段分析。随后再查看上下文中有哪些定义、材料和限制条件。
上下文不是信息越多越好。与目标无关的内容,即使回答正确,也可能造成偏题;真正影响目标能否完成的信息,则不应被省略。比较稳妥的检查方式是:遮住回答,只看原任务,逐项核对要求是否都有对应内容。
回答切题,就一定准确吗?
不一定。切题回答的是“有没有答对问题”,资料是否可靠、提取是否准确,是另一层问题。OpenAI 鼓励用户以批判性态度对待 ChatGPT,并从可靠来源核实重要信息。语气流畅、格式完整,只能说明表达看起来完整,不能替代来源核查。
核对时可以从三个问题开始:
- 这个结论来自哪项材料?
- 原材料是否直接支持该结论?
- 能否在可靠来源中找到同样的信息?
如果任务涉及扫描文件、图像表格或视觉布局复杂的文件,风险还要多留一步。OpenAI 说明,模型可能无法可靠地从这类内容中提取准确值。因此,回答中出现的数字、日期和名称,应回到原始文件或可靠来源逐项核对,不能仅凭排版整齐就认定提取无误。
最终应该怎样下判断?
先问任务目标是否被完成,再问上下文是否被正确使用,最后核对重要事实和关键数值。前两步判断“切不切题”,后一步判断“是否可信”,不能混为一谈。
任务目标和上下文都明确,却仍然无法确认某个事实时,应保留不确定性并说明待核实之处。模型可以帮助整理线索、发现矛盾和提出问题,但涉及重要信息的最终确认,仍需回到可靠来源。