面对多个备选方案,先淘汰不匹配目标或硬约束的,再比较证据可靠性、风险和可复核性。不要按模型的自信程度、表达篇幅或推荐顺序直接做决定:听起来完整,不等于已经得到外部材料证实。
先用五个问题筛一遍
| 核对维度 | 要问的问题 | 处理方式 |
|---|---|---|
| 目标 | 这个方案具体解决什么问题? | 删除答非所问的方案 |
| 硬约束 | 哪些条件必须满足? | 不满足就不能进入最终比较 |
| 证据 | 关键判断依据是什么? | 回到可靠来源逐项核实 |
| 风险 | 判断错误会造成什么影响? | 对高影响、难撤回的部分加强核查 |
| 验证 | 怎样用低成本方法检验? | 优先测试可逆、可小范围验证的方案 |
其中一个环节答不上来,不代表方案一定错误,但应标记为“待确认”,不能当作已经满足。
硬约束与偏好要分开
比较前,把要求分成三类:
- 必须满足:不满足就淘汰。
- 越满足越好:用于比较符合程度。
- 目前未知:继续查证,不能默认为满足。
如果方案涉及费用、期限、政策、资格、合同条款或结果承诺,应以对应的一手材料为准。没有明确材料时,可以写“未查到”,不要让模型自行补齐数字、条件或保证。
关键判断要回到来源
阅读方案时,可以把内容拆成三类:已知事实、模型推断和操作建议。三者混在一起时,模型的推断很容易看起来像已经确认的事实。
OpenAI建议用户以批判性态度对待 ChatGPT,并从可靠来源核实重要信息。实际核查时,不必平均检查每个句子,应优先核对那些会改变决策的陈述,例如:
- 依据是否来自原始材料,而非另一份模型总结;
- 来源是否真的支持该结论;
- 信息是否适用于当前对象和场景;
- 模型有没有遗漏条件、例外或不确定性。
如果不同材料之间存在冲突,应保留冲突并继续核实,而不是让模型替你选定一个更顺耳的答案。
用相同标准比较,而不是比较文风
可以让模型把所有方案放进同一张表,固定列出目标、步骤、所需条件、关键依据、风险和待确认项,并要求它把事实、推断与建议分开。信息不足的地方统一写“未查到”,不要补写。
OpenAI 帮助中心还建议:如果需要更一致的行为,可以添加一两个清晰示例。示例最好展示你需要的回答结构、判断维度和表达方式,而不是用来制造并不存在的先例。
需要注意,输出一致不等于内容正确。示例能够减少格式和取舍方式的波动,不能替代来源核查。
最后保留一张待确认清单
做出选择前,再问三个问题:
- 这个决定最依赖哪条尚未核实的信息?
- 如果这条信息后来发生变化,方案是否容易撤回?
- 哪个具体步骤可以先验证这一点,而不是一次性全面执行?
因此,更稳妥的取舍标准是:目标一致、硬约束合格、关键证据可查、风险可控、结果能够复核。如果几个方案在这些条件下仍无法区分,下一步应补齐证据,而不是继续让模型润色或重新排名。