把大模型放在边界清楚、结果可检查、出错后容易回退的环节;凡是难以撤销、会影响外部对象,或决定是否采用某个结果的判断,应设置人工批准点。自动生成不等于自动放行,自动执行也不等于可以绕过审批。
哪些步骤适合自动运行
在输入已经提供、任务目标明确、结果能够核对的情况下,大模型适合承担重复性的处理工作:
| 工作环节 | 自动运行的前提 | 典型检查点 |
|---|---|---|
| 提取、分类与格式转换 | 输入范围明确,不补造缺失内容 | 抽查关键字段及原文对应关系 |
| 摘要与要点整理 | 忠实于给定材料 | 检查是否遗漏限制条件或改变原意 |
| 文案、邮件和方案草拟 | 只生成供人审阅的草稿 | 批准最终版本后再对外使用 |
| 代码生成与初步测试 | 执行环境受控,权限和影响范围受限 | 审查代码后再运行,核对输出后再采用 |
| 多份材料的初步比较 | 评价标准事先写清 | 确认比较依据及异常项 |
这类任务可以提高处理速度,但自动化范围应止于草稿、建议或受控执行。一旦任务开始改变真实系统、发送外部信息或产生难以恢复的后果,就应转入人工批准。
哪些判断要由人批准
数据将如何使用
OpenAI 的数据控制功能允许用户选择是否将对话用于训练 OpenAI 模型。工作流负责人应确认这项选择符合实际用途和预期,而不是把未经确认的状态直接视为授权。
分析结果是否值得依赖
OpenAI 在 ChatGPT 数据分析说明中建议:在依赖结果之前,审查生成的代码、输出和假设。
因此,模型生成分析代码后,可以先在受控环境中运行;但“能够运行”并不等于“结论可靠”。批准者至少需要检查:
- 代码读取了哪些数据,采用了什么处理方法;
- 输出是否与输入及代码逻辑一致;
- 假设是否适合当前任务,有没有遗漏例外情况;
- 结论能否追溯到实际数据,而不是只因表达流畅就被接受。
是否执行有外部影响的动作
删除内容、修改权限、发布内容、发送邮件、提交订单等动作,应在执行前展示最终对象、具体内容和影响范围,并由人明确批准。需要改变系统状态时,权限控制应落实在模型之外,而不能只依赖模型在对话中作出判断。
证据不足或彼此冲突时
如果材料缺失、来源互相矛盾,或模型无法说明结论依据,工作流应停在人工核查阶段。人工需要补齐证据或明确决定,而不是让模型自行选择一个看起来合理的答案。
用什么标准划分自动化边界
给每个步骤同时问三个问题:
- 结果能否核对? 能回到输入材料、代码或明确规则逐项检查。
- 错误能否回退? 草稿可以修改,受控测试可以重跑。
- 影响是否由人承担? 一旦涉及外部发布、权限、费用、合同或其他重要权益,应由人决定。
三个问题中,只要“影响较大且难以回退”,就应设置人工批准点。若连依据是否完整都无法确认,也不应自动继续。
更稳妥的工作流不是让模型从头跑到尾,而是让它自动完成可验证的环节,在数据用途、分析可信度和外部动作三个位置停下来。人工不必重复处理全部内容,但必须掌握是否放行的决定权。