适合拿来测试的职场材料,主要有两类:一类是有明确来源、可以对照核对的文字材料,用来测试起草能力;另一类是有分类定义和正反例的材料,用来测试判断的一致性。材料越容易追溯依据,测试结果越容易复查。
一、用于测试起草能力:笔记和源文本
会议记录、访谈笔记、项目背景资料、已有报告片段,以及与任务直接相关的要求说明,都可以作为起草测试的输入。OpenAI 的 ChatGPT for Word 帮助页明确说明,ChatGPT 可以依据笔记和源文本起草备忘录、提案或报告。
测试时不必只给一个宽泛指令。可以把材料分成几个部分:
- 输入材料:笔记、源文本、背景说明和格式要求;
- 任务要求:要写备忘录、提案还是报告,面向谁写,达到什么目的;
- 核对标准:哪些内容必须保留,哪些内容不能自行补充,输出应采用什么结构。
例如,拿到会议笔记和项目资料后,可以要求模型先列出提纲,再分别起草一段备忘录或报告初稿。检查重点不是文字是否流畅,而是每个关键结论能否在原材料中找到对应内容,是否遗漏了重要限制,以及有没有加入没有依据的判断。
如果材料之间存在冲突,还应观察模型是否会指出冲突,而不是把不同说法拼成一个看似完整的结论。这个测试只能帮助发现输出中的问题,不能替代对事实和业务语境的确认。
二、用于测试分类能力:定义、规则和正反例
如果任务是判断一份材料属于哪个类别,适合准备一套清晰的分类规则,以及可接受和不可接受的输出示例。OpenAI 的创建和编辑 GPT 指南指出,如果自定义 GPT 需要应用特定定义或进行分类,应包含可接受和不可接受输出的简短示例。
因此,分类测试不应只有“请把这段文字分类”这样的指令,还要明确:
- 分类依据是什么;
- 每个类别对应哪些特征;
- 哪些边界情况容易混淆;
- 哪些输出算作可接受,哪些输出应判为不可接受。
例如,可以提供几条已经确定类别的材料,让模型处理新的条目,再逐项对照人工判断。需要核对的不只是最终标签,还包括它是否遵守了给定定义,是否对相似案例保持一致,以及在信息不足时有没有擅自作出确定判断。
没有正反例时,模型可能只能凭表面措辞理解任务;有了具体示例,测试者才更容易判断问题来自模型,还是来自规则本身没有说清楚。
三、怎样让一次测试更有用
为了让结果可复查,可以把每次测试固定为同一种流程:
- 先提供完整材料,而不是只截取片段。
- 写清任务目标、适用范围和输出格式。
- 要求模型把关键判断与对应材料关联起来。
- 再让模型生成结果。
- 逐项对照原材料、分类规则和人工判断,记录遗漏、增添和误判。
如果条件允许,还可以把同一材料交给不同模型或不同设置进行比较。比较时应使用相同的输入、相同的任务要求和相同的评分标准;否则,表面上看到的差异可能只是测试条件不同,而不是能力差异。
四、哪些材料不宜直接据此下结论
材料本身适合测试,不等于测试结果可以直接用于工作决策。涉及个人信息、商业秘密或组织内部敏感信息的材料,在上传前应先确认是否有相应授权,以及所用工具的隐私设置是否符合组织要求。
对于分类、审批、绩效评价等会影响他人的任务,模型输出只能作为辅助材料。即使测试表现良好,也仍需人工确认关键事实、边界情况和实际后果。来源没有说明的内容,不能因为模型写得完整,就当作已经得到证实。
因此,最适合的职场材料不是“看起来很复杂”的文件,而是输入清楚、规则明确、结果能够对照核对的材料。测试结束后,结论也应落在具体表现上:模型完成了什么、遗漏了什么、在哪些情况下需要人工接管。