大多数团队把“人在回路”当成一句让人安心的话。它听起来安全、负责,却往往意味着没有人真正决定人工到底要做什么。
人工可以审批操作、抽查样本、处理例外、事后审计、通过纠正结果来训练工作流,或负责业务决策。这些是不同的模式,各自有不同的成本、失败模式和人员配置要求。
本文将提供一个实用的决策模型,帮助你选择正确的模式。
人工审核是一项控制措施,而不是装饰。如果审核者没有明确权限、时间预算、检查清单和停止规则,工作流实际上仍是全自动的。
从后果出发
不要从模型出发,而要从错误输出的后果出发。
问自己五个问题:
- 这会影响客户、员工、供应商或监管机构吗?
- 它能否发送、发布、删除、收费、退款或更改记录?
- 它会暴露个人、机密、财务、法律或健康相关数据吗?
- 错误答案事后是否难以发现?
- 即使错误在技术上可以撤销,它是否仍会损害信任?
“是”的答案越多,人工的职责就必须越明确。
模式1:人工审批每项操作
适用于对外、破坏性、财务、法律、人力资源相关或客户可见的操作。
例如:
- 发送客户电子邮件,
- 发布公开文章,
- 发放退款,
- 删除记录,
- 修改合同条款,
- 提出用工建议。
模型准备草稿或建议,人工进行批准、编辑或拒绝。只有在审批被记录后,最终操作才会执行。
良好的审批设计包括:
- 清晰的差异对比或预览,
- 所使用的来源证据,
- 模型置信度或风险标记(如有),
- 一键拒绝路径,
- 在高风险流程中,推翻建议时必须说明原因,
- 包含审核者、时间戳和最终操作的审计日志。
这是成本最高的模式,但对后果重大的操作而言,它应当是默认选择。
模式2:人工审核例外情况
适用于大多数情况都很常规,但少数情况存在歧义或风险的场景。
例如:
- 提及取消、法律威胁、安全或账单问题的支持工单,
- 置信度低或字段缺失的发票信息提取,
- 无法确定公司规模或意向的潜在客户资格评估,
- 多个类别均匹配的文档分类。
工作流自动处理常规情况,并将例外情况转入队列。
例外情况的路由需要具体规则。仅凭“低置信度”通常过于含糊。更好的触发条件包括:
- 缺少必填字段,
- 提取出的值相互冲突,
- 不支持的语言,
- 无法识别的文档类型,
- 客户情绪超过风险阈值,
- 账户级别为企业级,
- 操作会越过金额或数据阈值,
- 来源数据已过时。
例外队列需要明确负责人和服务时限。如果没有人每天检查队列,系统并未减少工作,只是把工作藏了起来。
模式3:人工抽查输出
适用于后果较轻,但质量漂移仍然重要的工作流。
例如:
- 内部摘要,
- 内容标记,
- 会议行动项提取,
- 非敏感CRM字段的信息补全,
- 推荐知识库链接。
工作流自动运行,人工审核一部分样本:例如5%的输出、每周随机抽取20个案例,或审核新提示词版本生成的每一项输出。
只有当纠正结果能反馈到系统中时,抽查才有效:
- 记录错误之处,
- 对错误类型进行分类,
- 更新提示词、检索、模式或工具规则,
- 将案例加入评估,
- 持续跟踪错误率。
抽查是一套质量体系,并不是上线审批门禁。
模式4:人工事后审计
适用于低风险、可撤销且高频的工作流。
例如:
- 内部标记,
- 重复项检测,
- 仅作为草稿的知识库建议,
- 在不同模型之间进行成本路由,
- 客户不可见的格式清理。
工作流直接运行,再通过日志、仪表板和定期审计发现问题。
只有满足以下条件时,这种模式才可以接受:
- 操作可以撤销,
- 工作流有终止开关,
- 日志足够详细,能够重建决策过程,
- 漏掉错误的代价很低,
- 用户知道如何报告错误输出。
对于面向客户的承诺、敏感数据、付款或受监管的决策,不要采用事后审计。
模式5:人工负责决策
适用于AI辅助分析,但不应作出决策的场景。
例如:
- 招聘,
- 信贷或资格筛选,
- 法律策略,
- 医疗建议,
- 安全事件严重程度判定,
- 供应商选择,
- 重大采购决策。
模型可以汇总证据、列出权衡、生成问题或比较选项。最终判断由人工决策负责人签字确认。
工作流应明确标示:
- “由AI生成的分析,并非决策。”
- “决策负责人:姓名或角色。”
- “已审核的证据:来源。”
- “已知局限。”
- “最终理由。”
这样可以防止一种常见失败:模型流畅自然的建议默认变成了最终决策。
简单的审批矩阵
可以从这张表开始:
| 工作流后果 | 默认人工模式 |
|---|---|
| 内部、可撤销、低可见度 | 事后审计 |
| 内部、重复执行、对质量敏感 | 抽查审核 |
| 其他方面常规的流程中的歧义情况 | 例外审核 |
| 客户可见或对外操作 | 审批每项操作 |
| 破坏性、财务、法律、人力资源、受监管 | 人工负责最终决策 |
这张矩阵并非硬性规定,而是促使团队认真作出选择。如果选择更宽松的模式,请写明原因。
设计审核界面
良好的审核界面可以减轻审核疲劳。
应显示:
- 系统提出的内容,
- 系统使用的证据,
- 与当前状态相比有哪些变化,
- 该项目为何被转入审核,
- 允许执行的操作,
- 风险标记,
- 截止时间(如有)。
应避免:
- 展示完整提示词,
- 要求审核者查看原始日志,
- 隐藏源文档,
- 需要“编辑”操作时却只提供“批准”和“拒绝”,
- 要求审核者重新打开五个系统才能核实一个案例。
如果审核速度慢,人们就会绕过它;如果审核要求不清晰,人们就会机械地批准。
定义停止规则
每个人在回路工作流都需要停止规则。
例如:
- 抽查输出中超过3%未通过检查清单。
- 检测到任何跨客户数据暴露。
- 超过五项高风险例外在24小时内未得到审核。
- 更新提示词或模型后,拒绝率提高了50%。
- 工作流执行了一项本应要求审批的对外操作。
停止规则应说明由谁暂停工作流,以及接下来采取什么措施。
常见错误
人工介入得太晚。 如果审核者只能看到最终润色后的输出,可能会漏掉错误的源数据。必要时应展示证据和中间提取结果。
盲目批量审批。 批量审批确实有用,但前提是筛选和抽查已经证明批次内的内容具有一致性。
审核者未经培训。 审核者需要了解良好、不良和临界案例的示例。
没有反馈闭环。 如果纠正结果不能改进提示词、检索、模式或源数据,审核就会变成永久性的人工劳动。
没有容量规划。 每天处理1,000个案例,例外率为10%,就意味着100项人工任务。这需要一支团队,并非可以忽略的小事。
要点总结
人在回路设计并非单一模式,而是一组与后果相匹配的控制措施。
应采用:
- 对高后果操作进行审批,
- 对歧义情况进行例外审核,
- 通过抽查监测质量漂移,
- 对低风险、可撤销的工作进行审计,
- 由人工负责真正的业务决策。
实用的检验方法很简单:如果模型出错,由谁发现、谁能停止它、他们具体要做什么?如果无法回答这些问题,工作流就还没有准备好。



