AI工作流中的人在回路设计模式
中级9 分钟阅读自动化

AI工作流中的人在回路设计模式

人工审核并不是含糊的安全保障。本文提供一份实用指南,帮助你确定在AI工作流中,哪些事项应由人工审批、抽查、审计、升级处理,或绝不交由AI完成。

您应该能够做到的事情

只有明确人工的职责——审批、抽查、审计、升级处理或负责例外情况——人在回路设计才能发挥作用。如果工作流只写着“可由人工审核”,说明安全体系尚未真正设计完成。

AI Expert Team发布日期: 2026年5月17日
仅在此浏览器中保存。
本文内容

大多数团队把“人在回路”当成一句让人安心的话。它听起来安全、负责,却往往意味着没有人真正决定人工到底要做什么。

人工可以审批操作、抽查样本、处理例外、事后审计、通过纠正结果来训练工作流,或负责业务决策。这些是不同的模式,各自有不同的成本、失败模式和人员配置要求。

本文将提供一个实用的决策模型,帮助你选择正确的模式。

人工审核是一项控制措施,而不是装饰。如果审核者没有明确权限、时间预算、检查清单和停止规则,工作流实际上仍是全自动的。

从后果出发

不要从模型出发,而要从错误输出的后果出发。

问自己五个问题:

  1. 这会影响客户、员工、供应商或监管机构吗?
  2. 它能否发送、发布、删除、收费、退款或更改记录?
  3. 它会暴露个人、机密、财务、法律或健康相关数据吗?
  4. 错误答案事后是否难以发现?
  5. 即使错误在技术上可以撤销,它是否仍会损害信任?

“是”的答案越多,人工的职责就必须越明确。

模式1:人工审批每项操作

适用于对外、破坏性、财务、法律、人力资源相关或客户可见的操作。

例如:

  • 发送客户电子邮件,
  • 发布公开文章,
  • 发放退款,
  • 删除记录,
  • 修改合同条款,
  • 提出用工建议。

模型准备草稿或建议,人工进行批准、编辑或拒绝。只有在审批被记录后,最终操作才会执行。

良好的审批设计包括:

  • 清晰的差异对比或预览,
  • 所使用的来源证据,
  • 模型置信度或风险标记(如有),
  • 一键拒绝路径,
  • 在高风险流程中,推翻建议时必须说明原因,
  • 包含审核者、时间戳和最终操作的审计日志。

这是成本最高的模式,但对后果重大的操作而言,它应当是默认选择。

模式2:人工审核例外情况

适用于大多数情况都很常规,但少数情况存在歧义或风险的场景。

例如:

  • 提及取消、法律威胁、安全或账单问题的支持工单,
  • 置信度低或字段缺失的发票信息提取,
  • 无法确定公司规模或意向的潜在客户资格评估,
  • 多个类别均匹配的文档分类。

工作流自动处理常规情况,并将例外情况转入队列。

例外情况的路由需要具体规则。仅凭“低置信度”通常过于含糊。更好的触发条件包括:

  • 缺少必填字段,
  • 提取出的值相互冲突,
  • 不支持的语言,
  • 无法识别的文档类型,
  • 客户情绪超过风险阈值,
  • 账户级别为企业级,
  • 操作会越过金额或数据阈值,
  • 来源数据已过时。

例外队列需要明确负责人和服务时限。如果没有人每天检查队列,系统并未减少工作,只是把工作藏了起来。

模式3:人工抽查输出

适用于后果较轻,但质量漂移仍然重要的工作流。

例如:

  • 内部摘要,
  • 内容标记,
  • 会议行动项提取,
  • 非敏感CRM字段的信息补全,
  • 推荐知识库链接。

工作流自动运行,人工审核一部分样本:例如5%的输出、每周随机抽取20个案例,或审核新提示词版本生成的每一项输出。

只有当纠正结果能反馈到系统中时,抽查才有效:

  • 记录错误之处,
  • 对错误类型进行分类,
  • 更新提示词、检索、模式或工具规则,
  • 将案例加入评估,
  • 持续跟踪错误率。

抽查是一套质量体系,并不是上线审批门禁。

模式4:人工事后审计

适用于低风险、可撤销且高频的工作流。

例如:

  • 内部标记,
  • 重复项检测,
  • 仅作为草稿的知识库建议,
  • 在不同模型之间进行成本路由,
  • 客户不可见的格式清理。

工作流直接运行,再通过日志、仪表板和定期审计发现问题。

只有满足以下条件时,这种模式才可以接受:

  • 操作可以撤销,
  • 工作流有终止开关,
  • 日志足够详细,能够重建决策过程,
  • 漏掉错误的代价很低,
  • 用户知道如何报告错误输出。

对于面向客户的承诺、敏感数据、付款或受监管的决策,不要采用事后审计。

模式5:人工负责决策

适用于AI辅助分析,但不应作出决策的场景。

例如:

  • 招聘,
  • 信贷或资格筛选,
  • 法律策略,
  • 医疗建议,
  • 安全事件严重程度判定,
  • 供应商选择,
  • 重大采购决策。

模型可以汇总证据、列出权衡、生成问题或比较选项。最终判断由人工决策负责人签字确认。

工作流应明确标示:

  • “由AI生成的分析,并非决策。”
  • “决策负责人:姓名或角色。”
  • “已审核的证据:来源。”
  • “已知局限。”
  • “最终理由。”

这样可以防止一种常见失败:模型流畅自然的建议默认变成了最终决策。

简单的审批矩阵

可以从这张表开始:

工作流后果默认人工模式
内部、可撤销、低可见度事后审计
内部、重复执行、对质量敏感抽查审核
其他方面常规的流程中的歧义情况例外审核
客户可见或对外操作审批每项操作
破坏性、财务、法律、人力资源、受监管人工负责最终决策

这张矩阵并非硬性规定,而是促使团队认真作出选择。如果选择更宽松的模式,请写明原因。

设计审核界面

良好的审核界面可以减轻审核疲劳。

应显示:

  • 系统提出的内容,
  • 系统使用的证据,
  • 与当前状态相比有哪些变化,
  • 该项目为何被转入审核,
  • 允许执行的操作,
  • 风险标记,
  • 截止时间(如有)。

应避免:

  • 展示完整提示词,
  • 要求审核者查看原始日志,
  • 隐藏源文档,
  • 需要“编辑”操作时却只提供“批准”和“拒绝”,
  • 要求审核者重新打开五个系统才能核实一个案例。

如果审核速度慢,人们就会绕过它;如果审核要求不清晰,人们就会机械地批准。

定义停止规则

每个人在回路工作流都需要停止规则。

例如:

  • 抽查输出中超过3%未通过检查清单。
  • 检测到任何跨客户数据暴露。
  • 超过五项高风险例外在24小时内未得到审核。
  • 更新提示词或模型后,拒绝率提高了50%。
  • 工作流执行了一项本应要求审批的对外操作。

停止规则应说明由谁暂停工作流,以及接下来采取什么措施。

常见错误

人工介入得太晚。 如果审核者只能看到最终润色后的输出,可能会漏掉错误的源数据。必要时应展示证据和中间提取结果。

盲目批量审批。 批量审批确实有用,但前提是筛选和抽查已经证明批次内的内容具有一致性。

审核者未经培训。 审核者需要了解良好、不良和临界案例的示例。

没有反馈闭环。 如果纠正结果不能改进提示词、检索、模式或源数据,审核就会变成永久性的人工劳动。

没有容量规划。 每天处理1,000个案例,例外率为10%,就意味着100项人工任务。这需要一支团队,并非可以忽略的小事。

要点总结

人在回路设计并非单一模式,而是一组与后果相匹配的控制措施。

应采用:

  • 对高后果操作进行审批,
  • 对歧义情况进行例外审核,
  • 通过抽查监测质量漂移,
  • 对低风险、可撤销的工作进行审计,
  • 由人工负责真正的业务决策。

实用的检验方法很简单:如果模型出错,由谁发现、谁能停止它、他们具体要做什么?如果无法回答这些问题,工作流就还没有准备好。

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。

深入学习

精选的外部课程,帮助您更深入地了解该主题。

查看所有 自动化 课程