关键问题不是人工智能是否流行,而是在组织的质量、安全、隐私、成本和对员工影响的约束条件下,定义的工作流程是否有所改进。
工具和模型固然重要,但用例选择、流程设计、培训、治理、员工参与和测量同样关键。本手册明确阐述了这些决策,但并不保证团队会采用,也不保证生产力提升。
请将本手册视为供团队调整并评估的候选方案。组织规模本身并不能决定某种部署模式是否适用。
不要从许可证开始,而应从可支持的有限工作流程数量、明确的负责人、受影响员工的参与、基准测量、数据规则和明确的停止条件开始。
证据依据:NIST AI风险管理框架把治理、映射、测量和管理视为持续的组织工作;国际劳工组织2025年的生成式AI与就业更新和2026年的就业、生产力与工作组织实证证据综述则强调岗位转型和实施环境。这些来源都没有验证下文的示例时间表或采用目标;它们只是规划示例,应以你的基准和员工协商结果替换。
在设计部署之前,先了解实际做法
部分员工可能已经使用了经过批准或未经批准的人工智能工具;另一些员工可能有正当理由不使用。在不将调研变成员工监控的前提下,应了解实际使用情况、数据处理方式、无障碍需求、有益做法、失败案例和担忧。不要根据个别事例推断出使用率差距或能力水平。
当团队需要将候选工具转化为有文档记录和受管控的工作流程,并判断结果是否真正更好时,这份行动手册尤为重要。
第一个决定:范围
在进行任何推广前,先决定你要实现什么。不同目标的思路各异:
**提升生产力。**让现有工作完成得更快、更好。每个人用更少时间产出相同成果。结果是:以更少工时获得相同产出,或在相同工时内获得更多产出。
**提升质量。**让现有工作做得更好。结果是:工时相同,产出质量更高。
**降低成本。**减少员工人数、承包商支出或供应商支出。结果是:用更少的人获得相同产出。
**扩展能力。**完成团队以前无法做到的事情。结果是:获得以往不可能实现的新产出。
这些是不同的计划,成功标准也不同。“提升生产力”计划跟踪节省的时间;“降低成本”计划跟踪人员或支出的变化;“扩展能力”计划跟踪新的产出。
如果利益相关者希望实现多个目标,请明确主要目标并记录权衡取舍。否则,质量损失可能被时间节省的主张掩盖,或工作量增加可能被更高的产出量掩盖。
应从组织实际面临的问题和对利益相关者的影响中选择主要目标。“提高生产力”并不总是最容易衡量的:时间估计可能隐藏了修正工作、工作强度增加、努力方向转移、质量下降或监控增加。
选择使用场景
像”在营销中使用人工智能”这样宽泛的目标无法作为工作流程进行评估。必须定义现状、候选目标状态、受影响人员、输入和输出边界以及停止条件。
一份实用模板:
使用场景:[具体任务]
实施前:[团队目前如何完成这项任务,并列出具体耗时]
实施后:[团队将如何借助AI完成这项任务,并列出具体耗时]
负责人:[一个人]
决策日期:[进行评估的时间]
成功标准:[满足什么条件即可宣布成功]
一个假设的可衡量用例可能如下所示;其中的数字仅为示例,而非预期结果:
使用场景:在销售通话前起草第一版客户研究。
实施前:SDR每次通话前花费20-30分钟进行人工研究。
实施后:AI在60秒内生成草稿;SDR用5分钟审核并添加个人备注。
负责人:销售运营负责人。
决策日期:开始后4周。
成功标准:50%的SDR团队每周使用该工作流;平均准备时间从25分钟降至8分钟。
不良的使用场景如下:
使用场景:使用AI改善我们的销售流程。
实施前:我们销售产品。
实施后:借助AI更好地销售产品。
负责人:销售副总裁。
决策日期:以后再看。
成功标准:收入增加。
具体版本使其假设和负责人都可审查。模糊版本则无法提供可证伪的结果或决策日期。
从少量使用场景开始,其数量应以现有负责人和审核者能够评估为限。合适的数量取决于支持能力和风险。
本文链接的配套模板提供了每个候选使用场景所需的确切字段。
选择合适的首批使用场景
良好的首批使用场景通常具备以下特征:
**时间投入集中。**选择团队中多人都会投入大量时间的任务。如果一个工作流每人每周节省30分钟,覆盖20人,就能每周节省10小时。
**输入和输出清晰。**输入和输出定义明确的任务,比模糊任务更容易自动化。“汇总这次客户通话”定义清晰;“改善我们的客户体验”则不然。
**负面风险低。**选择错误可恢复、而不是可能造成灾难性后果的任务。优先选择内部文档,而不是面向客户的邮件;优先生成草稿,而不是最终输出;优先提供建议,而不是做出决策。
现有度量。 现有基准可以减少设置工作,但需验证其是否能够反映修正工作量、质量、对员工的影响以及转移的工作量,而不仅仅是输出量。
明确负责人。 指定一名有时间和权限的人来协调评估、收集员工反馈,并在标准未满足时停止工作流程。热情是有用的,但不能替代员工参与和明确的问责机制。
不要选择:
- AI实际上并不优于现有工具的使用场景。
- 在尚未获得隐私批准的情况下接触敏感数据的使用场景。
- 在法律审核通过前具有重大监管影响的使用场景。
- 没有人真正需要的“为创新而创新的面子工程”项目。
构建工作流
每个使用场景的实际成果都应是一个工作流——团队采用的具体、可重复流程,而不是模糊的“使用ChatGPT提供帮助”。
工作流包括:
- **触发条件。**工作流何时开始?
- **工具。**使用哪种AI工具、哪个模型、哪种集成?
- **提示词。**要使用的确切提示词。(消费级工具使用对话开场词,自定义应用使用系统提示词。)
- **输入。**人工提供什么?
- **输出。**AI生成什么?
- **审核。**AI输出投入使用前由谁审核?
- **成功指标。**如何知道它正在发挥作用?
将这些内容记录在共享位置——wiki、Notion、Confluence。工作流应足够具体,让新团队成员也能执行。
再添加一个字段:停止条件。如果输出错误、必需数据缺失、任务涉及敏感数据,或未达到置信度阈值,工作流应转向哪里?良好的工作流既会定义正常执行路径,也会定义拒绝或转交处理路径。
一种候选模式是让负责人和一个具有代表性且成员自愿参与的试点小组,在作出更大范围的决策前构建并测试工作流。小组成员和持续时间应根据受影响的角色、任务频率、风险和所需样本选择,而不是根据通用的时间表选择。
培训问题
通用工具说明无法确保员工能够安全地执行特定工作流程。培训应涵盖实际任务、数据边界、审查标准、拒绝路径和事件报告。
当所需能力是执行和审查特定工作流程时,通用产品导航是不够的。培训应涵盖任务及其失败路径,而不是假设已有知识或采用情况。
一种面向特定工作流的培训方案可以是:
- “这是销售团队研究客户所用的工作流。我们将用3个真实客户一起练习。”
- “这是内容团队起草博客文章大纲所用的工作流。我们将用3篇真实文章一起练习。”
- “这是支持团队起草回复所用的工作流。我们将用3张真实工单一起练习。”
培训应围绕真实工作展开,让员工亲手实践,并使用他们日常会用到的具体提示词和工具。
一个示例格式:
- 第1天: 60分钟的研讨会。通过真实示例逐步讲解工作流程。每个人亲自尝试。
- 第1周: 每个人承诺至少在3个真实任务中使用该工作流程。
- 第2周: 小组回顾。哪些有效,哪些无效,我们应做出哪些改变?
- 决策关口: 将试点与基准进行比较,咨询受影响的员工,并决定是暂停、修订、扩展还是停止。使用情况本身不是发布标准。
请将此视为示例计划,而非经过验证的采用公式。请将日期、任务数量和目标替换为基准、无障碍需求、员工协商结果和与风险相称的证据。
政策与防护措施
在扩大规模之前,请记录规则、负责人和升级路径。政策应涵盖隐私、安全、知识产权、就业影响、无障碍、输出审查和适用行业规则,同时不应将员工视为对立面。
一份基准政策文件包括:
**获批工具。**团队可以使用哪些AI工具开展工作?(消费版ChatGPT?仅限Teams/Enterprise?特定应用?)
批准的数据类型。 按系统、用途、角色、分类、供应商合同和适用法律定义允许的数据。“公共”并不自动意味着收集或再利用不受限制;个人或机密数据需要经过批准的合法且安全的路径。
**面向客户的规则。**可以向客户发送AI生成的响应吗?需要经过什么审核流程?是否必须披露?
**生成内容规则。**AI生成的内容能否用于X(营销、销售、内部)?是否需要人工审核?
**审核与问责。**AI输出以可能造成重大后果的方式投入使用前,由谁审核?发生问题时由谁负责?
**日志与审计。**记录哪些内容?谁可以访问日志?日志保留多久?
供应商数据使用。 记录提示词、输出、文件、反馈和遥测数据是否可以在当前产品、套餐、地区和设置下被保留或用于改进模型。应核实当前合同和控制措施,而不是假设企业默认设置。
**升级路径。**如果有人不确定某项操作是否合规,应向谁咨询?
政策长度应根据风险和组织规模而定。使操作规则易于发现、具体明确、向受影响员工开放、与完整的治理政策相链接,并由能够回答问题和更新政策的人员负责。
衡量影响
当单独衡量节省的时间、返工、质量、工作量、监控和受影响的利益相关者时,影响测量很容易被扭曲。在试点之前应定义基准和制衡指标。
衡量分为三个层级:
**第1级:采用情况。**人们是否在使用该工作流?(AI工具的使用数据、自报调查、直接观察。)易于衡量,但不能证明影响。
**第2级:时间/效率。**具体任务在实施前后分别需要多长时间?(时间跟踪、自报、抽样观察。)更难衡量,但更有意义。
第3级:输出质量和数量。 工作成果是否发生了变化?输出数量是否增加?质量是否提高?业务指标是否改善?使用合格的输出评审、现有指标以及适当的客户或用户证据;仅凭数量并不能代表质量。
选择能够证伪所声称效益并揭示潜在危害的衡量标准。采用率本身并不是结果;在工作流程可能影响质量和利益相关者时,应将这两类影响纳入衡量。
对于安全敏感型工作流,还要增加第四项检查:事故率和纠正率。跟踪AI辅助工作流生成的结果中,有多少需要纠正、升级或回滚。一个节省时间却使纠正工作翻倍的工作流,尚未成熟。
一个常见错误是在第1级就宣布胜利。“80%的团队都在使用这个工作流!”但实际发生了什么变化?团队是否完成了更多工作?质量是否提高?客户是否感受到了?
诚实衡量有时会发现,工作流并没有真正节省时间,或者在改善一项指标的同时损害了另一项指标。知道这一点很重要。目标是取得真实成效,而不是宣称已经取得成效。
需要防范的失败场景
将这些用作风险场景,而非普遍性声明:
失败1:以工具为中心,而非以工作流程为中心。 许可证被分配时没有明确的工作流程、负责人、基准或决策标准,导致影响无法衡量。
失败2:缺乏可问责的团队负责人或员工参与。 中央团队宣布一个计划,却没有给受影响的团队时间、权限或途径来质疑该工作流程。
失败3:跳过衡量。“当然有效,看看大家多兴奋。”兴奋不等于影响。必须衡量。
失败4:不可用的政策。 规则与实际工作不匹配,也没有提供经批准的替代方案,因此例外情况和未解决的需求变得不可见。应咨询受影响的员工,并提供可用的请求/升级路径;宽松性并不自动意味着更安全。
失败5:缺乏边界。 由于数据和审查规则从未明确,机密数据被输入未经批准的服务,或发送了没有证据支持的客户声明。
失败6:范围超出支持能力。 在团队能够回答问题、审查事件或比较结果之前,就为过多角色或工作流启动部署。应根据证据和支持能力分阶段扩大范围。
**失败7:视为一次性项目。**五月份有效的工作流,到十一月份可能已经过时,因为模型会变化、工具会变化,团队需求也会变化。AI应用是一项持续工作,而不是一个项目。
分阶段计划——根据证据设定日期
以下阶段是规划的框架,而非90天的绩效承诺。根据任务频率、咨询需求、法律/安全审查、样本量和运营准备情况设定持续时间。
范围与选择。
- 确定你的主要目标(效率、质量、成本、能力)。
- 仅识别审查团队能够支持的特定使用案例数量。
- 为每个使用案例指定负责人员,并识别受影响的利益相关者。
- 在可能的情况下获取基准测量数据。
工作流程设计与测试准备。
- 对于每个使用案例,由负责人和代表性的、同意参与的试点小组设计工作流程和测试。
- 记录工作流程。
- 在评估计划中定义的时间和样本量范围内,对批准的代表性工作进行测试。
政策与审查。
- 编写或更新运营政策,并将其与完整的安全、隐私、雇佣、采购和行业政策相链接。
- 获得法律/安全/领导层的批准。
- 向整个团队传达政策。
培训与有限试点。
- 每个工作流程运行一次研讨会。
- 参与和任务选择遵循试点计划、员工协商、无障碍需求和适用的雇佣规则。
- 负责人和转交联系人应能够随时解答问题并处理事件。
优化。
- 小组评审:哪些有效,哪些无效,哪些将发生变化。
- 根据实际经验更新工作流程。
- 解决采用障碍。
测量与决策。
- 收集有关采用情况、节省的时间和输出变化的数据。
- 对每个使用案例做出决策:扩大规模、优化或取消。
- 记录下次评审日期以及任何扩展所需的证据。
在决策关口,为每个使用案例确定以下三种结果之一:
| 结果 | 含义 | 下一步操作 |
|---|---|---|
| 扩展 | 使用情况明确、时间/质量有所改善、风险可接受 | 扩展到更多用户或相邻工作流 |
| 完善 | 有用但不可靠、指标不明确或存在培训缺口 | 修复提示词/流程/工具并重新测试 |
| 取消 | 没有实质性收益或风险过高 | 停止工作流并记录原因 |
在满足其发布标准、员工咨询、培训、政策、支持和回滚要求之前,不得将工作流程声明为已投入运营。后续周期未必更快。
关于个人应用与团队应用
个人实践可能与官方工具不同。通过自愿且无惩罚的流程发现差异,该流程能够区分经批准的工作用途与个人实验。
当员工选择分享已批准的做法时,应使用相同的数据、质量、安全、无障碍和员工影响标准对其进行评估。应认可贡献者,不得将自愿的实验转化为未公开的绩效预期。
自上而下的推广可能会忽略有用的实践、可访问性需求和潜在的风险。应与现有工作流程的用户一起评估这些流程,而不是自动将其制度化或压制。
核心结论
采用人工智能会改变技术、工作设计、治理、技能,有时还会改变角色。应将这些视为一项社会技术层面的决策,而不是购买软件许可这么简单。
操作手册的审查标准如下:
- 选择一个清晰的主要目标。
- 选择具体明确的使用场景(而不是模糊地“在X中使用AI”)。
- 构建工作流,而不是只提供工具访问权限。
- 使用真实工作进行培训,而不是讲解抽象的工具功能。
- 制定具体且可执行的政策。
- 在多个层级诚实衡量。
- 根据所学经验持续迭代。
- 将其视为持续工作,而非一次性项目。
容易失败的团队往往会:
- 推出工具,然后寄希望于结果。
- 目标模糊,衡量方式更加模糊。
- 跳过工作流构建步骤。
- 进行抽象培训。
- 要么没有政策,要么政策无法执行。
- 只看到“采用”就宣布胜利,而不检查影响。
操作手册是一组可测试的决策,而不是为期六个月的成果承诺。应保留那些在商定指标下显示出净效益的工作流程,修订那些存在可修复缺陷的工作流程,并淘汰那些风险或总成本超过其价值的工作流程。



