到2026年年中,“我们的团队是否应该使用AI?”这个问题基本已有答案。真正值得探讨的问题是:如何使用?
推广AI的团队最终会明显分成两类——一类取得显著成效,另一类几个月后仍然乏善可陈。差别很少来自工具,而是来自实施手册:选择哪些使用场景、如何培训、制定什么政策,以及如何衡量影响。
本文是一份团队应用AI的实用手册,源自规模在10到1,000人之间的公司中真正有效的做法。
不要从许可证入手。先确定3–5个工作流、负责人、基线衡量指标和数据规则。没有工作流责任归属的工具访问权限,只会成为看不见的支出。
个人走在公司前面
大多数推广计划都忽略了两个事实:
**事实1:自主应用AI的一线员工通常比公司领先6–12个月。**他们已经使用ChatGPT或Claude处理个人工作一年了,拥有自己喜欢的提示词,也知道哪些方法有效。
**事实2:大多数团队尚未将个人应用转化为团队层面的收益。**知识仍停留在个人头脑中,工作流没有改变,组织架构和工作方式看起来与2022年相同。
“个人使用AI”与“团队工作因AI而得到实质性改善”之间的差距,正是实施手册发挥作用的地方。
第一个决定:范围
在进行任何推广前,先决定你要实现什么。不同目标的思路各异:
**提升生产力。**让现有工作完成得更快、更好。每个人用更少时间产出相同成果。结果是:以更少工时获得相同产出,或在相同工时内获得更多产出。
**提升质量。**让现有工作做得更好。结果是:工时相同,产出质量更高。
**降低成本。**减少员工人数、承包商支出或供应商支出。结果是:用更少的人获得相同产出。
**扩展能力。**完成团队以前无法做到的事情。结果是:获得以往不可能实现的新产出。
这些是不同的计划,成功标准也不同。“提升生产力”计划跟踪节省的时间;“降低成本”计划跟踪人员或支出的变化;“扩展能力”计划跟踪新的产出。
大多数公司笼统地希望四者兼得。这种模糊性会带来问题——因为你无法判断是否取得成功。选择一个作为主要目标,其余作为次要目标。
对2026年的大多数团队而言,“提升生产力”是合适的主要目标。它最容易衡量、最容易论证,也最可预测。
选择使用场景
应用推广中最大的失败模式,是从过于宽泛的使用场景开始。“在营销中使用AI”不是使用场景,“使用AI撰写销售邮件”也不是。使用场景应足够具体,让你能够明确描述实施前和实施后的状态。
一份实用模板:
使用场景:[具体任务]
实施前:[团队目前如何完成这项任务,并列出具体耗时]
实施后:[团队将如何借助AI完成这项任务,并列出具体耗时]
负责人:[一个人]
决策日期:[进行评估的时间]
成功标准:[满足什么条件即可宣布成功]
良好的使用场景如下:
使用场景:在销售通话前起草第一版客户研究。
实施前:SDR每次通话前花费20-30分钟进行人工研究。
实施后:AI在60秒内生成草稿;SDR用5分钟审核并添加个人备注。
负责人:销售运营负责人。
决策日期:开始后4周。
成功标准:50%的SDR团队每周使用该工作流;平均准备时间从25分钟降至8分钟。
不良的使用场景如下:
使用场景:使用AI改善我们的销售流程。
实施前:我们销售产品。
实施后:借助AI更好地销售产品。
负责人:销售副总裁。
决策日期:以后再看。
成功标准:收入增加。
具体版本能够建立责任归属;模糊版本则为推卸责任创造空间——如果没有任何成果,也无人负责。
先从3–5个具体使用场景开始,不要试图同时做20件事。
本文链接的配套模板提供了每个候选使用场景所需的确切字段。
选择合适的首批使用场景
良好的首批使用场景通常具备以下特征:
**时间投入集中。**选择团队中多人都会投入大量时间的任务。如果一个工作流每人每周节省30分钟,覆盖20人,就能每周节省10小时。
**输入和输出清晰。**输入和输出定义明确的任务,比模糊任务更容易自动化。“汇总这次客户通话”定义清晰;“改善我们的客户体验”则不然。
**负面风险低。**选择错误可恢复、而不是可能造成灾难性后果的任务。优先选择内部文档,而不是面向客户的邮件;优先生成草稿,而不是最终输出;优先提供建议,而不是做出决策。
**已有衡量方式。**你已经在衡量的任务(每张工单的耗时、每周内容产出等)很容易评估影响。对于尚未衡量的任务,必须先建立衡量方式。
**由推动者牵头。**团队中已经有人对该使用场景充满热情。他们会领导推广、迭代工作流并说服同事。没有推动者,再好的使用场景也会夭折。
不要选择:
- AI实际上并不优于现有工具的使用场景。
- 在尚未获得隐私批准的情况下接触敏感数据的使用场景。
- 在法律审核通过前具有重大监管影响的使用场景。
- 没有人真正需要的“为创新而创新的面子工程”项目。
构建工作流
每个使用场景的实际成果都应是一个工作流——团队采用的具体、可重复流程,而不是模糊的“使用ChatGPT提供帮助”。
工作流包括:
- **触发条件。**工作流何时开始?
- **工具。**使用哪种AI工具、哪个模型、哪种集成?
- **提示词。**要使用的确切提示词。(消费级工具使用对话开场词,自定义应用使用系统提示词。)
- **输入。**人工提供什么?
- **输出。**AI生成什么?
- **审核。**AI输出投入使用前由谁审核?
- **成功指标。**如何知道它正在发挥作用?
将这些内容记录在共享位置——wiki、Notion、Confluence。工作流应足够具体,让新团队成员也能执行。
再添加一个字段:停止条件。如果输出错误、必需数据缺失、任务涉及敏感数据,或未达到置信度阈值,工作流应转向哪里?良好的工作流既会定义顺利路径,也会定义拒绝/升级路径。
一种实用模式是:团队推动者与2–3名高级用户共同构建工作流。他们先自行运行1–2周,然后再教给团队其他成员。
培训问题
大多数AI培训计划都以同样的方式失败:只教工具,不教工作。
“下面介绍如何使用ChatGPT——在框中输入内容、单击发送、查看输出”这样的培训不会改变行为。人们已经知道这些操作。他们不知道的是如何将工具应用到自己的具体工作中。
真正有效的培训以工作流为中心:
- “这是销售团队研究客户所用的工作流。我们将用3个真实客户一起练习。”
- “这是内容团队起草博客文章大纲所用的工作流。我们将用3篇真实文章一起练习。”
- “这是支持团队起草回复所用的工作流。我们将用3张真实工单一起练习。”
采用真实工作,亲手实践,并使用他们日常会用到的具体提示词和工具。
一种实用安排:
- **第1天:**60分钟工作坊。使用真实示例讲解工作流,每个人都亲自尝试。
- **第1周:**每个人承诺在至少3项真实任务中使用该工作流。
- **第2周:**小组复盘。哪些有效、哪些无效、需要改变什么?
- **第4周:**工作流经过完善,目标用户采用率达到50%+。此时可将其正式确立为“我们完成这项工作的方式”。
这种形式之所以有效,是因为它跳过抽象的工具培训,直接进入应用。人们通过实践来学习。
政策与防护措施
扩大规模前需要制定政策。没有政策,就会遇到各种问题:数据隐私、知识产权问题、幻觉影响实际工作,以及员工自行其是。
一份基准政策文件包括:
**获批工具。**团队可以使用哪些AI工具开展工作?(消费版ChatGPT?仅限Teams/Enterprise?特定应用?)
**获批数据类型。**哪些内容可以输入AI工具?(公开信息:可以。内部文档:视情况而定。客户数据:通常不可以,除非在受控工具中。个人数据:未经法律审核绝不可以。)
**面向客户的规则。**可以向客户发送AI生成的响应吗?需要经过什么审核流程?是否必须披露?
**生成内容规则。**AI生成的内容能否用于X(营销、销售、内部)?是否需要人工审核?
**审核与问责。**AI输出以可能造成重大后果的方式投入使用前,由谁审核?发生问题时由谁负责?
**日志与审计。**记录哪些内容?谁可以访问日志?日志保留多久?
**训练数据。**我们的数据能否用于训练模型?(通常应设置为“否”——大多数企业层级默认为否,但要进行核实。)
**升级路径。**如果有人不确定某项操作是否合规,应向谁咨询?
这份文件不必很长——对大多数团队而言,1–2页就足够。它必须存在、内容具体,并传达给每个人。
衡量影响
AI应用中最困难的部分,是诚实地衡量影响。大多数推广计划要么跳过这一步,要么粉饰数据。
衡量分为三个层级:
**第1级:采用情况。**人们是否在使用该工作流?(AI工具的使用数据、自报调查、直接观察。)易于衡量,但不能证明影响。
**第2级:时间/效率。**具体任务在实施前后分别需要多长时间?(时间跟踪、自报、抽样观察。)更难衡量,但更有意义。
**第3级:产出质量和数量。**工作成果是否发生变化?产出更多了吗?质量更高了吗?业务指标更好了吗?(现有业务指标、客户反馈、产出审核。)最难衡量,却也最重要。
每个使用场景至少应建立第1级和第2级衡量方式。如果可行,再加入第3级。
对于安全敏感型工作流,还要增加第四项检查:事故率和纠正率。跟踪AI辅助工作流生成的结果中,有多少需要纠正、升级或回滚。一个节省时间却使纠正工作翻倍的工作流,尚未成熟。
一个常见错误是在第1级就宣布胜利。“80%的团队都在使用这个工作流!”但实际发生了什么变化?团队是否完成了更多工作?质量是否提高?客户是否感受到了?
诚实衡量有时会发现,工作流并没有真正节省时间,或者在改善一项指标的同时损害了另一项指标。知道这一点很重要。目标是真实影响,而不是宣布取得影响。
常见失败模式
以下模式反复出现:
失败1:工具优先,而不是工作流优先。“让所有人都使用Copilot。”六个月后,使用率只有20%,影响无法衡量。应推广工作流,而不是工具。工具只是基础设施。
**失败2:没有推动者。**中央团队宣布AI计划,一线却没有任何人感兴趣,计划在推广阶段就夭折了。每个受影响团队都必须有一名推动者。
失败3:跳过衡量。“当然有效,看看大家多兴奋。”兴奋不等于影响。必须衡量。
**失败4:政策限制过严。**政策规定重要工作一律不得使用AI;团队仍然会用,只是不再公开。这样一来,AI已进入业务,却完全没有治理。宽松但具体的政策,优于严格却无人遵守的政策。
**失败5:政策限制不足。**完全没有防护措施;客户数据进入消费版ChatGPT;一名初级员工向重要客户发送包含幻觉的回复。接下来,你就要向法务和CEO解释发生了什么。
**失败6:一次性全面推广。**试图同时向整个公司推广;中央团队不堪重负;各个本地团队却没有实际进展。应逐个团队推广,让每个团队的经验为下一个团队提供参考。
**失败7:视为一次性项目。**5月份有效的工作流,到11月份可能已经过时,因为模型会变化、工具会变化,团队需求也会变化。AI应用是一项持续工作,而不是一个项目。
90天计划
以下是一支典型团队(例如20–50人的知识工作团队)可采用的90天实用计划:
第1–2周:确定范围和选择。
- 决定主要目标(生产力、质量、成本、能力)。
- 使用前文模板确定3–5个具体使用场景。
- 为每个场景指定一名推动者。
- 尽可能取得基线衡量数据。
第3–4周:构建工作流。
- 对每个使用场景,由推动者 + 2名高级用户构建工作流。
- 记录工作流。
- 在真实工作中测试1–2周。
第5–6周:制定政策。
- 编写1–2页的政策文件。
- 获得法务/安全/管理层的批准。
- 向整个团队传达。
第7–8周:培训与应用。
- 针对每个工作流开展工作坊。
- 每个人承诺在真实工作中使用该工作流。
- 推动者随时解答问题。
第9–10周:完善。
- 小组复盘:哪些有效、哪些无效、需要改变什么。
- 根据真实使用经验更新工作流。
- 解决应用障碍。
第11–12周:衡量与决策。
- 获取采用情况、节省时间、产出变化的数据。
- 为每个使用场景做出决定:扩展、完善或取消。
- 规划下一个90天。
90天结束时,每个使用场景都应得到以下三种结果之一:
| 结果 | 含义 | 下一步操作 |
|---|---|---|
| 扩展 | 使用情况明确、时间/质量有所改善、风险可接受 | 扩展到更多用户或相邻工作流 |
| 完善 | 有用但不可靠、指标不明确或存在培训缺口 | 修复提示词/流程/工具并重新测试 |
| 取消 | 没有实质性收益或风险过高 | 停止工作流并记录原因 |
这足以让一个团队的首批使用场景从构想到正式运行。后续周期会更快。
关于个人应用与团队应用
一种常见模式是:个人通常走在团队前面。团队中有些人已经使用AI处理个人工作一年了,拥有自己偏爱的工具、观点和工作流。
应利用这一点,而不是假装它没有发生。发掘个人的优秀做法,将最佳示例规范成团队工作流,并给予这些人认可和荣誉。
最糟糕的模式是:自上而下的推广忽视已有个人使用方式,然后与之竞争。结果是官方工具比人们已有的做法更差,因此官方采用率一直很低。
更好的方式是:自上而下的推广以现有有效做法为基础,并将其规范化。
核心结论
AI应用不是技术问题,而是一个以技术为组成部分的变革管理问题。
成功的团队会:
- 选择一个清晰的主要目标。
- 选择具体明确的使用场景(而不是模糊地“在X中使用AI”)。
- 构建工作流,而不是只提供工具访问权限。
- 使用真实工作进行培训,而不是讲解抽象的工具功能。
- 制定具体且可执行的政策。
- 在多个层级诚实衡量。
- 根据所学经验持续迭代。
- 将其视为持续工作,而非一次性项目。
失败的团队会:
- 推出工具,然后寄希望于结果。
- 目标模糊,衡量方式更加模糊。
- 跳过工作流构建步骤。
- 进行抽象培训。
- 要么没有政策,要么政策无法执行。
- 只看到“采用”就宣布胜利,而不检查影响。
这套手册并不复杂,但严格遵循它的团队很少。真正做到的团队,才会在六个月后将AI融入日常工作方式,并取得足以证明成效的生产力收益。



