用AI做刻意练习:让你亲自下场的反馈
初级9 分钟阅读个人成长系统

用AI做刻意练习:让你亲自下场的反馈

让AI辅助练习失去作用的最快方式,就是还没尝试解题便索要答案。这套练习循环包括子技能、评分标准、独立尝试、反馈和重试,把努力留在真正发生学习的地方。

您应该能够做到的事情

AI很适合按照评分标准提供反馈,却不能代替你亲自尝试。有效的循环是:缩小子技能范围,先写评分标准,在没有帮助的情况下限时尝试,根据标准获取反馈,并在看到示范答案前至少重试一次。

仅在此浏览器中保存。
本文内容

浪费一小时AI辅助练习的最快方式,就是先索要示范答案。你读完后点点头,感觉自己懂了,一周后却几乎什么也没记住,因为你从未真正做过培养这项技能所需的工作。看见答案时认得,不等于能自己做出来;理解一个漂亮的解法,也不等于能在压力下独立得出解法。

关于如何培养技能,刻意练习研究大体指向同一个方向:针对一项具体而狭窄的子技能,反复进行需要努力的尝试,再获得准确指出错误所在的反馈。K. Anders Ericsson、Ralf Krampe与Clemens Tesch-Römer关于专家表现的奠基研究发现,专家小提琴手之间的个体差异,与此类结构化、高投入练习的累计时间密切相关,而不是与笼统的“经验”相关。不过,该研究样本很小,每组只有十名小提琴手,练习时数也来自回溯估算。一项双盲直接重复研究未能复现其核心主张,即技能水平与累计练习之间“完全对应”:最佳组与优秀组小提琴手之间没有显著差异,练习所解释的表现方差也从原研究的48%降至26%(Macnamara与Maitra,Royal Society Open Science,2019)。AI很适合完成循环中的两项工作:生成评分标准和提供具体反馈。对于第三项,也就是亲自尝试,它却是很差的替代品。

模型可以生成练习作答、按照评分标准打分,并解释示范答案。但如果让它代替你完成尝试,培养技能所需的关键过程也会随之消失。对于任何出错会带来身体危险的技能,它也无法像合格教练一样观察和纠正你的动作。

第1步:把子技能收窄到几乎无聊

“提高写作”不是可单独练习的子技能。“为陌生开发邮件写一句只有该收件人才适用的开场白”才是。

好的子技能:

  • 窄到可在15分钟内尝试。
  • 具体到能无歧义判断一次尝试是否达标。
  • 连接到你已观察到的真实缺口,而非泛泛的弱点。

模糊子技能产出模糊反馈。收窄的子技能产出你能立刻行动的反馈。

第2步:尝试之前先制定评分标准

顺序很重要。看过作品后才制定评分标准,往往会在无意中迁就已经写出的内容。事先制定标准,评价才更诚实。

我在练习这项具体子技能:[精确描述它]。
请生成3–5条评分标准,使不同的人都能用它们一致地评价一次尝试。
对每条标准,具体描述“达标”与“未达标”分别长什么样。
不要包含“质量”或“清晰”这类没有此处具体含义描述的模糊标准。

John Hattie与Helen Timperley对反馈研究的综述指出,有效反馈围绕三个问题展开:目标是什么、目前表现如何、下一步该做什么。事先写好的评分标准,让第二个问题可以根据具体条目回答,而不是只给出笼统印象。

第3步:尝试,中途不向AI求助

设定时限,然后亲自写、解、说或做。尝试过程中不要打开聊天窗口索要提示。这是人们最想跳过的一步,也是真正培养技能的一步。

在把作品交给任何工具或他人之前,先按照评分标准诚实地自评。这一步本身就很重要。之后把自己的判断与模型反馈比较,可以看出你对质量的内在判断是否准确,而这也是值得培养的能力。

第4步:用“先尝试”提示词请求反馈

我在练习[子技能]。这是我的评分标准:[粘贴评分标准]。

这是我的尝试:[粘贴尝试]。

按照每项评分标准打分,并给出具体理由。
指出最薄弱的具体一行或一个时刻,不要只给笼统印象。
先不要改写我的尝试或给我示范答案。
在给我其他任何东西之前,先问我一个能帮我自己改进的问题。

“先不要改写”是这条提示词中最重要的一行。没有它,多数模型会默认立刻产出改进版,悄悄把你的练习变成编辑模型作品,而不是自己的作品。

第5步:在看到示范答案之前先重试

根据反馈完成第二次尝试。它仍然必须是你自己的作品,而不是模型的改写。

这是我根据你的反馈做的第二次尝试:[粘贴它]。
请按照同一套评分标准再次打分。
具体说明尝试一与尝试二之间什么变了,以及变化是否真正针对了你指出的最弱点。

若时间允许,做第三次尝试。至少完整重试一次之后,再要示范例子:

现在请给我一个针对[子技能]、符合相同评分标准的优秀示例。
具体指出它与我的尝试2有何不同,并引用相应评分标准的名称。
不要把它说成唯一正确的做法。如果存在合理的其他风格,请指出一种。

把示范答案留到重试之后,并非随意设定的规则。这样会迫使你主动从记忆和推理中生成改进后的尝试,而不是被动比较答案。关于测试效应的研究一致表明,只做被动比较带来的长期记忆效果较弱。

完整示例

子技能:把防御性的客服回复改写成平静、具体的回复,且不加虚假承诺。

事先制定的评分标准:(1)明确承认客户的具体投诉,而不是泛泛回应;(2)不含防御性语言(“那不是我们的政策”“你本来应该……”);(3)给出一项有明确时间范围的下一步;(4)不作出写作者实际上无法兑现的承诺。

尝试1:承认了投诉并给出下一步,但写下“我们总会在24小时内处理退款”,而写作者实际上无权作出这项保证。

反馈:4项中满足3项,明确指出第4项不合格。模型点出那句具体文字,并询问写作者能否亲自保证这个时限,而不是直接改写。

尝试2:把承诺改成“我已将此事转交退款团队,他们会在两个工作日内跟进”,这符合写作者实际能够承诺的范围。

第二次得分:4项中有4项达标。然后写作者才要求查看示范例子,专门比较承认投诉时所用的语气。

这个循环中最有价值的时刻,不是看到最终润色后的版本,而是模型针对某个具体句子提出尖锐问题,迫使写作者真正完成第二次尝试,而不是只编辑模型的作品。

不同领域,同一形状

循环适用于差异很大的子技能:

  • 语言学习: 子技能是在语境中正确写出过去时句子;尝试是一小段文字;评分标准检查动词一致和自然语序;反馈指出具体有问题的句子,而不是泛泛地说“语法需要加强”。
  • 数据分析: 子技能是根据图表写出一句清楚的洞察;尝试就是这句话;评分标准检查是否说清具体比较,并避免在没有数字时使用“显著”等模糊词;反馈直接指出这个词。
  • 公开演讲: 子技能是用具体的引子开场,而不是先展示议程;尝试是写下或录制开场句;评分标准检查具体程度和长度;反馈根据文字稿评价句子本身,不评价现场表现。

无论在哪个领域,模型的职责都相同:保持评分标准不变,对实际尝试打分,并在学习者至少重试一次之前不提供润色版本。

防范两种具体失败模式

答案泄漏。 如果反馈提示中意外包含了接近解法的措辞,例如粘贴了模型可能记得的问题描述和广为人知的示范解答,模型可能只是在复述已知答案,而不是评价你的推理。反馈请求应只围绕你的实际尝试。若反馈读起来像教科书答案,而不像针对你所写内容的回应,就要保持怀疑。

虚构的专业能力。 即使模型无法根据某一领域的现行标准可靠核实正确性,仍可能自信地为技术、医疗、法律或安全关键型任务打分。回答语气自信,不等于内容准确。对于具有现实风险的事项,例如法律文件、医学学习答案或财务计算,在信任评分前,应根据权威来源或合格专业人士的意见核验评分标准和反馈。

跨会话记录进度

单次反馈循环有用;只有连续记录多次练习,才能看出你是真正在进步,还是进入了平台期。

会话子技能最佳自评限制得分的因素下一步焦点
1冷邮件开场2/4第一行泛泛写前研究一个具体细节
2冷邮件开场3/4具体但太长开场压到一句
3冷邮件开场4/4转到行动号召子技能

一旦子技能在两次会话中保持顶分,就移到下一个,而不是继续练习你已展示过的东西。

哪些场景不适合使用这套方法

对于出错可能造成身体危险,或必须实时纠正动作的技能,例如驾驶、操作机械、大多数体育运动和乐器演奏,以及医疗和临床操作,聊天式反馈无法观察你的动作、姿势或环境,因此不能代替合格的人类教练。应把这套流程用于可以根据文字或录音评价的可观察成果,例如写作、分析、语言练习、结构化论证和代码审查。

对于刻意练习究竟能保证什么,也应保持更细致的认识。Brooke Macnamara、David Hambrick与Frederick Oswald后续的元分析发现,刻意练习可以解释表现差异中有意义但有限的一部分,在游戏和音乐领域所占比例较大,在教育和专业领域则小得多。结构化且需要努力的练习确实有帮助,但它不是唯一变量。声称练满固定小时数就一定成为专家,超出了证据支持的范围。

围绕循环建立习惯

练习循环只有反复进行才有用,因此它与习惯设计直接相关。应选择稳定的触发线索,例如吃完某一餐或当天合上笔记本电脑之后,而不是依赖“记得要练习”。如果子技能属于正在进行的更大课程,这套方法也可以配合更完整的学习计划使用;如果还需要先理解概念才能开始尝试,则可结合四提示词辅导循环

今天选择一项范围明确的子技能,先制定评分标准,再在索要任何帮助前亲自尝试。下载刻意练习循环工作表,完成整个循环。

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。