配套视频

推理模型提示词工程(o3、R1、Claude扩展思考)——配套视频

文章的核心观点是,推理模型颠覆了以往的提示词方法:你不再指导思维链,而是开始编写严谨的问题规格。这两段视频会解释其中的原因和来龙去脉——一段清楚说明了推理模型为何属于不同类型的模型;另一段则是一场简短的团队对谈,由构建o1的人员讲述那个令标准提示技巧变得多余的“顿悟”时刻。

首选视频

27:51
o1究竟是怎么回事?为什么o1是第三种模型范式,以及你可能不知道的10件事

AI Explained

这是最清晰、不炒作的讲解,说明o1(以及由此延伸的o3、R1和Claude extended thinking)为何在下一个token预测之上加入强化学习,以奖励正确的多步骤答案,以及这对你与模型沟通的方式意味着什么。看过它之后,文章中“不要再说‘一步一步思考’,而要开始编写规格”的建议就不会显得武断。

您应该从中获得什么: 理解推理模型的提示词为何应明确问题、约束条件和成功标准,而不是要求模型展示思维链。

先观看或了解: 具备基本的提示词使用经验,并熟悉o系列、Claude extended thinking和R1等模型名称。

AI Expert 注释: 将o1术语视为历史背景。真正有用的经验,是提示方法转向严谨的任务规格;当前的模型名称、产品限制和最佳实践仍会不断变化。

打开视频页面

也值得关注

03:16
构建OpenAI o1

OpenAI

o1团队用三分钟讲述模型在强化学习(RL)训练期间开始质疑自身推理的那个时刻。这是一手资料,可以佐证文章的观点:思维链如今发生在模型内部,而不是由你写入提示词。

您应该从中获得什么: 了解推理模型区别于普通聊天模型的最初产品和研究定位。

先观看或了解: 先观看首选视频,或阅读配套文章中的推理模型部分。

AI Expert 注释: 将其作为历史资料保留,而不是当前的实施指南。它解释了这一类别为何出现,但生产环境中的选择应依据当前的模型阵容和API文档。

打开视频页面