思维链、自我批评、思维树——何时使用哪一种
中级10 分钟阅读提示词工程

思维链、自我批评、思维树——何时使用哪一种

三种能切实提升AI处理难题时输出质量的推理技术,以及使用它们的成本效益账。本文提供具体提示词、并列对比,并说明现代推理模型带来的注意事项。

您应该能够做到的事情

思维链、自我批评和思维树都能显著提升难题的解答质量,但代价是延迟、token和耐心。应针对问题选择合适的技术,而推理模型又会改变其中的权衡方式。

AI Expert Team发布日期: 2026年5月15日
仅在此浏览器中保存。
本文内容

提示工程中有三种技术,可以在高难度分析任务上带来可衡量、可重复的改进:思维链自我批评思维树。自2022至2023年那一波推理研究以来,这些技术一直受到学界关注——思维链见Wei et al., 2022,思维树见Yao et al., 2023。尽管专用推理档位已经兴起(当前GPT-5.x和Claude模型的思考模式,以及DeepSeek R1),这些技术依然重要:一方面,它们对快速模型仍然有用;另一方面,它们也决定了你应该如何为推理模型本身编写提示词。

本文将介绍每种技术是什么、该在什么时候使用哪一种,以及相关的成本效益账。

这些技术解决什么问题

这三种技术针对的是同一个根本问题:语言模型通常以自回归方式逐个token生成答案。如果没有单独的审议或搜索阶段,早期生成的token会迅速限制后续内容,使答案过早锁定在薄弱的结论上。对于简单任务,这样做没有问题,也很高效。但对于多步推理、复杂分析,或任何需要正确处理多个中间环节才能得出答案的任务,这种默认方式可能产出看似自信却错误的结果。

这些技术迫使模型在确定答案之前,将更多计算用在中间推理上。

思维链(CoT)

这是最早也最简单的技术。在提示词中加入“给出最终答案前,请逐步思考”之类的语句,模型就会先给出推理过程,再给出结论。

来看一个完整示例。请比较:

**普通提示:**一列火车上午9:00从塔林出发,速度为80 km/h。另一列火车上午9:30从塔尔图出发,以100 km/h的速度驶向塔林。两座城市相距190 km。它们会在什么时间相遇?

以及:

**使用CoT:**同一个问题。请逐步思考。首先,计算第一列火车在第二列火车出发前行驶的距离。然后,列出它们相遇时间的方程。展示计算过程,再给出最终答案。

在高难度算术类问题中,普通GPT-3.5级模型的错误率约为30–50%;使用CoT的版本则接近5–15%。随着模型不断进步,这些数字已经有所变化,但总体趋势——加入CoT能够提升多步任务的准确率——在各代模型中始终一致。

适合使用思维链的情况:

  • **多步算术,特别是涉及单位、日期或精确舍入时。**即使是强大的模型也会在这些问题上出错。
  • 逻辑谜题以及答案需要通过一连串推理才能得出的类似问题。
  • **代码调试,**因为答案取决于对状态变化的追踪。
  • **策略分析,**因为结论取决于对多项因素的权衡。

不必使用的情况:

  • 简单的事实回忆。“爱沙尼亚的首都是什么?”不需要CoT。
  • **生成类任务。**写作、总结、起草。在这些任务中,CoT只会增加token,并不会提高质量。
  • **推理模型。**o3、Claude Extended Thinking、DeepSeek R1已经会在内部执行CoT——在提示词中加入“逐步思考”,往好里说是多余,往坏里说则可能适得其反。

最后一点至关重要,我们稍后还会回到这个话题。

自我批评

这是一种分两轮进行的技术。首先让模型生成答案,然后让它批评自己的答案并生成修订版。

提示词结构如下:

第1步:[Your original question]

第2步:审查你上面的答案。找出其中的任何错误、弱点,或你所做但可能并不成立的假设。严格批评你自己的工作。

第3步:根据你的批评,生成修订后的答案。

这种改进源于模型摆脱了第一轮对结论的执着。模型被迫以批评者的视角审视自己的工作,便能发现原本那一轮无法察觉的问题。

更复杂的变体是宪法式/基于原则的自我批评。你先定义答案应该满足的一组原则,再让模型逐项进行评估。

针对这类问题,好的答案应遵循以下原则:

  1. 回答实际问题,而不是该问题的泛化版本。
  2. 引用具体证据,而不是含糊地提及来源。
  3. 在存在不确定性时明确承认这一点。
  4. 对信心进行恰当校准——在有力的论点上保持自信,在薄弱的论点上使用保留措辞。

生成一个答案。然后根据每项原则对其进行评估。之后再修订答案。

Anthropic的Constitutional AI工作以及现代对齐研究中的类似方法,背后采用的就是这种技术。

适合使用自我批评的情况:

  • 希望不离开当前对话就进行第二轮完善的写作任务。
  • 模型很可能过度自信的分析工作。
  • 希望模型找出自身论证漏洞的决策支持。
  • 希望在代码生成后再进行一轮审查的代码任务。

不必使用的情况:

  • 不存在可作为修订目标的“正确”答案的任务(创意头脑风暴、想法生成)。
  • 你更希望亲自进行批评的任务(任何以你的判断为核心价值的任务)。
  • **快速对话回复,**因为此时延迟成本会超过质量收益。

思维树(ToT)

这是成本最高的技术。模型不再只生成一条推理链,而是显式考虑多条路径,评估每一条路径,再选择最有希望的一条。

一个完整示例的结构如下:

第1步:为这个问题生成三种不同的解决方法。

第2步:针对每种方法完成最初的几个步骤,但不要确定最终答案。

第3步:评估哪种方法最有可能成功,并说明原因。具体指出各自的优势和弱点。

第4步:选定最佳方法并完成解答。

思维树之所以有效,是因为有些问题存在多种看似可行的解决路径,而你最先尝试的并不总是最佳路径。通过强制进行并行探索,你可以避免被锁定在次优路径上。

来看一个实际的高难度提示词示例:

我有一条复杂的SQL查询,运行速度太慢。请帮我优化。

第1步:生成三种不同的优化策略。 第2步:针对每种策略,指出它要解决的具体瓶颈及其成本。 第3步:评估哪种策略最有可能以最低风险为我们带来最大的收益。 第4步:实施选定的方法。

与“这是一个改写版本”相比,你得到的结果会明显更有深度:三种方法、相互比较、建议以及实施方案。

适合使用思维树的情况:

  • **存在多个可信解决方案的问题。**架构决策、算法选择、战略选择。
  • **优化问题。**首次尝试往往不是最佳方案。
  • **以探索为目的的创意任务。**命名、框架设计、定位。
  • 任何你怀疑显而易见的答案可能有误的任务。

不必使用的情况:

  • **只有一种正确解决方法的任务。**如果一条SQL查询就能解决问题,就不要索要三条。
  • **简单的事实问题。**没有必要。
  • 大多数推理模型任务——如今,这些模型会在内部完成这类探索。

实用决策树

当你面对一个难题时,真正的问题不是“我应该使用CoT、自我批评还是ToT”,而是“这个问题的形态是什么?”

  • 线性多步问题(算术、逻辑谜题、严谨推理)→ 思维链。
  • 过度自信构成风险的问题(分析、建议、应当经过审查的代码)→ 自我批评。
  • 存在多种可行方法的问题(优化、战略选择、创意探索)→ 思维树。
  • 对话式、简单或生成式任务 → 都不用,省去额外开销。

还有一种有用的元模式:在自我批评中使用ToT,并在ToT中使用CoT。探索三条路径(ToT),逐步推理每一条路径(CoT),然后批评选定的路径(自我批评)。这听起来有些过度,但对于难度最高的分析工作确实有用。代价是延迟和token;收益则是答案质量得到实质提升。

推理模型如何改变这笔账

自2024年以来,最大的变化是专用推理模型的兴起——o1、o3、Claude Extended Thinking、DeepSeek R1、Gemini 2.5 Thinking。这些模型在输出答案之前会在内部执行思维链,通常会“思考”数十秒甚至数分钟。

这从三个重要方面改变了提示方式:

**1. 不要再加入“逐步思考”。**推理模型本来就会这样做。显式加入这句话可能会让模型困惑或生成多余的内容。直接提问即可。

**2. 相信模型选择的推理长度。**如果你提出一个复杂问题,模型会在内部生成一条很长的推理链。你不会看到全部内容(有些内容隐藏在“思考”模式中)。相应的代价是延迟,请耐心等待。

**3. 使用简单、直接的提示词。**与快速模型相比,推理模型对提示词没那么敏感——它们会通过推理处理歧义,而不是被歧义卡住。对快速模型效果很好的过度设计提示词(大量背景框定、多重约束、结构化模板),有时反而会降低推理模型的输出质量。先尝试更简单的版本。

来看一个完整示例。请比较给推理模型的以下两个提示词:

提示词A:“请逐步思考以下问题。首先,确定关键约束条件。然后列出选项。再根据约束条件评估每个选项。最后做出选择。展示每一步的推理。问题:我们是否应该实行每周四天工作制?”

提示词B:“我们是否应该实行每周四天工作制?背景:一家有80人的B2B SaaS公司,客户支持团队在周一至周五运营。”

对于大多数推理模型,提示词B会生成更好的答案。推理模型已经知道如何思考这个问题;显式的脚手架可能会以有害的方式限制它。

对于快速模型,情况恰恰相反。它们需要脚手架才能生成质量相当的结果。

这是自2023年以来提示工程领域最重要的新事实:在快速模型上效果最佳的同一个提示词,放在推理模型上可能反而更差,反之亦然

成本效益账

这些技术都有成本。下面是如实的核算:

技术token成本延迟成本质量提升何时值得使用
思维链~2–3x~1.5–2x难题上提升10–40%使用快速模型处理多步问题时
自我批评~2x~2x整体提升5–20%过度自信确实构成风险时
思维树~3–5x~2–3x多方法问题上提升10–30%存在多条路径的难题
推理模型(内置)~3–10x~5–30x难题上提升30–100%任何真正困难的问题

对于大多数日常用途,不采用任何技术的快速模型就足够了。对于难题,合适的技术(或推理模型)值得额外的成本。对于简单任务,所有这些技术都是在浪费金钱和时间。

一条实用原则:**在决定采用某项技术之前,先问问自己,这项任务出错的代价是否大到足以证明该技术的额外成本是合理的。**如果是,就使用合适的技术;如果不是,直接发送提示词即可。

完整示例:一项真正困难的任务

假设你正在评估两份供应商提案,希望得到一份经过恰当校准的比较。

不使用任何技术(普通提示词):

比较这两份供应商提案[paste]。我们应该选择哪一家?

你会得到一份有所保留、兼顾双方的回答。可以作为起点,但还不够。

使用CoT:

比较这两份供应商提案。请逐步思考:

  1. 列出对我们的决策很重要的标准。
  2. 根据每项标准为每家供应商评分。
  3. 找出分数差异最大的标准。
  4. 然后给出你的建议。

你会得到结构清晰得多的分析。每一步都清楚可见,你可以核实或纠正。

再加上自我批评:

[same as above]

给出建议后,批评你自己的分析:

  1. 我可能错误地设定了哪些标准的权重?
  2. 我做了哪些不该做的假设?
  3. 支持另一家供应商的最有力、可信的理由是什么?

然后在必要时给出修订后的建议。

批评环节会找出第一轮分析中的盲点。

使用ToT:

比较这两份供应商提案。

第1步:针对这类选择,生成三种不同的决策框架(例如,风险最小化、价值最大化、能力匹配)。 第2步:应用每个框架,得出三项建议。 第3步:这些框架在哪些方面意见一致?在哪些方面存在分歧? 第4步:考虑到我们的实际约束,哪个框架最合适?给出最终建议。

你会从三个不同角度看待这项选择;差异之处正是最值得思考的地方。

使用推理模型:

比较这两份供应商提案。我们应该选择哪一家,为什么?请说明哪些因素会改变你的答案。

推理模型会在内部完成上述所有工作。其输出通常能与经过大量提示的快速模型输出相当,甚至更好,而实际耗时大致相同。

在2026年,对于真正困难的分析工作,使用干净提示词的推理模型通常是正确选择。CoT和ToT对快速模型仍然有用,而无论底层模型是什么,自我批评作为额外一层仍然有用。

几个实用习惯

**让自己清楚使用了哪种技术。**在提示词中记下你使用的技术,这有助于你培养对哪些方法有效的直觉。

**比较输出。**每周一次,分别在使用和不使用某项技术的情况下运行同一个高难度提示词,看看结果有何不同。你很快就能判断何时值得付出这项技术的成本。

**不要不加思考地堆叠技术。**把CoT + 自我批评 + ToT + 推理模型全都堆在一起,通常不如选择合适的一种。每增加一层都会增加成本;只有当某一层确实能改善你这项具体任务的答案时,才应添加。

**将这些技术收入你的提示词库。**准备好“使用CoT”“使用自我批评”“使用ToT”的片段,并将其应用于当前任务,可以省下反复输入脚手架的大量时间。

要点总结

三种技术,各有最适合的场景。思维链适合线性多步问题;自我批评适合发现过度自信;思维树适合有多种解决方法的问题。推理模型会在内部执行前两项技术,从而改变成本效益账——但这些技术仍然重要,既适用于快速模型,也可以作为叠加在模型之上的模式。

根据问题选择合适的技术。当它们无法带来对得起成本的收益时,就不要使用。理解“更难的问题”和“不同的问题”之间的差别,其他一切都会由此展开。

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。