Chain-of-thought, self-critique, tree-of-thoughts — когда что использовать
Уверенный10 мин чтенияЗапросы к ИИ

Chain-of-thought, self-critique, tree-of-thoughts — когда что использовать

Три техники рассуждений, которые действительно улучшают результаты ИИ на сложных задачах, — и арифметика их издержек и выгод. С конкретными промптами, сравнениями бок-о-бок и подвохами, которые приносят современные рассуждающие модели.

Что вы сможете сделать

Chain-of-thought, self-critique и tree-of-thoughts каждая по-настоящему поднимает качество на сложных задачах — ценой задержки, токенов и терпения. Подбирайте технику под форму задачи, а рассуждающие модели опять меняют арифметику.

AI Expert TeamОпубликовано: 15 мая 2026 г.
Сохраняется только в этом браузере.
В этой статье

В промпт-инжиниринге есть три техники, которые дают измеримые, повторяющиеся улучшения на сложных аналитических задачах: chain-of-thought, self-critique и tree-of-thoughts. Их изучают со времён волны исследований по рассуждениям 2022–2023 годов — chain-of-thought описан у Wei et al., 2022, tree-of-thoughts — у Yao et al., 2023 — и, несмотря на появление специализированных рассуждающих режимов (режимы «мышления» современных моделей GPT-5.x и Claude, DeepSeek R1), эти техники всё ещё важны — и потому, что остаются полезными с быстрыми моделями, и потому, что задают стиль работы с самими рассуждающими моделями.

Эта статья — про то, что каждая из техник собой представляет, когда какую применять и какова их экономика.

Какую проблему они решают

Все три техники бьют в один и тот же корень: по умолчанию языковая модель выдаёт ответ за один проход вперёд, рано фиксируя вывод без явного рассуждения. Для простых задач это нормально и эффективно. Для многошаговых рассуждений, сложного анализа или всего, где ответ зависит от нескольких верно сделанных промежуточных шагов, режим «одного прохода» по умолчанию даёт уверенно неправильные ответы.

Техники заставляют модель потратить больше вычислений на промежуточные рассуждения, прежде чем зафиксировать вывод.

Chain-of-thought (CoT)

Самая первая и самая простая. Добавьте к промпту что-то вроде «думай по шагам, прежде чем дать финальный ответ» — и модель сначала выдаст рассуждение, а потом вывод.

Проработанный пример. Сравните:

Без CoT: Поезд выходит из Таллинна в 9:00, идёт со скоростью 80 км/ч. Другой поезд выходит из Тарту в 9:30 навстречу со скоростью 100 км/ч. Расстояние между городами 190 км. Во сколько они встретятся?

и:

С CoT: Тот же вопрос. Думай по шагам. Сначала посчитай расстояние, которое первый поезд проходит до отправления второго. Затем составь уравнение момента встречи. Покажи решение, потом дай финальный ответ.

На сложных арифметических задачах у обычных моделей класса GPT-3.5 доля ошибок составляла около 30–50%; версии с CoT давали 5–15%. С развитием моделей цифры сдвинулись, но направление — добавление CoT повышает точность на многошаговых задачах — сохраняется из поколения в поколение.

Когда применять chain-of-thought:

  • Многошаговая арифметика, особенно с единицами, датами или точными округлениями. Даже сильные модели тут спотыкаются.
  • Логические задачи и похожие, где ответ — конец цепочки рассуждений.
  • Отладка кода, где ответ зависит от прослеживания состояния.
  • Стратегический анализ, где вывод зависит от взвешивания нескольких факторов.

Когда не стоит:

  • Простое припоминание фактов. «Какая столица Эстонии?» — CoT не нужен.
  • Генеративные задачи. Письмо, резюмирование, черновики. CoT только добавляет токены без выигрыша в качестве.
  • Рассуждающие модели. o3, Claude Extended Thinking, DeepSeek R1 уже делают CoT внутри — добавлять «думай по шагам» в промпт в лучшем случае избыточно, в худшем контрпродуктивно.

К последнему пункту мы вернёмся — он критичен.

Self-critique

Двухпроходная техника. Сначала просим модель дать ответ. Потом просим её же раскритиковать собственный ответ и выдать переработанную версию.

Структура промпта:

Шаг 1: [Ваш исходный вопрос]

Шаг 2: Просмотри свой ответ выше. Найди ошибки, слабые места и допущения, которые могут не выполняться. Будь жёстким критиком собственной работы.

Шаг 3: На основе критики выдай переработанный ответ.

Улучшение возникает оттого, что модель освобождается от приверженности выводу, к которому пришла в первом проходе. Вынужденная смотреть на свою работу как критик, она ловит то, чего не поймала бы изначально.

Более продвинутый вариант — constitutional / principle-based self-critique (самокритика на основе принципов). Вы задаёте набор принципов, которым должен удовлетворять ответ, и просите модель оценить себя по каждому.

Принципы хорошего ответа на такой вопрос:

  1. Он отвечает на собственно заданный вопрос, а не на его обобщение.
  2. Он цитирует конкретные доказательства, а не машет в сторону источников.
  3. Он явно признаёт неопределённость там, где она есть.
  4. Он откалиброван — уверен в сильных пунктах, осторожен в слабых.

Выдай ответ. Затем оцени его по каждому принципу. Затем переработай.

Именно эта техника стоит за работой Anthropic над Constitutional AI и схожими подходами в современных исследованиях по согласованию (alignment).

Когда применять self-critique:

  • Письменные задачи, где нужен второй проход, не выходя из разговора.
  • Аналитика, где модель скорее всего будет самоуверенной.
  • Поддержка решений, где хочется, чтобы модель нашла дыры в собственной аргументации.
  • Код, где после прохода генерации хочется проход ревью.

Когда не стоит:

  • Задачи без «правильного» ответа, к которому можно переработать (творческий брейншторм, генерация идей).
  • Задачи, где критику хочется делать самому (всё, где ценность — ваше суждение).
  • Быстрые разговорные ответы, где стоимость задержки перевешивает выигрыш в качестве.

Tree-of-thoughts (ToT)

Самая дорогая техника. Вместо одной цепочки рассуждений модель явно рассматривает несколько путей, оценивает каждый и выбирает самый перспективный.

Структура с проработанным примером:

Шаг 1: Сгенерируй три разных подхода к этой задаче.

Шаг 2: Для каждого подхода пройди несколько первых шагов, не фиксируя финальный ответ.

Шаг 3: Оцени, какой подход с большей вероятностью сработает и почему. Будь конкретен в плюсах и минусах.

Шаг 4: Выбери лучший подход и доведи решение.

Tree-of-thoughts работает потому, что у некоторых задач есть несколько правдоподобных стратегий, и первая попытка не всегда лучшая. Принудительное параллельное исследование избавляет от залипания на неоптимальном пути.

Практический пример — сложный промпт:

У меня сложный SQL-запрос, который выполняется слишком медленно. Помоги оптимизировать.

Шаг 1: Сгенерируй три разных стратегии оптимизации. Шаг 2: По каждой — какое именно узкое место она устраняет и какой ценой. Шаг 3: Оцени, какая даст самый большой выигрыш при наименьшем риске. Шаг 4: Реализуй выбранный подход.

В ответе вы получаете заметно более вдумчивую вещь, чем «вот один переписанный запрос». Три подхода, сравнение, рекомендация, реализация.

Когда применять tree-of-thoughts:

  • Задачи с несколькими правдоподобными решениями. Архитектурные решения, выбор алгоритма, стратегический выбор.
  • Задачи оптимизации. Где первая попытка редко лучшая.
  • Творческие задачи, где исследование и есть смысл. Нейминг, упаковка, позиционирование.
  • Что угодно, где вы подозреваете, что очевидный ответ неверен.

Когда не стоит:

  • Задачи с одним правильным подходом. Не просите три SQL-запроса, если работает один.
  • Простые фактические вопросы. Перебор.
  • Большинство задач для рассуждающих моделей — модели теперь делают такое исследование внутри.

Практическое дерево решений

Когда перед вами сложная задача, вопрос не в том, «какую технику применить — CoT, self-critique или ToT». Вопрос в том, «какой формы эта задача».

  • Линейная многошаговая задача (арифметика, логическая головоломка, строгое рассуждение) → chain-of-thought.
  • Задача, где риск — самоуверенность (анализ, рекомендация, код, который нужно отревьюить) → self-critique.
  • Задача с несколькими правдоподобными подходами (оптимизация, стратегический выбор, творческое исследование) → tree-of-thoughts.
  • Разговорная, простая или генеративная → ничего. Пропустите накладные расходы.

Есть и полезный мета-паттерн: CoT внутри ToT внутри self-critique. Исследуем три пути (ToT), по каждому идём по шагам (CoT), потом критикуем выбранный путь (self-critique). Звучит как перебор, но действительно полезно для самой тяжёлой аналитики. Цена — задержка и токены; выгода — заметно лучшие ответы.

Как рассуждающие модели меняют арифметику

Главный сдвиг с 2024 года — появление специализированных рассуждающих моделей: o1, o3, Claude Extended Thinking, DeepSeek R1, Gemini 2.5 Thinking. Эти модели делают chain-of-thought внутри, прежде чем выдать ответ, — часто «думая» десятки секунд или минуты.

Это меняет то, как с ними работать, в трёх важных отношениях:

1. Перестаньте добавлять «думай по шагам». Рассуждающие модели и так это делают. Явно добавленная фраза может их сбить или дать избыточный вывод. Просто задавайте вопрос напрямую.

2. Доверяйте длине рассуждения модели. Если вопрос сложный, модель внутри сгенерирует длинную цепочку рассуждений. Вы видите не всё (часть скрыта в режиме размышления). Компромисс — задержка. Будьте терпеливы.

3. Используйте простые, прямые промпты. Рассуждающие модели менее чувствительны к промптам, чем быстрые: они прорассуждают сквозь неоднозначность, а не застревают в ней. Переусложнённые промпты, которые хорошо работают с быстрыми моделями (тяжёлая рамка, много ограничений, структурированные шаблоны), иногда ухудшают вывод рассуждающей модели. Сначала пробуйте более простую версию.

Проработанный пример. Сравните два промпта к рассуждающей модели:

Промпт A: «Думай по шагам про следующий вопрос. Сначала выяви ключевые ограничения. Потом перечисли варианты. Потом оцени каждый вариант по ограничениям. Потом выбери. Показывай рассуждения на каждом шаге. Вопрос: стоит ли нам ввести четырёхдневную рабочую неделю?»

Промпт B: «Стоит ли нам ввести четырёхдневную рабочую неделю? Контекст: B2B SaaS на 80 человек, команда поддержки работает пн–пт».

Для большинства рассуждающих моделей Промпт B даст лучший ответ. Рассуждающая модель и так знает, как продумать этот вопрос; явные строительные леса могут её ограничить и навредить.

Для быстрых моделей всё наоборот. Им эти леса нужны, чтобы выдать сопоставимое качество.

Это самый важный новый факт о промпт-инжиниринге с 2023 года: тот же промпт, который лучше всего работает на быстрой модели, может быть хуже на рассуждающей — и наоборот.

Арифметика издержек и выгод

У всех техник есть цена. Честный расчёт:

ТехникаСтоимость в токенахСтоимость в задержкеВыигрыш в качествеКогда стоит того
Chain-of-thought~2–3x~1.5–2x10–40% на сложных задачахМногошаговые задачи на быстрых моделях
Self-critique~2x~2x5–20% в среднемКогда самоуверенность — реальный риск
Tree-of-thoughts~3–5x~2–3x10–30% на задачах с несколькими подходамиСложные задачи с несколькими путями
Рассуждающая модель (встроенная)~3–10x~5–30x30–100% на сложных задачахЧто угодно по-настоящему сложное

Для повседневного использования быстрая модель без техник — нормально. Для сложных задач правильная техника (или рассуждающая модель) окупает доплату. Для тривиальных задач все эти техники жгут деньги и время.

Практическое правило: прежде чем тянуться за техникой, спросите, оправдывает ли цена ошибки на этой задаче дополнительную стоимость техники. Если да — берите подходящую. Если нет — просто отправляйте промпт.

Проработанный пример: настоящая сложная задача

Допустим, вы оцениваете два предложения от подрядчиков и хотите выверенное сравнение.

Без техник (обычный промпт):

Сравни эти два предложения [вставка]. Какое выбрать?

Вы получите осторожный, «и так и эдак» ответ. Полезная отправная точка; этого мало.

С CoT:

Сравни эти два предложения. Думай по шагам:

  1. Перечисли критерии, важные для нашего решения.
  2. Оцени каждого подрядчика по каждому критерию.
  3. Определи критерии, по которым оценки расходятся сильнее всего.
  4. Затем дай рекомендацию.

Вы получаете гораздо более структурированный анализ. Каждый шаг виден; можно проверить или поправить.

С self-critique сверху:

[то же, что выше]

После рекомендации раскритикуй собственный анализ:

  1. Каким критериям я мог дать неправильный вес?
  2. Что я допустил, чего не следовало?
  3. Какой самый сильный правдоподобный довод за другого подрядчика?

Затем выдай переработанную рекомендацию, если нужно.

Критика ловит слепые зоны первого анализа.

С ToT:

Сравни эти два предложения.

Шаг 1: Сгенерируй три разных каркаса принятия таких решений (например, минимизирующий риск, максимизирующий ценность, ориентированный на возможности). Шаг 2: Примени каждый каркас. Получи три рекомендации. Шаг 3: Где каркасы сходятся? Где расходятся? Шаг 4: С учётом наших реальных ограничений, какой каркас уместнее? Финальная рекомендация.

Получаете три разных угла на выбор; различия — это место, где живёт интересное мышление.

С рассуждающей моделью:

Сравни эти два предложения. Какое выбрать и почему? Включи то, что изменило бы твой ответ.

Рассуждающая модель делает всё вышеперечисленное внутри. Вывод часто сопоставим с выводом быстрой модели с тяжёлым промптом или лучше — примерно за то же реальное время.

В 2026 году на по-настоящему сложной аналитической работе рассуждающая модель с чистым промптом — обычно правильный ход. CoT и ToT остаются полезными с быстрыми моделями, а self-critique — полезным слоем поверх любой модели.

Несколько практических привычек

Делайте технику видимой для себя. Помечайте в промпте, какую технику применили, — это помогает наработать интуицию.

Сравнивайте выводы. Раз в неделю прогоняйте один и тот же сложный промпт с техникой и без и смотрите, насколько ответы различаются. Быстро откалибруетесь, когда техника окупает свою цену.

Не нагромождайте техники бездумно. Нагромождение CoT + self-critique + ToT + рассуждающая модель редко лучше правильно выбранной одной. Каждый слой добавляет цену; добавляйте только то, что действительно улучшает ответ на вашу конкретную задачу.

Держите техники в библиотеке. Сниппеты «с CoT», «с self-critique», «с ToT» — приложил к текущей задаче — экономят реальное время по сравнению с перепечатыванием каркаса.

Главная мысль

Три техники. У каждой своя область применения. Chain-of-thought — для линейных многошаговых задач. Self-critique — чтобы ловить самоуверенность. Tree-of-thoughts — для задач с несколькими подходами. Рассуждающие модели меняют арифметику, делая первые две внутри, — но техники всё равно важны и для быстрых моделей, и как паттерны, которые можно класть сверху.

Подбирайте правильную под задачу. Пропускайте, когда они не оправдывают цену. Усвойте разницу между «более сложной задачей» и «другой задачей» — всё остальное следует из неё.

Читать дальше

Продолжайте тот же учебный путь со следующими практическими статьями.

Углубиться

Тщательно подобранные внешние курсы, которые глубже раскрывают эту тему.

DeepLearning.AI

ChatGPT Prompt Engineering for Developers

Иса Фулфорд · Эндрю Ын

Девяносто минут — и вы получаете годовой опыт интуиции. Если вы пишете код, вызывающий LLM, это самый эффективный курс в интернете для закрытия разрыва между «играю с ChatGPT» и «выкатываю функцию с вызовом LLM в рабочую эксплуатацию».

Уверенный~1,5 часа
Coursera · Vanderbilt University

Prompt Engineering for ChatGPT

Dr. Jules White

Хорошее длинное дополнение к короткому курсу DeepLearning.AI, особенно для людей без кода. Dr. White учит промптингу как набору повторяемых паттернов, а не трюкам, поэтому работа с LLM становится системной.

Начинающий~18 часов
Microsoft Learn

Work Smarter with AI: Craft Effective Prompts for Microsoft Copilot

Microsoft Learn

Промпт-инжиниринг, но для инструмента, с которым большинство офисных сотрудников столкнётся первым. Собственная четырёхчастная схема промптов Microsoft (цель, контекст, источник, ожидание) — действительно полезная модель мышления, и в отличие от общих курсов по промптам для ChatGPT уже в нашем каталоге, этот полностью привязан к специфике Microsoft 365 Copilot и тому, как он опирается на данные.

Уверенный~1h 5m · в своём темпе

Все курсы в категории «Запросы к ИИ»