Три изученных способа организации промпта и поиска решения — chain-of-thought, self-critique и tree-of-thoughts. Chain-of-thought исследовали Wei и соавторы, 2022, а tree-of-thoughts — Yao и соавторы, 2023, но на конкретных моделях и наборах задач. Эти работы не доказывают универсального улучшения для современных моделей или бизнес-задач. Рассматривайте каждый способ как гипотезу и сравнивайте его с прямым промптом на собственном наборе оценки.
Ниже — что каждая из техник собой представляет, когда какую применять и какова их экономика.
Какую проблему они решают
Все три техники бьют в один и тот же корень: языковая модель обычно генерирует ответ авторегрессивно, по одному токену за раз. Без отдельной фазы обдумывания или поиска ранние токены быстро ограничивают то, что следует дальше, и могут зафиксировать ответ на слабом выводе. Для простых задач это нормально и эффективно. Для многошаговых рассуждений, сложного анализа или всего, где ответ зависит от нескольких верно сделанных промежуточных шагов, такой режим по умолчанию даёт уверенно неправильные ответы.
Такие промпты запрашивают промежуточную структуру или дополнительные проходы. Более длинный видимый текст и большее число вызовов увеличивают стоимость, но сами по себе не доказывают правильность ответа.
Chain-of-thought (CoT)
Исходный шаблон предлагает модели сформировать промежуточное рассуждение до ответа. В рабочем процессе лучше запрашивать необходимые проверяемые артефакты — уравнения, допущения, источники, результаты тестов или краткое обоснование решения, — а не считать свободное внутреннее повествование доказательством.
Проработанный пример. Сравните:
Без CoT: Поезд выходит из Таллинна в 9:00, идёт со скоростью 80 км/ч. Другой поезд выходит из Тарту в 9:30 навстречу со скоростью 100 км/ч. Расстояние между городами 190 км. Во сколько они встретятся?
и:
С CoT: Тот же вопрос. Думай по шагам. Сначала посчитай расстояние, которое первый поезд проходит до отправления второго. Затем составь уравнение момента встречи. Покажи решение, потом дай финальный ответ.
Работа 2022 года показала улучшения на нескольких тестах арифметического, житейского и символьного рассуждения для достаточно крупных на тот момент моделей, причём эффект существенно зависел от модели и задачи. Не переносите исторические результаты на современную модель, другой промпт или рабочие данные. Запустите оба варианта и оцените итоговый ответ вместе с проверяемыми промежуточными результатами.
Когда применять chain-of-thought:
- Многошаговая арифметика, особенно с единицами, датами или точными округлениями. Даже сильные модели тут спотыкаются.
- Логические задачи и похожие, где ответ — конец цепочки рассуждений.
- Отладка кода, где ответ зависит от прослеживания состояния.
- Стратегический анализ, где вывод зависит от взвешивания нескольких факторов.
Когда не стоит:
- Простое припоминание фактов. «Какая столица Эстонии?» — CoT не нужен.
- Генеративные задачи. Письмо, резюмирование, черновики. CoT только добавляет токены без выигрыша в качестве.
- Рассуждающие модели. o3, Claude Extended Thinking, DeepSeek R1 уже делают CoT внутри — добавлять «думай по шагам» в промпт в лучшем случае избыточно, в худшем контрпродуктивно.
К последнему пункту мы вернёмся — он критичен.
Self-critique
Двухпроходная техника. Сначала просим модель дать ответ. Потом просим её же раскритиковать собственный ответ и выдать переработанную версию.
Структура промпта:
Шаг 1: [Ваш исходный вопрос]
Шаг 2: Просмотри свой ответ выше. Найди ошибки, слабые места и допущения, которые могут не выполняться. Будь жёстким критиком собственной работы.
Шаг 3: На основе критики выдай переработанный ответ.
Дополнительный проход способен найти часть дефектов, но та же модель может повторить или рационализировать исходную ошибку. Считайте самокритику ещё одним ошибающимся оценщиком; при существенных последствиях используйте детерминированные проверки, найденные источники, тесты или независимую квалифицированную проверку.
Более продвинутый вариант — constitutional / principle-based self-critique (самокритика на основе принципов). Вы задаёте набор принципов, которым должен удовлетворять ответ, и просите модель оценить себя по каждому.
Принципы хорошего ответа на такой вопрос:
- Он отвечает на собственно заданный вопрос, а не на его обобщение.
- Он цитирует конкретные доказательства, а не машет в сторону источников.
- Он явно признаёт неопределённость там, где она есть.
- Он откалиброван — уверен в сильных пунктах, осторожен в слабых.
Выдай ответ. Затем оцени его по каждому принципу. Затем переработай.
Именно эта техника стоит за работой Anthropic над Constitutional AI и схожими подходами в современных исследованиях по согласованию (alignment).
Когда применять self-critique:
- Письменные задачи, где нужен второй проход, не выходя из разговора.
- Аналитика, где модель скорее всего будет самоуверенной.
- Поддержка решений, где хочется, чтобы модель нашла дыры в собственной аргументации.
- Код, где после прохода генерации хочется проход ревью.
Когда не стоит:
- Задачи без «правильного» ответа, к которому можно переработать (творческий брейншторм, генерация идей).
- Задачи, где критику хочется делать самому (всё, где ценность — ваше суждение).
- Быстрые разговорные ответы, где стоимость задержки перевешивает выигрыш в качестве.
Tree-of-thoughts (ToT)
Самая дорогая техника. Вместо одной цепочки рассуждений модель явно рассматривает несколько путей, оценивает каждый и выбирает самый перспективный.
Структура с проработанным примером:
Шаг 1: Сгенерируй три разных подхода к этой задаче.
Шаг 2: Для каждого подхода пройди несколько первых шагов, не фиксируя финальный ответ.
Шаг 3: Оцени, какой подход с большей вероятностью сработает и почему. Будь конкретен в плюсах и минусах.
Шаг 4: Выбери лучший подход и доведи решение.
Поиск по нескольким ветвям стоит применять, когда у задачи действительно есть несколько правдоподобных подходов и процесс способен оценивать промежуточные варианты. Три сгенерированных варианта не гарантируют разнообразия и могут повторять одно ложное допущение; задайте критерии сравнения и сохраните основания выбора.
Практический пример — сложный промпт:
У меня сложный SQL-запрос, который выполняется слишком медленно. Помоги оптимизировать.
Шаг 1: Сгенерируй три разных стратегии оптимизации. Шаг 2: По каждой — какое именно узкое место она устраняет и какой ценой. Шаг 3: Оцени, какая даст самый большой выигрыш при наименьшем риске. Шаг 4: Реализуй выбранный подход.
В ответе вы получаете заметно более вдумчивую вещь, чем «вот один переписанный запрос». Три подхода, сравнение, рекомендация, реализация.
Когда применять tree-of-thoughts:
- Задачи с несколькими правдоподобными решениями. Архитектурные решения, выбор алгоритма, стратегический выбор.
- Задачи оптимизации. Где первая попытка редко лучшая.
- Творческие задачи, где исследование и есть смысл. Нейминг, упаковка, позиционирование.
- Что угодно, где вы подозреваете, что очевидный ответ неверен.
Когда не стоит:
- Задачи с одним правильным подходом. Не просите три SQL-запроса, если работает один.
- Простые фактические вопросы. Перебор.
- Большинство задач для рассуждающих моделей — модели теперь делают такое исследование внутри.
Практическое дерево решений
Когда перед вами сложная задача, вопрос не в том, «какую технику применить — CoT, self-critique или ToT». Вопрос в том, «какой формы эта задача».
- Линейная многошаговая задача (арифметика, логическая головоломка, строгое рассуждение) → chain-of-thought.
- Задача, где риск — самоуверенность (анализ, рекомендация, код, который нужно отревьюить) → self-critique.
- Задача с несколькими правдоподобными подходами (оптимизация, стратегический выбор, творческое исследование) → tree-of-thoughts.
- Разговорная, простая или генеративная → ничего. Пропустите накладные расходы.
Не объединяйте техники по умолчанию. Сравните прямой промпт, один дополнительный способ организации рассуждения и, при необходимости, их сочетание на одних и тех же примерах. Оставьте самый простой вариант, проходящий критерии выпуска.
Как модели с углублённым рассуждением меняют проверку промпта
Возможности и настройки моделей с углублённым рассуждением зависят от поставщика и версии. Названия моделей, сроки их поддержки, настройки усилия и видимость промежуточного содержимого меняются, поэтому сверяйтесь с актуальной документацией поставщика, а не с зафиксированным в статье списком.
Это меняет то, как с ними работать, в трёх важных отношениях:
1. Начинайте с результата. Укажите цель, важный контекст, ограничения, требования к доказательствам и критерий завершения. Текущие рекомендации OpenAI по промптам для GPT-5.6 советуют ясно описывать требуемый результат и проверять упрощения промпта на репрезентативных задачах.
2. Проверяйте результат, а не объём рассуждения. Большее усилие или задержка не доказывают правильность. Требуйте ссылки, расчёты, валидацию схемы, тесты или другие подходящие задаче доказательства и измеряйте итоговый результат.
3. Сравнивайте прямой промпт с необходимой структурой. Убирайте избыточные инструкции по одной группе, но сохраняйте реальные ограничения и обязательные схемы ответа. Короткий промпт лучше только тогда, когда проходит те же тесты.
Проработанный пример. Сравните два промпта к рассуждающей модели:
Промпт A: «Думай по шагам про следующий вопрос. Сначала выяви ключевые ограничения. Потом перечисли варианты. Потом оцени каждый вариант по ограничениям. Потом выбери. Показывай рассуждения на каждом шаге. Вопрос: стоит ли нам ввести четырёхдневную рабочую неделю?»
Промпт B: «Стоит ли нам ввести четырёхдневную рабочую неделю? Контекст: B2B SaaS на 80 человек, команда поддержки работает пн–пт».
Промпт B полезен как базовый вариант, но в нём отсутствуют критерии решения, требования к доказательствам, влияние на заинтересованные стороны и критерий завершения. Сравните его с кратким структурированным промптом и оцените оба; не выбирайте победителя только по длине. Разные модели и настройки реагируют на дополнительную структуру по-разному, поэтому храните промпт вместе с версией модели и результатами оценки и повторяйте тесты при обновлении.
Арифметика издержек и выгод
Дополнительная структура может увеличить число токенов, вызовов и задержку. Универсального множителя без фиксированных модели, задачи, промпта, настройки рассуждения и условия остановки не существует:
| Подход | Что измерять | Возможное применение |
|---|---|---|
| Запрошенная промежуточная работа | правильность ответа и артефактов, токены, задержка | задачи с проверяемыми промежуточными результатами |
| Самокритика | найденные и добавленные дефекты, ложная уверенность, стоимость второго прохода | переработка по явной рубрике |
| Поиск по нескольким ветвям | разнообразие путей, точность оценщика, общее число вызовов, хвостовая задержка | задачи с действительно различными подходами |
| Режим рассуждения поставщика | доля пройденных задач при разных настройках усилия, токены, задержка, цена | только когда большее усилие улучшает приёмочные тесты |
Используйте прямой промпт как базовый вариант. Добавляйте структуру или режим рассуждения только тогда, когда измеренное улучшение качества оправдывает дополнительные стоимость и задержку для этой задачи.
Практическое правило: прежде чем тянуться за техникой, спросите, оправдывает ли цена ошибки на этой задаче дополнительную стоимость техники. Если да — берите подходящую. Если нет — просто отправляйте промпт.
Проработанный пример: настоящая сложная задача
Допустим, вы оцениваете два предложения от подрядчиков и хотите выверенное сравнение.
Без техник (обычный промпт):
Сравни эти два предложения [вставка]. Какое выбрать?
Вы получите осторожный, «и так и эдак» ответ. Полезная отправная точка; этого мало.
С CoT:
Сравни эти два предложения. Думай по шагам:
- Перечисли критерии, важные для нашего решения.
- Оцени каждого подрядчика по каждому критерию.
- Определи критерии, по которым оценки расходятся сильнее всего.
- Затем дай рекомендацию.
Вы получаете гораздо более структурированный анализ. Каждый шаг виден; можно проверить или поправить.
С self-critique сверху:
[то же, что выше]
После рекомендации раскритикуй собственный анализ:
- Каким критериям я мог дать неправильный вес?
- Что я допустил, чего не следовало?
- Какой самый сильный правдоподобный довод за другого подрядчика?
Затем выдай переработанную рекомендацию, если нужно.
Критика ловит слепые зоны первого анализа.
С ToT:
Сравни эти два предложения.
Шаг 1: Сгенерируй три разных каркаса принятия таких решений (например, минимизирующий риск, максимизирующий ценность, ориентированный на возможности). Шаг 2: Примени каждый каркас. Получи три рекомендации. Шаг 3: Где каркасы сходятся? Где расходятся? Шаг 4: С учётом наших реальных ограничений, какой каркас уместнее? Финальная рекомендация.
Получаете три разных угла на выбор; различия — это место, где живёт интересное мышление.
С рассуждающей моделью:
Сравни эти два предложения. Какое выбрать и почему? Включи то, что изменило бы твой ответ.
Рассуждающая модель делает всё вышеперечисленное внутри. Вывод часто сопоставим с выводом быстрой модели с тяжёлым промптом или лучше — примерно за то же реальное время.
В 2026 году на по-настоящему сложной аналитической работе рассуждающая модель с чистым промптом — обычно правильный ход. CoT и ToT остаются полезными с быстрыми моделями, а self-critique — полезным слоем поверх любой модели.
Несколько практических привычек
Делайте технику видимой для себя. Помечайте в промпте, какую технику применили, — это помогает наработать интуицию.
Сравнивайте выводы. Раз в неделю прогоняйте один и тот же сложный промпт с техникой и без и смотрите, насколько ответы различаются. Быстро откалибруетесь, когда техника окупает свою цену.
Не нагромождайте техники бездумно. Нагромождение CoT + self-critique + ToT + рассуждающая модель редко лучше правильно выбранной одной. Каждый слой добавляет цену; добавляйте только то, что действительно улучшает ответ на вашу конкретную задачу.
Держите техники в библиотеке. Сниппеты «с CoT», «с self-critique», «с ToT» — приложил к текущей задаче — экономят реальное время по сравнению с перепечатыванием каркаса.
Главная мысль
Три техники. У каждой своя область применения. Chain-of-thought — для линейных многошаговых задач. Self-critique — чтобы ловить самоуверенность. Tree-of-thoughts — для задач с несколькими подходами. Рассуждающие модели меняют арифметику, делая первые две внутри, — но техники всё равно важны и для быстрых моделей, и как паттерны, которые можно класть сверху.
Подбирайте правильную под задачу. Пропускайте, когда они не оправдывают цену. Усвойте разницу между «более сложной задачей» и «другой задачей» — всё остальное следует из неё.



