Tres técnicas de diseño de prompts han producido mejoras medibles y repetibles en tareas analíticas difíciles: cadena de pensamiento (chain-of-thought, CoT), autocrítica y árbol de pensamientos (tree-of-thoughts, ToT). Se estudian desde la oleada de investigación sobre razonamiento de 2022-2023 —la cadena de pensamiento en Wei et al., 2022 y el árbol de pensamientos en Yao et al., 2023—. Pese al auge de modos específicos de razonamiento en los modelos GPT-5.x y Claude actuales o en DeepSeek R1, estas técnicas siguen siendo relevantes con modelos rápidos y ayudan a decidir cómo formular prompts para los modelos de razonamiento.
Este artículo explica en qué consiste cada técnica, cuándo utilizarla y cuál es su balance entre costes y beneficios.
El problema que resuelven
Las tres técnicas abordan el mismo problema: un modelo de lenguaje genera normalmente la respuesta de forma autorregresiva, token a token. Sin una fase separada de deliberación o búsqueda, los primeros tokens condicionan rápidamente los siguientes y pueden encaminar la respuesta hacia una conclusión débil. En tareas sencillas, este comportamiento resulta eficiente. En razonamientos de varios pasos o análisis complejos, donde la respuesta depende de acertar en distintas etapas intermedias, puede producir conclusiones incorrectas expresadas con seguridad.
Estas técnicas hacen que el modelo dedique más cálculo a los pasos intermedios antes de ofrecer una conclusión.
Cadena de pensamiento (CoT)
Es la técnica original y más sencilla. Añade una instrucción como «piensa paso a paso antes de dar la respuesta final» para que el modelo desarrolle los pasos intermedios antes de concluir.
Un ejemplo trabajado. Compara:
Básico: Un tren sale de Tallin a las 9:00 y viaja a 80 km/h. Otro sale de Tartu a las 9:30 en dirección a Tallin a 100 km/h. La distancia entre ambas ciudades es de 190 km. ¿A qué hora se encuentran?
versus:
Con CoT: El mismo problema. Piensa paso a paso. Primero, calcula la distancia recorrida por el primer tren antes de que salga el segundo. Después, plantea la ecuación del encuentro. Muestra los cálculos y da la respuesta final.
En determinados problemas aritméticos difíciles, los modelos de la clase GPT-3.5 sin esta técnica mostraban tasas de error de aproximadamente el 30-50%, frente al 5-15% con CoT. Las cifras han cambiado con la mejora de los modelos, pero la tendencia —que CoT puede aumentar la precisión en tareas de varios pasos— se ha mantenido entre generaciones.
Cuándo usar cadena de pensamiento:
- Aritmética multietapa, especialmente con unidades, fechas o redondeo preciso. Incluso los modelos fuertes cometen errores en estos.
- Acertijos lógicos y problemas similares donde la respuesta es la conclusión de una cadena.
- Depuración de código, donde la respuesta depende de seguir el estado.
- Análisis de estrategia, donde la conclusión depende de ponderar múltiples factores.
Cuándo no merece la pena:
- Recuperación factual sencilla. «¿Cuál es la capital de Estonia?» no necesita CoT.
- Tareas generativas. Escribir, resumir o redactar. CoT puede añadir tokens sin mejorar la calidad.
- Modelos de razonamiento. o3, Claude Extended Thinking y DeepSeek R1 ya realizan procesos de razonamiento internos; añadir «piensa paso a paso» puede ser redundante o incluso contraproducente.
Ese último punto es crítico y volveremos a él.
Autocrítica
Es una técnica de dos pasadas. Primero, pide una respuesta; después, solicita al modelo que la critique y produzca una versión revisada.
La estructura del prompt:
Paso 1: [Tu pregunta original]
Paso 2: Revisa la respuesta anterior. Busca errores, debilidades o suposiciones que podrían no cumplirse. Sé muy crítico con tu trabajo.
Paso 3: Basado en tu crítica, produce una respuesta revisada.
La segunda pasada permite al modelo revisar una conclusión con la que ya se había comprometido. Al evaluar su trabajo desde otra perspectiva, puede detectar problemas omitidos en el primer intento.
Una variante más sofisticada es la autocrítica constitucional o basada en principios. Define los principios que debe satisfacer la respuesta y pide al modelo que la evalúe frente a cada uno.
Principios para una buena respuesta a este tipo de pregunta:
- Aborda la pregunta real, no una generalización de ella.
- Cita pruebas concretas en lugar de aludir vagamente a las fuentes.
- Reconoce explícitamente la incertidumbre cuando esté presente.
- Está calibrada: expresa seguridad en los puntos sólidos y cautela en los débiles.
Produce una respuesta. Evalúala frente a cada principio y, después, revísala.
Esta es la técnica detrás del trabajo de Constitutional AI de Anthropic y enfoques similares en la investigación moderna de alineación.
Cuándo usar autocrítica:
- Tareas de escritura donde quieres un segundo paso sin salir de la conversación.
- Trabajo analítico en el que el modelo puede mostrar un exceso de confianza.
- Apoyo a decisiones en el que quieres encontrar lagunas en el propio argumento del modelo.
- Código que necesita una revisión después de generarse.
Cuándo no merece la pena:
- Tareas sin una «respuesta correcta» hacia la que revisar (lluvia de ideas creativa o generación de ideas).
- Tareas donde preferirías hacer la crítica tú mismo (cualquier cosa donde tu juicio es el valor).
- Respuestas conversacionales rápidas donde el coste de latencia supera la ganancia de calidad.
Árbol de pensamientos (ToT)
La técnica más cara. En lugar de producir una sola cadena de razonamiento, el modelo considera explícitamente múltiples caminos, evalúa cada uno y selecciona el más prometedor.
Estructura de un ejemplo trabajado:
Paso 1: Genera tres enfoques diferentes para este problema.
Paso 2: Desarrolla los primeros pasos de cada enfoque sin comprometerte con una respuesta final.
Paso 3: Evalúa cuál enfoque es más probable que tenga éxito y por qué. Sé específico sobre fortalezas y debilidades.
Paso 4: Elige el mejor enfoque y completa la solución.
El árbol de pensamientos resulta útil cuando un problema admite varios enfoques plausibles y el primero no siempre es el mejor. La exploración en paralelo reduce el riesgo de quedar atrapado en una vía subóptima.
Ejemplo práctico — un prompt difícil:
Tengo una consulta SQL compleja que se ejecuta demasiado lentamente. Ayúdame a optimizarla.
Paso 1: Genera tres estrategias diferentes de optimización. Paso 2: Para cada una, identifica el cuello de botella que abordaría y su coste. Paso 3: Evalúa cuál puede ofrecer la mayor mejora con el menor riesgo. Paso 4: Implementa el enfoque elegido.
Obtendrás algo más elaborado que «aquí tienes una reescritura»: tres enfoques, una comparación, una recomendación y una implementación.
Cuándo usar árbol de pensamientos:
- Problemas con múltiples soluciones creíbles. Decisiones de arquitectura, elección de algoritmos, decisiones estratégicas.
- Problemas de optimización. El primer intento rara vez es el mejor.
- Tareas creativas donde la exploración es el objetivo. Nombrar, enmarcar, posicionar.
- Cualquier cosa donde sospechas que la respuesta obvia está equivocada.
Cuándo no merece la pena:
- Tareas con un único enfoque correcto. No pidas tres consultas SQL cuando basta una.
- Preguntas factuales sencillas. Es un esfuerzo innecesario.
- La mayoría de las tareas para modelos de razonamiento. Estos modelos ya realizan internamente una exploración similar.
Un árbol de decisión práctico
Cuando tienes un problema difícil frente a ti, la pregunta no es “¿debería usar CoT, autocrítica o ToT?”. Es “¿cuál es la forma del problema?”
- Problema lineal multietapa (aritmética, acertijo lógico, razonamiento estricto) → cadena de pensamiento.
- Problema donde el riesgo es la sobreconfianza (análisis, recomendación, código que debe revisarse) → autocrítica.
- Problema con varios enfoques plausibles (optimización, decisión estratégica, exploración creativa) → árbol de pensamientos.
- Tarea conversacional, sencilla o generativa → ninguna técnica. Evita el coste adicional.
También existe un metapatrón: utilizar CoT dentro de ToT y terminar con autocrítica. Explora tres vías con ToT, desarrolla cada una paso a paso con CoT y critica después la elegida. Puede resultar excesivo, pero es útil en los análisis más difíciles. El coste es mayor latencia y consumo de tokens; el beneficio potencial es una respuesta mejor.
Cómo cambian el balance los modelos de razonamiento
El mayor cambio desde 2024 ha sido el auge de modelos específicos de razonamiento: o1, o3, Claude Extended Thinking, DeepSeek R1 y Gemini 2.5 Thinking. Estos modelos realizan un proceso de razonamiento interno antes de responder, a menudo durante decenas de segundos o minutos.
Esto cambia la forma de redactar prompts en tres aspectos importantes:
1. Deja de añadir «piensa paso a paso». Los modelos de razonamiento ya realizan trabajo interno. La frase puede resultar redundante o perjudicial. Formula la pregunta directamente.
2. Deja que el modelo determine cuánto razonar. Ante una pregunta compleja, puede realizar un proceso interno extenso que no se muestra por completo. La contrapartida es la latencia; espera a que termine.
3. Utiliza prompts sencillos y directos. Los modelos de razonamiento suelen ser menos sensibles a la formulación que los modelos rápidos y pueden resolver cierta ambigüedad. Los prompts excesivamente elaborados —con mucho contexto impuesto, numerosas restricciones y plantillas rígidas— pueden empeorar el resultado. Prueba primero la versión sencilla.
Ejemplo trabajado. Compara estos dos prompts a un modelo de razonamiento:
Prompt A: «Piensa paso a paso sobre la pregunta siguiente. Primero, identifica las restricciones clave. Después, enumera las opciones, evalúa cada una frente a las restricciones y elige. Muestra el razonamiento en cada paso. Pregunta: ¿deberíamos adoptar una semana laboral de cuatro días?»
Prompt B: «¿Deberíamos adoptar una semana laboral de cuatro días? Contexto: empresa de 80 empleados que ofrece SaaS B2B; el equipo de atención al cliente trabaja de lunes a viernes».
En muchos modelos de razonamiento, el prompt B producirá una respuesta mejor. El modelo ya dispone de un proceso interno; el andamiaje explícito puede imponer restricciones poco útiles.
Con modelos rápidos puede ocurrir lo contrario: el andamiaje puede ayudarles a lograr una calidad comparable.
Este es el hecho más importante sobre ingeniería de prompts desde 2023: el mismo prompt que funciona mejor en un modelo rápido puede ser peor en un modelo de razonamiento, y viceversa.
Balance entre costes y beneficios
Todas las técnicas tienen costes. Este es un balance aproximado:
| Técnica | Coste de tokens | Coste de latencia | Mejora de calidad | Cuándo merece la pena |
|---|---|---|---|---|
| Cadena de pensamiento | ~2-3x | ~1.5-2x | 10-40% en problemas difíciles | Problemas multietapa con modelos rápidos |
| Autocrítica | ~2x | ~2x | 5-20% en general | Cuando la sobreconfianza es un riesgo real |
| Árbol de pensamiento | ~3-5x | ~2-3x | 10-30% en problemas con múltiples enfoques | Problemas difíciles con múltiples caminos |
| Modelo de razonamiento (integrado) | ~3-10x | ~5-30x | 30-100% en problemas difíciles | Cualquier cosa genuinamente difícil |
Para la mayoría de los usos ocasionales, basta un modelo rápido sin estas técnicas. En problemas difíciles, una técnica adecuada o un modelo de razonamiento puede justificar el coste adicional. En tareas triviales, estas opciones consumen tiempo y dinero sin aportar valor.
Regla práctica: antes de recurrir a una técnica, pregúntate si el coste de equivocarte justifica el coste adicional. Si la respuesta es sí, elige la adecuada; si no, envía el prompt sin más.
Ejemplo trabajado: una tarea difícil real
Supón que estás evaluando dos propuestas de proveedores y quieres una comparación calibrada.
Sin ninguna técnica (prompt básico):
Compara estas dos propuestas de proveedores [pegar]. ¿Cuál deberíamos elegir?
Obtendrás una respuesta prudente que puede servir como punto de partida, pero no bastará para decidir.
Con CoT:
Compara estas dos propuestas de proveedores. Piensa paso a paso:
- Enumera los criterios relevantes para nuestra decisión.
- Puntúa a cada proveedor en cada criterio.
- Identifica los criterios donde las puntuaciones divergen más.
- Luego, da tu recomendación.
Obtendrás un análisis mucho más estructurado. Cada paso será visible y podrás verificarlo o corregirlo.
Con autocrítica encima:
[mismo que arriba]
Después de tu recomendación, critica tu propio análisis:
- ¿Qué criterios podría haber ponderado mal?
- ¿Qué suposiciones hice sin fundamento suficiente?
- ¿Cuál es el argumento más creíble para el otro proveedor?
Luego, produce una recomendación revisada si es necesario.
La crítica detecta puntos ciegos en el primer análisis.
Con ToT:
Compara estas dos propuestas de proveedores.
Paso 1: Genera tres marcos diferentes de toma de decisiones para este tipo de elección (por ejemplo, minimización de riesgos, maximización de valor, alineación de capacidades). Paso 2: Aplica cada marco. Obtén tres recomendaciones. Paso 3: ¿Dónde coinciden los marcos? ¿Dónde divergen? Paso 4: Dadas nuestras restricciones reales, ¿qué marco es el más adecuado? Ofrece una recomendación final.
Obtendrás tres perspectivas; las diferencias entre ellas contienen la parte más interesante del análisis.
Con un modelo de razonamiento:
Compara estas dos propuestas de proveedores. ¿Cuál deberíamos elegir y por qué? Incluye las cosas que cambiarían tu respuesta.
El modelo de razonamiento realiza gran parte de ese trabajo internamente. El resultado puede ser comparable o superior al de un modelo rápido con un prompt muy elaborado, con un tiempo total parecido.
En 2026, para trabajo analítico genuinamente difícil, un modelo de razonamiento con un prompt limpio suele ser la mejor opción. CoT y ToT siguen siendo útiles con modelos rápidos, y la autocrítica sigue siendo útil como capa adicional independientemente del modelo subyacente.
Algunos hábitos prácticos
Registra la técnica utilizada. Anótala en el prompt para desarrollar intuición sobre qué funciona.
Compara resultados. Una vez por semana, ejecuta el mismo prompt difícil con y sin la técnica y observa las diferencias. Aprenderás cuándo compensa su coste.
No apiles técnicas sin criterio. Combinar CoT, autocrítica, ToT y un modelo de razonamiento rara vez supera a elegir bien una sola opción. Cada capa añade coste; incorpora únicamente las que mejoren la respuesta en tu tarea.
Guarda las técnicas en tu biblioteca. Mantén fragmentos para «con CoT», «con autocrítica» y «con ToT» que puedas aplicar a la tarea actual sin reescribir el andamiaje.
El mensaje clave
Tres técnicas, cada una con su ámbito. Cadena de pensamiento para problemas lineales de varios pasos; autocrítica para detectar exceso de confianza; árbol de pensamientos para problemas con varios enfoques. Los modelos de razonamiento cambian el balance al realizar internamente parte de ese trabajo, pero las técnicas siguen siendo útiles con modelos rápidos y como patrones adicionales.
Utiliza la opción adecuada para el problema y omítela cuando no justifique su coste. Interioriza la diferencia entre un «problema más difícil» y un «problema diferente»; lo demás se deriva de ella.



