Prompting y práctica · Lectura de 8 min

Pedirle a la IA que 'piense paso a paso' y por qué mejora sus respuestas

Un modelo apurado se equivoca en cuentas simples. Obligarlo a razonar en voz alta lo vuelve más certero. La razón es curiosa.

Le puse a un modelo una cuenta de escuela primaria: "Un tren lleva 17 pasajeros. En la primera parada bajan 8 y suben 5. En la segunda bajan 3 y suben 12. ¿Cuántos van al final?". Respondió, rápido y seguro: "22". La respuesta correcta es 23. No era un modelo tonto ni una cuenta difícil. Era un modelo apurado. Entonces borré todo y agregué cuatro palabras al final de la pregunta: "pensemos paso a paso". La misma máquina, sin cambiar nada más, escribió las cuatro restas y sumas en orden y llegó a 23.

Esa diferencia de un dígito esconde una de las ideas más útiles y más raras del prompting. Se llama chain of thought (cadena de pensamiento) y consiste en algo que suena casi a truco de niños: en lugar de pedirle al modelo la respuesta, le pides que muestre el camino. Lo curioso no es que funcione. Lo curioso es por qué.

01 · el caminoQué es chain of thought y por qué el modelo necesita el espacio

Empecemos por la respuesta directa. Chain of thought prompting es la técnica de pedirle a un modelo que escriba los pasos intermedios de su razonamiento antes de dar la respuesta final. En lugar de saltar del problema al resultado, el modelo despliega una cadena: primero esto, luego aquello, por lo tanto lo otro. La respuesta cae al final, como consecuencia del camino, no como un salto.

Para entender por qué eso ayuda hay que recordar cómo trabaja un modelo de lenguaje: no piensa y luego habla. Pensar y hablar son, para él, la misma acción. Genera una palabra, la agrega a lo que lleva escrito, y sobre ese texto ampliado genera la siguiente. Cada palabra que produce se convierte en piso para la próxima. No hay una pizarra secreta donde calcule aparte y después nos dicte el resultado limpio. El texto que ves es el cálculo.

El modelo no razona en privado y luego escribe. Escribir es la única forma que tiene de razonar.

Piénsalo como geometría. Ir del problema a la respuesta en un solo salto es trazar una recta entre dos puntos muy lejanos: cualquier temblor mínimo en el ángulo de salida te deja lejísimos del destino. En cambio, pedir pasos intermedios es poner puntos de apoyo en el trayecto. Cada paso corto es fácil de acertar, y cada uno corrige la puntería del siguiente. La cadena no hace al modelo más inteligente: le da lugares donde apoyar el pie.

Figura 1 · el salto largo frente a los pasos cortos
problema "22" (mal) un solo salto: un error temprano te desvía todo problema "23" (bien) pasos cortos: cada apoyo corrige la puntería del siguiente
La respuesta no cambió porque el modelo supiera más. Cambió porque le diste tramos cortos donde cada paso sostiene al que sigue. Un error en un salto largo arruina todo; un error en un tramo corto es más visible y más fácil de no cometer.

02 · el hallazgoLa frase de seis palabras que destrabó el razonamiento

Hasta 2022, la sabiduría común era que los modelos de lenguaje simplemente no servían para razonamiento de varios pasos: aritmética, acertijos de lógica, problemas con enunciado. Fallaban y ya. Dos trabajos casi simultáneos cambiaron esa idea, y lo hicieron sin tocar el modelo: solo cambiaron lo que le pedían.

El primero, de Jason Wei y colegas en Google, mostró que si en el prompt le das al modelo unos pocos ejemplos resueltos con sus pasos a la vista (no solo pregunta y respuesta, sino el razonamiento completo del medio), el modelo imita ese formato y empieza a resolver problemas nuevos también paso a paso. Su acierto en problemas de matemática de secundaria dio un salto grande, y el efecto crecía con el tamaño del modelo: en modelos pequeños casi no aparecía, en los grandes se volvía notable [1].

El segundo hallazgo fue todavía más desnudo. Takeshi Kojima y su equipo probaron algo casi provocador: no dar ningún ejemplo, solo agregar al final del problema la frase "Let's think step by step" (pensemos paso a paso). Sin ejemplos, sin entrenamiento extra, seis palabras. Y el acierto en varios problemas de razonamiento subió de forma marcada. Al modo cero-ejemplos lo llamaron zero-shot chain of thought [2].

Por qué una frase tan tonta funciona

El modelo aprendió de millones de textos humanos, y en esos textos, cuando alguien anuncia "pensemos paso a paso", lo que sigue casi siempre es una explicación ordenada y correcta. La frase no invoca magia: pone al modelo en el vecindario de texto donde vive el razonamiento cuidadoso, y desde ahí genera lo que corresponde a ese estilo. Le cambiaste la compañía, no el cerebro.

Conviene una advertencia honesta, porque acá se cuela mucho mito: la cadena de texto que el modelo escribe no es garantía de que "pensó" así por dentro. A veces la explicación suena impecable y la respuesta igual sale mal. Los pasos ayudan de verdad, los números lo confirman, pero son una herramienta para acertar más seguido, no una ventana transparente a su mente. Trátalos como andamio útil, no como confesión.

03 · la prácticaCómo pedirlo bien (y cuándo no molestarse)

La buena noticia es que aplicar esto no requiere nada técnico. Es cuestión de cómo redactas la pregunta. Tres formas, de menos a más esfuerzo.

La frase mágica. Al final de un problema de lógica, cuentas o varios pasos, agrega algo como "razona paso a paso antes de responder" o "explica tu razonamiento y luego da la respuesta". Es gratis y suele bastar para destrabar el error del salto largo.

El ejemplo resuelto. Si el problema tiene un formato repetido, muéstrale primero uno resuelto con todos sus pasos a la vista, y luego pídele el tuyo. El modelo copia la forma del razonamiento, no solo la del resultado. Esto es chain of thought con ejemplos, y es lo que midió el trabajo de Wei.

El orden explícito. Pídele que primero liste los datos, después el plan, después los cálculos, y al final (y solo al final) la respuesta. Forzar ese orden evita que dispare el resultado antes de tener sobre qué apoyarlo.

Figura 2 · dos prompts, dos resultados
Prompt A: "¿Cuántos pasajeros van al final? Responde solo el número." → 22 ✗
Prompt B: "Resuélvelo paso a paso: escribe cada parada y recién al final el total." → 17−8+5=14; 14−3+12=23 → 23 ✓
El mismo modelo, la misma cuenta. Lo único que cambió fue la instrucción: pedir el número seco versus pedir el camino. Los pasos intermedios le dieron dónde apoyar cada operación.

Ahora la letra chica, porque esto no es pólvora para todo. Pedir pasos gasta más: el modelo escribe más texto, así que la respuesta tarda más y, si pagas por uso, cuesta más tokens. Para preguntas simples (una definición, un dato, un sí o no), agregar "razona paso a paso" no mejora nada y solo infla la respuesta. La cadena de pensamiento brilla donde hay varios pasos encadenados: aritmética con enunciado, lógica, planificación, comparaciones con varias condiciones. Para lo demás, deja que conteste directo.

No le pidas el camino cuando el destino está al lado. Pídelo cuando el salto es largo.

Hay un detalle final que vale la pena guardar. Muchos de los modelos más nuevos, los llamados modelos de razonamiento, ya hacen esto solos: fueron entrenados para desplegar su cadena de pasos por dentro antes de contestar, sin que se lo pidas. En esos casos, escribir "paso a paso" es redundante. Pero entender la idea sigue sirviendo, porque explica qué están haciendo esos modelos cuando "se toman su tiempo": están poniendo puntos de apoyo entre tu pregunta y su respuesta, exactamente como el tren que, contado con calma, lleva 23.

Fuentes

  1. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q. & Zhou, D. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. Advances in Neural Information Processing Systems (NeurIPS) 35. arXiv:2201.11903.
  2. Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. & Iwasawa, Y. (2022). Large Language Models are Zero-Shot Reasoners. Advances in Neural Information Processing Systems (NeurIPS) 35. arXiv:2205.11916. (Origen de "Let's think step by step".)
  3. Nye, M., Andreassen, A. J., Gur-Ari, G., et al. (2021). Show Your Work: Scratchpads for Intermediate Computation with Language Models. arXiv:2112.00114. (Antecedente: escribir pasos intermedios mejora el cálculo.)

Aprende más sobre IA

Ver todo Aprende IA