latentSource

Modelos de razonamiento: Por qué pensar más tiempo genera mejores respuestas

Pensamiento extendido, test-time compute y chain-of-thought durante el entrenamiento: desglosamos cómo una nueva clase de modelos intercambia latencia por precisión.

·7 min read
Compartir
Modelos de razonamiento: Por qué pensar más tiempo genera mejores respuestas

Más rápido no siempre es mejor. A veces, la respuesta correcta requiere paciencia. Esa es la idea detrás de los reasoning models (modelos de razonamiento): una clase de LLMs que deliberadamente dedican más cómputo en el inference time para producir respuestas más exactas y confiables. El intercambio es directo: pagas con latencia y tokens, y recibes a cambio precisión.

Para entender por qué esto funciona, hay que analizar un par de capas sobre cómo los modelos de lenguaje generan texto realmente.

Cómo funcionan los LLMs estándar

Un modelo de lenguaje de gran escala convencional genera texto a través de la predicción autorregresiva. Dada una secuencia de tokens, predice el siguiente. Luego, añade ese token y predice el que sigue. Un forward pass a través de la red por cada token. Sin retrocesos, sin revisiones, sin segundas opiniones.

Esto es sorprendentemente efectivo para muchas tareas. El modelo tiene miles de millones de parámetros que codifican patrones de su dataset de entrenamiento, y un solo forward pass por esos parámetros puede producir texto fluido, coherente y a menudo correcto.

Pero hay una limitación real. La predicción de cada token recibe exactamente un forward pass de cómputo. Ya sea que el modelo esté respondiendo "¿De qué color es el cielo?" o "Demuestra que hay infinitos números primos", recibe el mismo presupuesto de cómputo por token. La dificultad de la pregunta no cambia cuánto "pensamiento" puede realizar el modelo.

Para tareas simples, eso está bien. Para razonamientos complejos de varios pasos, es un techo insuperable. El modelo tiene que codificar toda la ruta de la solución en un único flujo de predicciones de tokens, sin capacidad de explorar alternativas, verificar resultados intermedios o rectificar cuando una línea de razonamiento falla.

El concepto de test-time compute

Los modelos de razonamiento invierten esa restricción. En lugar de asignar un cómputo fijo por token, dedican un cómputo variable basado en la dificultad del problema. El mecanismo es muy sencillo: antes de producir la respuesta final, el modelo genera una cadena extendida de tokens de razonamiento. Esos tokens de "pensamiento" son el modelo trabajando en el problema, y más tokens de pensamiento significan más cómputo aplicado.

Esto es lo que los investigadores llaman test-time compute scaling. Así como escalar el cómputo de entrenamiento (más datos, más parámetros, más pasos de entrenamiento) mejora la capacidad del modelo, escalar el cómputo de inferencia mejora la calidad de las respuestas individuales.

El hallazgo interesante: el escalado de test-time compute tiene sus propias scaling laws. Duplicar el presupuesto de pensamiento no duplica la calidad, pero produce ganancias consistentes y medibles en problemas difíciles. Y las ganancias son mayores precisamente donde más importan: en problemas que requieren un razonamiento genuino de múltiples pasos.

Observa el mismo modelo, con y sin pensamiento

No hace falta que confíes solo en mi palabra. A continuación se muestran dos ejecuciones reales grabadas del mismo modelo (Gemini Flash) respondiendo al mismo acertijo: obtener 24 usando los números 2, 3, 10 y 10, cada uno usado exactamente una vez. La única diferencia entre las ejecuciones es un parámetro de la API: el presupuesto de pensamiento (thinking budget). Nada está simulado y no se llama a ningún LLM al presionar play; estás viendo grabaciones de ejecuciones reales a su ritmo real.

Mismo modelo, mismo acertijo, un parámetro cambiado. Con el pensamiento desactivado, el modelo responde en unos cuatro segundos: de forma fluida, segura y errónea (revisa su expresión y cuenta cuántos dieces utiliza). Con el pensamiento activado, expande el bloque de pensamiento y observa cómo prueba combinaciones, llega a callejones sin salida y retrocede antes de llegar a una respuesta válida. Tarda diez veces más. También es correcto.

Vale la pena detenerse en el modo de fallo de la primera ejecución. El modelo no dice algo disparatado; produce una expresión que realmente es igual a 24, pero violando una restricción que acababa de reafirmar. Esa es la esencia de la generación de un solo paso: no hay espacio para verificar resultados intermedios contra las reglas. La segunda ejecución gasta sus tokens extra haciendo precisamente esa verificación.

Entrenando el razonamiento en el modelo

Los modelos de razonamiento no surgen del pretraining estándar. No puedes simplemente pedirle a un modelo base que "piense más" y esperar una mejora sistemática. El comportamiento de razonamiento debe ser entrenado, generalmente a través de reinforcement learning.

El ciclo de entrenamiento se ve aproximadamente así:

Primero, generar candidatos de cadenas de razonamiento. Ante un problema con una respuesta conocida, el modelo produce múltiples intentos de razonamiento diferentes. Algunos llegan a la respuesta correcta. Otros no.

Luego, evaluar las cadenas. Aquí es donde entra la señal de recompensa, y hay dos enfoques principales. Los Outcome Reward Models (ORM) solo se fijan en la respuesta final: ¿llegó la cadena a la conclusión correcta? Es simple de implementar, pero la retroalimentación es escasa. Los Process Reward Models (PRM) evalúan cada paso de la cadena de forma independiente: ¿este paso se siguió lógicamente del anterior? Proporcionan una retroalimentación más densa y un razonamiento más confiable, pero se necesitan datos etiquetados paso a paso para entrenarlos.

Finalmente, actualizar el modelo. Usando las señales de recompensa, haces que los patrones de razonamiento exitosos sean más probables y los fallidos menos probables. Tras muchas iteraciones, el modelo aprende a producir cadenas de razonamiento que llegan de manera confiable a respuestas correctas.

Standard LLM:
  Input → [Forward Pass] → Output

Reasoning Model:
  Input → [Think] → [Think] → [Think] → ... → [Answer]
           ↑                                      ↑
      Variable compute                     Final response
      (reasoning tokens)                   (grounded in thinking)

El enfoque de RL es lo que separa a los modelos de razonamiento de un simple prompt de chain-of-thought. Cuando le pides a un modelo estándar que "piense paso a paso", le estás pidiendo que use un formato de razonamiento, pero el modelo no fue entrenado para razonar bien en ese formato. Un modelo de razonamiento fue optimizado explícitamente para producir cadenas de pensamiento que conduzcan a respuestas correctas.

Cómo se ven los tokens de pensamiento

El razonamiento interno de estos modelos es genuinamente interesante de leer. Ya has visto el ejemplo real; si expandes el bloque de pensamiento en la reproducción superior, verás al modelo enumerando expresiones candidatas y descartándolas. Aquí hay un ejemplo más limpio y simplificado del mismo comportamiento en un problema de lógica.

<thinking>
El problema me pide determinar si todos los cuadrados son rectángulos.

Permítanme recordar las definiciones:
- Un rectángulo tiene cuatro lados y cuatro ángulos rectos.
- Un cuadrado tiene cuatro lados iguales y cuatro ángulos rectos.

Por lo tanto, un cuadrado cumple con todas las condiciones de un rectángulo
(cuatro lados, cuatro ángulos rectos) más una restricción adicional
(todos los lados iguales).

Espera, debería verificar que esto no sea una pregunta con trampa. ¿Existen
marcos geométricos donde esta relación no se cumpla? En la geometría euclidiana
estándar, un cuadrado siempre es un caso especial de un rectángulo.
Esto es por definición.

Confío en la respuesta.
</thinking>

Sí, todos los cuadrados son rectángulos. Un cuadrado cumple con todos los requisitos
de un rectángulo (cuatro lados, cuatro ángulos rectos) con la restricción adicional
de que todos los lados tienen la misma longitud.

Observa la autocorrección ("Espera, debería verificar..."), la prueba de hipótesis ("¿Existen marcos geométricos...?") y la evaluación de confianza ("Confío en la respuesta"). Estos patrones surgen del proceso de entrenamiento por RL. El modelo aprendió que las cadenas que contienen estos comportamientos tienen más probabilidades de llegar a respuestas correctas.

En problemas más difíciles, las cadenas de pensamiento se vuelven más largas y complejas. Un problema de una competencia de matemáticas puede producir miles de tokens de pensamiento, con el modelo probando múltiples enfoques, llegando a callejones sin salida, retrocediendo y volviendo a intentar. Es costoso, y es drásticamente más efectivo que una respuesta de un solo paso.

¿En qué destacan los modelos de razonamiento?

Las mejoras de rendimiento de los modelos de razonamiento no son uniformes. Son mayores en áreas que requieren una lógica genuina de múltiples pasos.

Las matemáticas es donde más brillan. Los problemas que necesitan manipulaciones algebraicas encadenadas, análisis de casos o construcción de pruebas ven las mayores ganancias. En benchmarks de matemáticas de competición como AIME, los modelos de razonamiento obtienen puntuaciones 2 o 3 veces más altas que los modelos estándar de tamaño comparable.

La generación de código es el siguiente gran campo. Escribir código correcto suele significar razonar sobre casos de borde, flujo de datos y corrección algorítmica. Los modelos de razonamiento producen código que tiene más probabilidades de ser correcto al primer intento, especialmente en problemas algorítmicos.

El razonamiento científico también se beneficia mucho. Las preguntas de ciencia de nivel de posgrado que requieren la aplicación de múltiples conceptos en secuencia mejoran notablemente con el pensamiento extendido.

El instruction following complejo también mejora. Las tareas con múltiples restricciones ("escribe una función que haga X, maneje el caso de borde Y y se ejecute en tiempo O(n)") salen mejor porque el modelo puede verificar explícitamente cada restricción durante su fase de pensamiento.

Las desventajas

Los modelos de razonamiento no son una solución gratuita. Los costos son reales.

Latencia. Un modelo que genera 2,000 tokens de pensamiento antes de responder tarda significativamente más en contestar que uno que responde de inmediato. Para aplicaciones interactivas donde los usuarios esperan respuestas en menos de un segundo, esto puede ser un impedimento.

Costo de tokens. Los tokens de pensamiento no son gratuitos. Se pagan igual que los tokens de salida. Una respuesta que cuesta $0.01 con un modelo estándar podría costar $0.10 con un modelo de razonamiento que genere cadenas de pensamiento largas.

Verbosidad en el pensamiento. No todo el pensamiento es productivo. Los modelos de razonamiento a veces generan cadenas repetitivas o circulares, consumiendo tokens sin avanzar. Se está trabajando en solucionar esto.

Overhead en tareas simples. Si le pides a un modelo de razonamiento la capital de Francia, seguirá generando tokens de pensamiento. Serán cortos y el overhead será pequeño, pero sigue siendo un cómputo innecesario para una tarea que no lo requiere.

Cuándo NO usar modelos de razonamiento

Esta es la parte que se pasa por alto cuando la gente se entusiasma con el razonamiento. Hay casos claros donde estos modelos son la herramienta equivocada.

Búsquedas de hechos simples. Si la respuesta es un dato único que el modelo conoce o no, el pensamiento extendido añade latencia sin mejorar la precisión.

Escritura creativa. Los tokens de razonamiento optimizan la exactitud. Las tareas creativas se benefician de la fluidez, el estilo y la imprevisibilidad, no de la verificación sistemática.

Aplicaciones de alto rendimiento (high-throughput) y baja latencia. Chatbots, autocompletado, clasificación en tiempo real. Si necesitas procesar miles de solicitudes por segundo con una latencia mínima, los modelos de razonamiento son demasiado caros.

Tareas donde el modelo ya es casi perfecto. Si un modelo estándar ya alcanza el 99% de precisión en tu tarea específica, gastar 10 veces más cómputo en razonamiento no mejorará los resultados de manera significativa.

El enfoque correcto es usar modelos de razonamiento de manera selectiva, para tareas donde proporcionan mejoras significativas en la precisión, y usar modelos más rápidos y baratos para todo lo demás.

El futuro: pensamiento adaptativo

La dirección más interesante en los modelos de razonamiento no es hacer que piensen más, sino que piensen mejor. El razonamiento adaptativo, donde el modelo ajusta dinámicamente su presupuesto de pensamiento según la dificultad de la entrada, es el siguiente paso natural.

Imagina un modelo que recibe una pregunta, realiza una evaluación rápida de dificultad inicial y luego decide cuántos tokens de pensamiento asignar. Las preguntas fáciles reciben unos pocos tokens de verificación. Las preguntas difíciles reciben miles de tokens de razonamiento profundo. El costo promedio se mantiene razonable y los problemas más difíciles siguen recibiendo el cómputo que necesitan.

Los primeros trabajos en esta dirección parecen prometedores. Algunos enfoques entrenan un estimador de dificultad independiente que deriva las preguntas a diferentes presupuestos de pensamiento. Otros permiten que el propio modelo aprenda a terminar el pensamiento antes de tiempo cuando alcanza una confianza alta.

Este enfoque adaptativo es lo que hace que los modelos de razonamiento sean prácticos para una gama mucho más amplia de aplicaciones. En lugar de elegir entre "rápido y a veces equivocado" o "lento y generalmente correcto", obtienes un sistema que equilibra automáticamente el compromiso basado en cada entrada específica.

La trayectoria es bastante clara. La inteligencia se está convirtiendo en una variable que puedes subir o bajar según los requisitos de cada tarea. Ese es un paradigma diferente de los modelos de capacidad fija con los que hemos estado trabajando, y cambia la forma en que deberíamos pensar sobre la construcción de sistemas de IA.