latentSource

Leyes de escala de los LLM

Comprende las leyes de potencia que rigen el rendimiento de la IA: por qué los modelos más grandes y un mayor cómputo generan consistentemente mejores resultados.

·5 min read
Compartir
Leyes de escala de los LLM

Leyes de escala de los LLM

Uno de los descubrimientos más trascendentales en la investigación moderna de la IA es que el rendimiento de los modelos de lenguaje sigue leyes de potencia sorprendentemente predecibles. Si se obtienen las variables adecuadas —presupuesto de cómputo, tamaño del dataset, recuento de parámetros—, se puede pronosticar la loss de un modelo con una precisión razonable antes de gastar una sola hora de GPU. Estas leyes han rediseñado la forma en que los laboratorios asignan presupuestos de entrenamiento de miles de millones de dólares y tienen una influencia real en el rumbo que tomará el campo a continuación.

Las leyes de escala originales: Kaplan et al. (2020)

La historia comienza con un paper de OpenAI de 2020 realizado por Kaplan, McCandlish, Henighan y otros. Entrenaron modelos de lenguaje desde decenas de miles hasta miles de millones de parámetros y descubrieron que la pérdida de prueba (test loss, en nats) sigue una ley de potencia en tres variables:

  • N — número de parámetros del modelo (excluyendo los embeddings)
  • D — tamaño del dataset de entrenamiento (en tokens)
  • C — cómputo utilizado para el entrenamiento (en FLOPs)

Las relaciones:

L(N)N0.076L(D)D0.095L(C)C0.050L(N) \propto N^{{-0.076}} \qquad L(D) \propto D^{{-0.095}} \qquad L(C) \propto C^{{-0.050}}

En términos sencillos: cada aumento de 10x en el compute reduce la loss en una cantidad fija y predecible. Las curvas son suaves, abarcan múltiples órdenes de magnitud y no mostraron signos de estancamiento en los rangos probados.

Una conclusión importante de Kaplan fue que el tamaño del modelo importa más que el tamaño de los datos. Su análisis indicaba que, para un presupuesto de cómputo fijo, se deberían escalar los parámetros de forma agresiva y entrenar con relativamente menos datos. Concretamente: si multiplicas por 10 tu compute, aumenta el tamaño del modelo aproximadamente 5.5x y aumenta los tokens de entrenamiento unas 1.8x.

Ese hallazgo influyó directamente en GPT-3 (175B de parámetros, ~300B de tokens) e inició la era de "más grande es mejor".

Chinchilla lo reescribe: Hoffmann et al. (2022)

Dos años más tarde, Hoffmann et al., de DeepMind, publicaron el paper de Chinchilla, que revisó fundamentalmente la división óptima entre parámetros y datos.

Entrenaron más de 400 modelos desde 70M hasta 16B de parámetros con distintas cantidades de datos y descubrieron que los modelos de Kaplan estaban subentrenados (undertrained). La estrategia compute-optimal consiste en escalar los parámetros y los tokens de entrenamiento en una proporción aproximadamente igual.

Su regla general revisada: los tokens de entrenamiento deben ser aproximadamente 20 veces el número de parámetros.

ModeloParámetrosTokens óptimos (Kaplan)Tokens óptimos (Chinchilla)
1B1B~25B~20B
10B10B~45B~200B
70B70B~80B~1.4T
175B175B~130B~3.5T
Invalid viz:graph block: expected JSON like {"name":"my_graph"}.

Tokens de entrenamiento óptimos para el cómputo según la receta de la ley de escala. El eje Y es logarítmico; con 175B de parámetros, Chinchilla exige 27 veces más datos de entrenamiento que Kaplan, razón por la cual GPT-3 parece drásticamente subentrenado en retrospectiva.

La brecha es enorme a grandes escalas. Según los cálculos de Chinchilla, GPT-3 estaba severamente subentrenado; debería haber visto aproximadamente 3.5 billones de tokens en lugar de 300 mil millones. DeepMind lo demostró al entrenar a Chinchilla (70B de parámetros, 1.4T de tokens) para superar al mucho más grande Gopher (280B de parámetros, 300B de tokens) con el mismo presupuesto de cómputo.

Por qué el desacuerdo

Los dos equipos llegaron a conclusiones diferentes principalmente debido a la metodología:

  • Esquemas de tasa de aprendizaje (Learning rate schedules): Kaplan utilizó un esquema de coseno fijo en todas las ejecuciones. Chinchilla ajustó por ejecución, lo cual es importante porque los modelos más pequeños con más datos se benefician de warmups más largos.
  • Asignación del presupuesto de entrenamiento: Kaplan ejecutó muchos modelos hasta una convergencia parcial. Chinchilla varió ambos ejes (parámetros y tokens) a través de la matriz completa.
  • Parámetros de embedding: Kaplan los excluyó de N. Chinchilla los incluyó, lo que desplaza la curva para los modelos más pequeños.

El consenso actual se inclina hacia Chinchilla, aunque todavía se discuten los exponentes precisos. Los modelos LLaMA de Meta (2023-2024) fueron entrenados explícitamente en el régimen "Chinchilla-optimal" o incluso en sobreentrenamiento: LLaMA 7B se entrenó con 1T de tokens, muy por encima de su punto óptimo de cómputo, porque el costo de inferencia escala con el recuento de parámetros, no con los tokens de entrenamiento.

El entrenamiento compute-optimal en la práctica

La versión práctica es un problema de optimización. Para un presupuesto de cómputo fijo, hay que encontrar el par de parámetros/tokens que minimice la loss. Dos aproximaciones hacen el trabajo pesado: el cómputo de entrenamiento de un transformer es de aproximadamente C6NDC \approx 6ND FLOPs, y el presupuesto de datos óptimo según Chinchilla es de D20ND \approx 20N tokens. Al sustituir uno en el otro, se obtiene toda la receta:

# Cálculo simplificado de cómputo óptimo # C ≈ 6 * N * D (FLOPs aproximados para un forward+backward pass de un transformer) # Chinchilla óptimo: D ≈ 20 * N def compute_optimal_config(flops_budget): # A partir de C = 6 * N * D y D = 20 * N: # C = 6 * N * 20 * N = 120 * N^2 N = (flops_budget / 120) ** 0.5 D = 20 * N return int(N), int(D) # Ejemplo: Presupuesto de 1e24 FLOPs params, tokens = compute_optimal_config(1e24) # params ≈ 2.9B, tokens ≈ 57B

En realidad, los laboratorios a menudo se desvían del óptimo de cómputo a propósito. Sobreentrenar un modelo más pequeño es común cuando importa la eficiencia de la inferencia: el entrenamiento es un costo único, mientras que la inferencia ocurre millones de veces. Es por eso que LLaMA 3 8B fue entrenado con 15T de tokens, aproximadamente 40 veces más allá del óptimo de Chinchilla.

Más allá de la pérdida: capacidades emergentes

Las leyes de escala predicen una mejora suave en la pérdida de entropía cruzada (cross-entropy loss). El comportamiento de los modelos en el mundo real es menos fluido. Investigaciones de Google y otros han documentado capacidades emergentes: habilidades que aparecen de repente cuando los modelos cruzan ciertos umbrales de escala.

Aritmética few-shot, razonamiento chain-of-thought y deducción lógica de múltiples pasos parecen "activarse" en escalas particulares en lugar de mejorar gradualmente. Eso hace que las leyes de escala sean necesarias pero no suficientes para predecir lo que un modelo puede hacer realmente. La loss es continua. La utilidad es, a menudo, una función escalonada.

Lo que las leyes de escala predicen para el futuro

Si las leyes de potencia actuales se mantienen, se deducen varias cosas:

  1. Los muros de datos (data walls) son reales. El texto de alta calidad en el internet público se estima entre 5 y 15 billones de tokens. Los modelos ya están alcanzando ese techo, lo que impulsa el interés en los datos sintéticos y el entrenamiento multimodal.

  2. Los requisitos de cómputo siguen creciendo. Reducir a la mitad la loss de los modelos de frontera actuales requeriría aproximadamente 1000 veces más cómputo, razón por la cual los laboratorios están invirtiendo en clusters de más de 100,000 GPUs.

  3. Aparecen los rendimientos decrecientes. Los exponentes de las leyes de potencia son menores que 1, por lo que cada mejora sucesiva cuesta desproporcionadamente más. Pasar de la calidad de GPT-3 a la de GPT-4 requirió entre 10 y 100 veces más cómputo. El próximo salto equivalente costará aún más.

  4. Las mejoras en la arquitectura pueden desplazar la curva. Las leyes de escala describen una familia de arquitecturas determinada. Innovaciones como mixture-of-experts, modelos de espacio de estados (state-space models) o mejores mecanismos de atención pueden desplazar toda la curva, alcanzando la misma loss con menos cómputo.

Las leyes de escala trasladaron el entrenamiento de IA del arte hacia la ingeniería. No te dicen todo —nada sobre alineación, seguridad o qué capacidades emergerán—, pero te brindan una lente útil para razonar sobre la economía y la trayectoria del desarrollo de la IA. Si estás tomando decisiones sobre el entrenamiento de modelos, el gasto en infraestructura o la dirección de un producto de IA, necesitas conocerlas.