latentSource

Destilación de modelos: comprimiendo inteligencia sin perderla

Los modelos grandes son potentes pero costosos. La destilación transfiere su conocimiento a modelos más pequeños, rápidos y económicos, y los resultados son sorprendentemente buenos.

·5 min read
Compartir
Destilación de modelos: comprimiendo inteligencia sin perderla

Los modelos más grandes del mundo se están convirtiendo en maestros para los más pequeños.

¿Qué es la destilación?

La destilación de conocimiento (knowledge distillation) entrena a un modelo "estudiante" pequeño para imitar a un modelo "maestro" grande. En lugar de entrenar al estudiante desde cero con datos brutos, se utilizan los outputs del maestro como señal de entrenamiento. El estudiante no solo aprende las respuestas correctas; capta la incertidumbre del maestro, sus preferencias y la forma en que pondera las alternativas.

La idea es bastante simple. La distribución de salida de un maestro sobre los posibles tokens contiene mucha más información que una etiqueta rígida (hard label). Cuando un maestro predice "París" para "La capital de Francia es ___" con un 92% de probabilidad, también está diciendo que "Lyon" obtuvo un 3%, "Marsella" un 1% y "Berlín" un 0.4%. Esos números codifican relaciones entre conceptos que una etiqueta one-hot descarta.

Esto es algo muy distinto a entrenar con un dataset de respuestas correctas. El dataset dice "París". El maestro dice "casi con certeza París, y así de seguro estoy sobre cada alternativa".

El framework original de Hinton

El paper de Geoffrey Hinton de 2015, "Distilling the Knowledge in a Neural Network", formalizó la idea. El mecanismo es el escalamiento de temperatura en la salida softmax — una temperatura TT en el denominador del exponente:

pi=exp(zi/T)jexp(zj/T)p_i = \frac{{\exp(z_i / T)}}{{\sum_j \exp(z_j / T)}}
# Standard softmax (temperature = 1) softmax(logits) # Sharp distribution — mostly probability on top-1 # Softened softmax (temperature = T, e.g. T=4) softmax(logits / T) # Flatter distribution — reveals teacher's "dark knowledge"

A temperaturas más altas, la distribución se aplana y se empiezan a notar las preferencias sutiles del maestro entre los outputs de menor rango. Hinton llamó a esto "conocimiento oscuro" (dark knowledge): información sobre cómo están estructurados los datos que reside dentro del maestro pero que nunca llega a las etiquetas rígidas.

La pérdida de entrenamiento (training loss) del estudiante combina dos términos:

loss = alpha * cross_entropy(student_output, hard_labels) \ + (1 - alpha) * kl_divergence( softmax(student_logits / T), softmax(teacher_logits / T) ) * (T ** 2)

Escrito formalmente, siendo pSTp_S^{{T}} y pTTp_T^{{T}} las distribuciones suavizadas por temperatura del estudiante y del maestro:

L=αLCE(y,pS)  +  (1α)T2KL ⁣(pTTpST)\mathcal{{L}} = \alpha \, \mathcal{{L}}_{{\text{{CE}}}}(y,\, p_S) \;+\; (1-\alpha)\, T^2 \, \mathrm{{KL}}\!\left(p_T^{{T}} \,\|\, p_S^{{T}}\right)

El primer término mantiene al estudiante anclado a las respuestas correctas reales. El segundo término transfiere el conocimiento distribucional del maestro. El factor T2T^2 compensa el hecho de que los gradientes se reducen a temperaturas más altas; suavizar por TT escala los gradientes por 1/T21/T^2, por lo que multiplicar la pérdida por T2T^2 mantiene ambos términos equilibrados.

Destilación de LLM moderna

La destilación para grandes modelos de lenguaje (LLM) ha avanzado mucho más allá de la configuración original de Hinton. En la práctica actual, se presentan tres enfoques.

Destilación de salidas (Output distillation)

El estudiante se entrena con las distribuciones de probabilidad a nivel de token del maestro. Para cada entrada, el maestro emite una distribución completa sobre el vocabulario en cada posición, y el estudiante aprende a igualarla.

Este es el enfoque más limpio, pero requiere acceso a los logits del maestro, lo cual no siempre es posible. Los modelos que solo ofrecen API, como GPT-4 o Claude, no exponen sus probabilidades. Cuando los logits no están disponibles, aún se puede destilar a partir del texto generado, pero se pierde la información de las etiquetas suaves que hace que la técnica sea tan efectiva en primer lugar.

Destilación de características (Feature distillation)

El estudiante aprende a igualar las representaciones internas del maestro: estados ocultos (hidden states) de capas intermedias, patrones de atención u otras activaciones. Esto aporta información más rica que la destilación solo de salidas, porque las representaciones intermedias capturan cómo el modelo procesa la información, no solo lo que concluye.

# Simplified feature distillation for layer_s, layer_t in zip(student.layers, teacher.selected_layers): # Project student features to teacher's dimension if needed projected = projection_layer(layer_s.output) feature_loss += mse_loss(projected, layer_t.output)

Se requiere compatibilidad arquitectónica (o capas de proyección) y acceso de "caja blanca" (white-box) al maestro. En la práctica, esto suele hacerse cuando ambos modelos pertenecen a la misma familia.

Destilación a nivel de secuencia (Sequence-level distillation)

El maestro genera trazas de razonamiento completas o secuencias de chain-of-thought, y el estudiante se ajusta (fine-tuning) con esos resultados. El estudiante no aprende la distribución de probabilidad del maestro, sino que aprende a reproducir su proceso de razonamiento.

Esta es la forma más accesible en la práctica porque solo necesita la salida de texto del maestro, no sus estados internos. También es el enfoque detrás de algunos de los resultados recientes más impresionantes.

¿Por qué funciona tan bien?

La efectividad radica en la densidad de información de las etiquetas suaves frente a las etiquetas rígidas.

Tomemos una tarea de clasificación de sentimiento con un ejemplo sutil. La etiqueta rígida dice "positivo". Pero la distribución suave del maestro dice "73% positivo, 22% neutral, 5% negativo". Esa señal del 22% neutral le indica al estudiante que este es un caso fronterizo. Al entrenar con muchos casos así, el estudiante comienza a aprender dónde se encuentran realmente los límites de decisión, no solo de qué lado del límite cae cada ejemplo.

Para los modelos de lenguaje, la misma lógica se extiende a cada predicción de token. La distribución del maestro sobre los tokens del vocabulario codifica sinónimos, preferencias estilísticas, convenciones del dominio e incertidumbre. Un estudiante entrenado en esas distribuciones desarrolla una capacidad de generación más matizada que uno entrenado con etiquetas one-hot de un dataset.

Resultados en el mundo real

La evidencia de que la destilación funciona a escala es indiscutible.

El modelo Phi-3-mini de Microsoft (3.8B de parámetros) iguala o supera a GPT-3.5 Turbo en muchos benchmarks. No fue destilación pura —la generación de datos sintéticos por modelos más grandes y la curación cuidadosa de datos hicieron gran parte del trabajo— pero el principio es el mismo: un modelo pequeño entrenado con señales de alta calidad de modelos más grandes.

Las variantes destiladas de DeepSeek R1 son quizás el ejemplo más claro. DeepSeek tomó su modelo de razonamiento R1 y lo destiló en modelos más pequeños de varios tamaños:

  • DeepSeek-R1-Distill-Qwen-1.5B
  • DeepSeek-R1-Distill-Qwen-7B
  • DeepSeek-R1-Distill-Qwen-14B
  • DeepSeek-R1-Distill-Qwen-32B
  • DeepSeek-R1-Distill-Llama-8B
  • DeepSeek-R1-Distill-Llama-70B

La variante destilada de 32B funciona de manera asombrosamente cercana al modelo R1 completo en benchmarks de razonamiento. La destilación preservó específicamente el comportamiento de chain-of-thought: el estudiante aprendió no solo las respuestas del maestro, sino su proceso de razonamiento paso a paso.

Los modelos Gemma de Google se apoyan en la destilación de modelos Gemini más grandes, lo cual es una razón clave por la que rinden muy por encima de lo esperado para su tamaño.

Las limitaciones

La destilación no es magia.

El estudiante no puede superar al maestro. El techo de un modelo destilado es la capacidad del maestro. Si el maestro se equivoca en una pregunta, es probable que el estudiante también lo haga, o peor aún, que se equivoque de una manera correlacionada que sea más difícil de detectar.

La calidad depende de la cobertura de los datos. La destilación funciona mejor cuando los datos de entrenamiento cubren la distribución que el estudiante verá en producción. Un estudiante destilado en textos en inglés no manejará bien el japonés, incluso si el maestro pudiera hacerlo.

El razonamiento complejo se comprime con pérdida (lossy). Las tareas fácticas simples se destilan limpiamente. El razonamiento de múltiples pasos, la resolución de problemas matemáticos y las tareas que requieren un conocimiento profundo del mundo pierden más durante la compresión. El estudiante aprende la forma del razonamiento, pero no siempre desarrolla la profundidad del maestro.

La evaluación es complicada. El rendimiento en los benchmarks puede ser engañoso. Un modelo destilado puede igualar al maestro en benchmarks estándar y luego desmoronarse ante casos de borde o cambios en la distribución que el maestro maneja sin problemas. La evaluación en producción con su caso de uso real es innegociable.

La perspectiva de producción

Los modelos destilados son los caballos de batalla de la IA implementada. La economía es contundente:

MétricaMaestro (70B)Estudiante destilado (7B)
Costo de inferencia~10x~1x
Latencia (TTFT)~2s~200ms
Memoria~140GB FP16~14GB FP16
Calidad100% (base)85-95% en la mayoría de las tareas

Para la mayoría de los casos de uso en producción, una calidad del 85-95% al 10% del costo es el balance adecuado. Se implementa el modelo destilado para la mayoría de las solicitudes y se envían solo las consultas más difíciles al modelo más grande.

# Production pattern: routing by complexity if estimated_complexity(query) > THRESHOLD: response = large_model.generate(query) # 5% of traffic else: response = distilled_model.generate(query) # 95% of traffic

El futuro del despliegue de IA no consiste en ejecutar el modelo más grande posible. Consiste en ejecutar el modelo más pequeño que sea lo suficientemente bueno para cada tarea, y la destilación es la forma en que se construyen esos modelos.