latentSource

DeepSeek R1 y la revolución del razonamiento open-source

Un laboratorio chino lanzó un modelo de razonamiento que igualó a OpenAI o1 a una fracción del costo, y luego lo liberó como open-source. He aquí por qué esto es sumamente importante.

·6 min read
Compartir
DeepSeek R1 y la revolución del razonamiento open-source

Cuando DeepSeek lanzó R1, la industria de la AI vivió uno de esos raros momentos en los que todos tuvieron que recalibrar al mismo tiempo. Un laboratorio que trabaja bajo las restricciones de exportación de chips de EE. UU. había producido un modelo de razonamiento que competía cara a cara con o1 de OpenAI en matemáticas, código y lógica de múltiples pasos. Luego, liberaron los weights. El impacto técnico, económico y geopolítico golpeó de forma simultánea.

Qué es R1 en realidad

DeepSeek R1 es un large language model entrenado específicamente para un razonamiento extendido. Los modelos estándar con instruction-tuning generan respuestas en una sola pasada. R1 produce una chain of thought interna antes de comprometerse con una respuesta. Piensa en voz alta, resuelve problemas paso a paso, se autocorrige y considera múltiples enfoques antes de responder.

Esto no es prompt engineering. El comportamiento de razonamiento está integrado mediante reinforcement learning. R1 no razona porque se le haya pedido que piense paso a paso. Razona porque así fue entrenado para operar.

La base es una arquitectura mixture-of-experts (MoE) con 671 mil millones de parámetros totales, de los cuales aproximadamente 37 mil millones están activos durante cualquier forward pass. Es una elección de diseño deliberada. MoE le otorga al modelo una capacidad de conocimiento masiva manteniendo el costo de inferencia manejable, ya que solo una fracción de los parámetros se activa por token.

El impacto de los benchmarks

Cuando se publicaron los benchmarks, captaron toda la atención.

BenchmarkDeepSeek R1OpenAI o1
AIME 2024 (Math)79.8%79.2%
MATH-50097.3%96.4%
Codeforces (Competitive Programming)96.3 percentile96.6 percentile
GPQA Diamond (Graduate Science)71.5%75.7%
SWE-bench Verified49.2%48.9%
Invalid viz:graph block: expected JSON like {"name":"my_graph"}.

DeepSeek R1 frente a OpenAI o1 en cinco benchmarks de razonamiento. Codeforces se reporta como percentil; el resto es % de precisión. Las barras están tan juntas que la paridad es la protagonista del gráfico.

Casi paridad. R1 lleva la delantera en algunos, o1 mantiene la ventaja en otros. La historia no se trata de quién ganó qué benchmark. Se trata de que una brecha que todos suponían que tardaría años en cerrarse, se cerró en meses.

La pregunta de los 6 millones de dólares

DeepSeek afirmó que el entrenamiento de R1 costó aproximadamente 6 millones de dólares. Para ponerlo en contexto, se estima que el costo de GPT-4 superó los 100 millones de dólares. Incluso aceptando que R1 se basa en la infraestructura del modelo base existente de DeepSeek, esa cifra es impactante.

Algunos factores lo hicieron posible.

Eficiencia de MoE. Entrenar un modelo MoE es más barato por parámetro efectivo que un modelo denso de capacidad equivalente. Se obtiene más capacidad de conocimiento por FLOP.

RL aplicado al razonamiento. En lugar de entrenar la capacidad de razonamiento desde cero mediante un pretraining masivo, DeepSeek utilizó RL para enseñar a razonar a un modelo base que ya era capaz. Esto es mucho más económico que escalar el cómputo de pretraining.

Innovación algorítmica bajo restricciones. Los controles de exportación de EE. UU. limitaron el acceso de DeepSeek a los últimos chips de NVIDIA, lo que obligó al equipo a exprimir más el hardware disponible mediante mejores algoritmos, recetas de entrenamiento más eficientes e ingeniería inteligente. Las restricciones le hicieron un favor al equipo.

La cifra de 6 millones de dólares debe tomarse con las precauciones habituales. Probablemente no incluye el costo de entrenar el modelo base, el costo de experimentos fallidos o los salarios de los investigadores. Sin embargo, incluso con ajustes generosos, el total es una fracción de lo que los laboratorios occidentales gastaron en capacidades comparables.

Cómo lo hicieron: GRPO y la receta de entrenamiento

La receta técnica detrás de R1 es una de las partes más interesantes del lanzamiento. DeepSeek introdujo Group Relative Policy Optimization (GRPO), un algoritmo de reinforcement learning que entrena al modelo para producir mejores cadenas de razonamiento.

La idea central: ante un problema, generar múltiples cadenas de razonamiento candidatas. Calificar cada una según si llega a la respuesta correcta. Luego, actualizar el modelo para aumentar la probabilidad de las cadenas que funcionaron y disminuir la de las que no. La parte de "group relative" significa que las recompensas se normalizan dentro de cada lote (batch), lo que elimina la necesidad de un modelo de valor separado y reduce la complejidad del entrenamiento.

# Intuición simplificada de GRPO for problem in training_set: # Generar K cadenas de razonamiento candidatas chains = [model.generate(problem) for _ in range(K)] # Calificar cada cadena: ¿llegó a la respuesta correcta? rewards = [score(chain, problem.answer) for chain in chains] # Normalizar las recompensas dentro del grupo normalized = (rewards - mean(rewards)) / std(rewards) # Actualizar el modelo: potenciar cadenas buenas, penalizar las malas model.update(chains, normalized)

Esto es elegante porque evita la complejidad de entrenar un reward model separado. La señal de recompensa es simple y verificable: ¿produjo la cadena de razonamiento la respuesta correcta? Esto funciona particularmente bien para matemáticas, código y lógica, donde la exactitud es objetiva.

DeepSeek también utilizó destilación (distillation) de sus modelos más grandes para crear variantes más pequeñas y eficientes. La serie DeepSeek-R1-Distill toma los patrones de razonamiento aprendidos por el modelo completo y los comprime en arquitecturas más pequeñas basadas en Qwen y Llama. Así es como se obtiene capacidad de razonamiento en hardware de consumo.

Por qué los pesos abiertos cambian todo

DeepSeek lanzó R1 con open weights bajo una licencia permisiva. Las consecuencias caen en cascada.

Reproducibilidad. Los investigadores pueden estudiar el modelo, sondear sus patrones de razonamiento, identificar modos de falla y publicar hallazgos. Nada de esto es posible con modelos cerrados donde solo se tiene acceso vía API.

Fine-tuning. Las organizaciones pueden tomar R1 y adaptarlo a sus dominios. Una firma legal lo ajusta con jurisprudencia. Una empresa de biotecnología lo ajusta con biología molecular. La capacidad de razonamiento base se transfiere; el conocimiento del dominio se añade encima.

Despliegue on-premise. Las empresas con requisitos de sensibilidad de datos (que son muchas) pueden ejecutar R1 internamente sin enviar datos a una API externa. Esto no es una preocupación de nicho. Es un requisito estricto para cargas de trabajo en salud, finanzas, defensa y gobierno.

Sin dependencia de API. Los modelos cerrados pueden cambiar precios, modificar comportamientos o dar de baja versiones cuando el proveedor lo desee. Los open weights te dan un artefacto estable y versionado que realmente controlas.

Aceleración comunitaria. A las pocas semanas del lanzamiento de R1, la comunidad de código abierto ya había producido versiones cuantizadas que se ejecutan en una sola GPU, modelos combinados (merged) que unen el razonamiento de R1 con las fortalezas de otros modelos, y variantes con fine-tuning para tareas específicas.

La dimensión geopolítica

Es imposible hablar de DeepSeek sin el contexto geopolítico. Los controles de exportación de EE. UU. fueron diseñados, en parte, para frenar el desarrollo de la AI en China restringiendo el acceso a chips avanzados. El éxito de DeepSeek sugiere que esos controles tuvieron un efecto secundario no deseado: empujaron a los laboratorios chinos hacia la eficiencia algorítmica en lugar del escalado por fuerza bruta.

Esa no es la imagen completa. DeepSeek tuvo acceso a un cómputo significativo, probablemente incluyendo hardware previo al embargo. Y los controles bien podrían haber frenado el desarrollo en otras áreas. Pero la idea de que las restricciones de cómputo por sí solas podrían mantener una brecha de capacidad duradera sufrió un golpe real.

Vale la pena observar la dinámica más amplia. Si la innovación algorítmica puede compensar la desventaja de hardware, el panorama global de la AI se vuelve más competitivo, no menos. Esto tiene implicaciones para las políticas, la inversión y la forma a largo plazo de la industria.

Modelos destilados: razonamiento en hardware de consumo

La parte más significativa desde el punto de vista práctico del lanzamiento de R1 es la familia de modelos destilados. DeepSeek-R1-Distill-Qwen-32B y DeepSeek-R1-Distill-Llama-70B llevan la capacidad de razonamiento al hardware que las personas reales y las pequeñas empresas poseen actualmente.

La variante Qwen de 32B, en particular, se ejecuta cómodamente en una sola GPU de consumo de gama alta con cuantización de 4 bits. No iguala al R1 completo en los benchmarks más difíciles, pero en la gran mayoría de las tareas de razonamiento prácticas se desempeña sorprendentemente bien.

# Ejecutando el modelo destilado localmente con Ollama ollama run deepseek-r1:32b # O con llama.cpp para mayor control ./llama-server -m deepseek-r1-distill-qwen-32b-Q4_K_M.gguf \ --ctx-size 32768 \ --n-gpu-layers 99

Esta es la verdadera historia. Cuando un estudiante de posgrado con una sola GPU puede ejecutar un modelo que razona a un nivel cercano a la frontera en sus problemas de investigación específicos, la dinámica de la investigación en AI cambia.

Qué sigue

R1 no es el final de la historia del razonamiento open-source. Es la prueba de concepto. La receta de entrenamiento es pública. Las innovaciones algorítmicas están documentadas. Otros laboratorios y grupos de investigación ya están construyendo sobre este trabajo.

La implicación para la industria: la capacidad de razonamiento ya no es un foso (moat). Es un commodity en formación. La competencia se desplazará hacia lo que construyas sobre el razonamiento, cómo lo integres en los productos y con qué eficiencia puedas desplegarlo a escala.

Para los profesionales, el mensaje es igual de claro. Deberían estar evaluando modelos de razonamiento abiertos para sus casos de uso ahora mismo. El rendimiento está ahí. La ventaja de costo es real. Y ejecutar modelos en su propia infraestructura, con sus propios datos y bajo su propio control vale más de lo que la mayoría de la gente se da cuenta hasta que lo necesita.