El costo de la inteligencia
Cuando OpenAI lanzó la API de GPT-3 en marzo de 2020, el precio por token significaba que solo las startups bien financiadas podían permitirse experimentar. Cinco años después, generar un millón de tokens cuesta aproximadamente una milésima parte de lo que costaba entonces. La tendencia no se está frenando y, si estás construyendo algo sobre estos modelos, la curva importa más que los benchmarks principales.
Una breve historia de precios
Los precios de inferencia han bajado de manera bastante consistente:
| Modelo | Fecha | Entrada (por 1M tokens) | Salida (por 1M tokens) |
|---|---|---|---|
| GPT-3 (davinci) | Jun 2020 | $60.00 | $60.00 |
| GPT-3.5 Turbo | Mar 2023 | $2.00 | $2.00 |
| GPT-4 | Mar 2023 | $30.00 | $60.00 |
| GPT-4 Turbo | Nov 2023 | $10.00 | $30.00 |
| GPT-4o | May 2024 | $5.00 | $15.00 |
| GPT-4o mini | Jul 2024 | $0.15 | $0.60 |
| Gemini 1.5 Flash | May 2024 | $0.075 | $0.30 |
| Gemini 2.0 Flash | Feb 2025 | $0.10 | $0.40 |
| DeepSeek V3 | Dic 2024 | $0.27 | $1.10 |
| Llama 3.1 405B (hosted) | Jul 2024 | $0.80 | $0.80 |
Precios por millón de tokens en los principales modelos, 2020–2025. El eje Y es logarítmico: tres órdenes de magnitud separan a GPT-3 (2020) de Gemini 1.5 Flash (2024). Pasa el cursor sobre cualquier punto para ver el modelo y el precio exacto.
El patrón es el mismo en cada ciclo. Un nuevo frontier model se lanza con un precio premium; luego, en unos pocos meses, llega una variante más barata con un costo entre 10 y 100 veces menor. El nivel "suficientemente bueno" sigue volviéndose más barato y mejor al mismo tiempo, que es la parte en la que la mayoría de las proyecciones de costos todavía se equivocan.
Qué está impulsando realmente la caída
No es una sola cosa. El colapso de los precios es el efecto compuesto de mejoras acumuladas en el pipeline de inferencia, y realmente hay que analizar cada capa por separado para entender por qué la curva tiene esa forma.
Hardware
Cada generación de GPU ofrece aproximadamente entre 2 y 3 veces más throughput de inferencia por dólar. La H100 ofrece cerca de 3 veces la inferencia de transformers que la A100 con un consumo de energía similar, y la B200 lleva esto aún más lejos. El silicio personalizado (custom silicon) está funcionando aún mejor en regímenes específicos: el TPU v5e de Google y el Trainium2 de Amazon están diseñados para una inferencia de alto throughput en lugar del rol general de entrenamiento e inferencia que desempeñan las GPU y, para arquitecturas específicas, a menudo superan a NVIDIA en costo por token.
Cuantización
La inferencia de precisión completa FP32 prácticamente ha desaparecido en producción. La progresión que han seguido la mayoría de los equipos es:
FP32 → FP16 → BF16 → INT8 → INT4 → GPTQ/AWQ/GGUF
Cada paso reduce la memoria aproximadamente a la mitad y, a menudo, mejora el throughput. AWQ y GPTQ en particular se mantienen sorprendentemente bien: la cuantización (quantization) INT4 de LLaMA 70B suele mostrar menos del 1% de degradación en los benchmarks estándar frente a FP16, y un modelo de 70B cuantizado a 4 bits cabe en una sola GPU de 80GB en lugar de necesitar dos. Para la mayoría de las cargas de trabajo (workloads) de producción, la pérdida de calidad es invisible.
Destilación
Entrenar un modelo más pequeño para imitar a uno más grande se ha convertido en una práctica estándar. GPT-4o mini no es solo una arquitectura más pequeña; es un modelo destilado (distilled model) que captura la mayor parte del comportamiento de GPT-4 con una fracción de la cantidad de parámetros. Esta es probablemente la razón principal por la cual la calidad por dólar ha avanzado tan rápido.
La receta es sencilla. Generar millones de pares de entrada-salida de un "maestro" grande y luego realizar un fine-tuning de un "estudiante" más pequeño con esos datos. El estudiante adopta la distribución de salida del maestro sin necesidad de tener su misma cantidad de parámetros.
Batching e infraestructura de serving
El continuous batching, el speculative decoding, PagedAttention (tal como se implementa en vLLM) y la optimización de KV-cache ya no son curiosidades de investigación; así es como funciona la inferencia en producción. El serving inicial de LLM era vergonzosamente ineficiente. Las GPU se quedaban inactivas durante la fase de decodificación autorregresiva y se podía ver cómo los gráficos de utilización se estancaban. El serving moderno mantiene la utilización por encima del 80% mediante una programación inteligente de las solicitudes.
# Throughput de vLLM en LLaMA 70B, 4x A100:
# Serving ingenuo (naive): ~200 tokens/seg
# HuggingFace TGI: ~800 tokens/seg
# vLLM: ~2000 tokens/segSelf-hosting vs Precios de API
La decisión de construir frente a comprar (build-vs-buy) depende del volumen, la latencia y qué modelo necesitas realmente.
El precio de las API gana cuando tu volumen es inferior a unos 50-100M de tokens por día, necesitas un frontier model como GPT-4 o Claude Opus, no quieres gestionar infraestructura o tu tráfico es intermitente (spiky) en lugar de sostenido.
El self-hosting gana cuando procesas cientos de millones de tokens diarios con un volumen constante, un modelo abierto más pequeño en el rango de 7B-70B cumple con tus estándares de calidad, necesitas una latencia inferior a 50 ms o modificaciones personalizadas del modelo, o las reglas de privacidad de datos prohíben enviar información a un tercero.
El punto de equilibrio sigue desplazándose hacia volúmenes más altos a medida que caen los precios de las API. En 2023, el self-hosting tenía sentido por encima de los 10M de tokens/día. Para finales de 2025, ese umbral estará más cerca de los 100M de tokens/día en la mayoría de los casos, porque los proveedores de API adoptan las mejoras de infraestructura más rápido de lo que los equipos individuales pueden replicarlas.
Qué cambia realmente con una inferencia barata
La reducción acumulada de costos tiene consecuencias concretas sobre quién puede construir qué.
Con un precio de $60 por millón de tokens en 2020, solo las empresas bien financiadas podían experimentar. Un chatbot que gestionaba 1,000 conversaciones al día costaba entre $2,000 y $5,000 al mes solo en tarifas de API, antes de pagar cualquier otra cosa.
A $0.15 por millón de tokens en 2024, el mismo chatbot cuesta entre $5 y $10 al mes. Un desarrollador independiente puede construir y ejecutar un producto impulsado por IA por el costo de un café al día.
En la trayectoria actual, para 2026 o 2027, el costo de una llamada típica a un LLM será aproximadamente el mismo que el de una consulta a una base de datos. Eso cambia el cálculo para cada producto de software. Añadir funciones de IA se convierte en una decisión de interfaz de usuario (UI), no en una decisión de costos.
Ya se puede ver esto en el mercado. Productos que habrían sido "startups de IA" en 2023 ahora son funciones dentro de productos existentes. Los clientes de correo electrónico resumen hilos. Los editores de código autocompletan funciones. Los CRM redactan borradores de seguimiento. Cuando la inteligencia es barata, se convierte en infraestructura y la diferenciación se traslada a otra parte.
El horizonte de la "inferencia a $0"
¿Dónde termina esto? Existen límites físicos reales. Las multiplicaciones de matrices requieren energía y la energía cuesta dinero. Pero varias tendencias apuntan a que la inferencia se convierta en un error de redondeo para la mayoría de las aplicaciones.
La inferencia en el dispositivo (on-device inference) elimina el viaje de ida y vuelta por la red y el margen de la API. Apple, Google y Qualcomm están lanzando NPU capaces de ejecutar modelos de entre 3B y 7B de parámetros localmente, con un costo marginal de cero por consulta.
El almacenamiento en caché (caching) y el pre-procesamiento eliminan el trabajo redundante. Muchas consultas a LLM son variaciones de la misma intención, y el semantic caching puede atender intenciones repetidas sin una pasada completa (forward pass).
La amortización a escala también es importante. A medida que la IA se vuelve ubicua, el costo por consulta es absorbido por el costo de la plataforma, de la misma manera que ya ocurre con los ciclos de CPU y el ancho de banda.
Mi lectura es que estamos a 2 o 3 años del punto en el que el costo de inferencia dejará de ser una partida presupuestaria significativa para la mayoría de los productos de software. Si eso es correcto, el valor se desplazará por completo hacia los datos, la distribución y la experiencia de producto. El "foso" (moat) no es el modelo. Es todo lo que lo rodea.
