No todas las llamadas de IA necesitan atravesar internet. Cada vez más, ninguna tiene por qué hacerlo.
Por qué la IA en el edge es importante
La era de la IA cloud-first está encontrando un contrapeso. Ejecutar modelos directamente en teléfonos, laptops y dispositivos embebidos resuelve cuatro problemas a la vez.
El primero es la latencia. Un viaje de ida y vuelta (round trip) a una API en la nube toma entre 200 y 2000 ms, dependiendo del modelo y la carga. La inferencia on-device toma entre 10 y 100 ms. Para tareas en tiempo real —traducción en vivo, procesamiento de cámara, predicción de teclado— esa brecha es la diferencia entre algo que se siente fluido y algo que parece roto.
El segundo es la privacidad. Cuando los datos nunca salen del dispositivo, desaparecen categorías enteras de preocupaciones regulatorias y de confianza. Los datos de salud se quedan en el teléfono. Los documentos legales se quedan en la laptop. Sin acuerdos de procesamiento de datos (data processing agreements), sin riesgo de filtraciones a través de una API de terceros.
El tercero es la capacidad offline. La IA en la nube simplemente deja de funcionar sin conectividad. La IA on-device sigue funcionando en aviones, sótanos o áreas rurales con señal inestable. Para un despliegue global, esto es un requisito indispensable, no un lujo.
El cuarto es el costo. Las llamadas a APIs se acumulan rápido. Una aplicación de consumo que realiza 100 llamadas a un LLM por usuario al día para millones de usuarios está generando costos que no escalan. La inferencia on-device tiene un costo marginal cero una vez que el modelo ha sido desplegado.
Los habilitadores de hardware
La IA on-device se volvió viable gracias al silicio dedicado. Los chips modernos incluyen Unidades de Procesamiento Neuronal, o NPUs, que son aceleradores especializados construidos para las multiplicaciones de matrices que dominan la inferencia de redes neuronales.
Los principales actores hoy en día son: Apple Neural Engine en los chips de las series M y A, con una NPU de 16 núcleos que alcanza más de 38 TOPS en el M4. Qualcomm Hexagon NPU en el Snapdragon 8 Gen 3+, con alrededor de 45 TOPS, impulsando la IA on-device en los buques insignia de Android. La NPU de Intel que comenzó con Meteor Lake, llevando finalmente la aceleración de IA a las laptops x86. MediaTek APU en el Dimensity 9300+, con un rendimiento de NPU competitivo para la gama media de Android.
Estas no son GPUs adaptadas para inferencia; están construidas desde cero para operaciones tensoriales de bajo consumo y alto rendimiento. La eficiencia energética es lo que realmente importa en la práctica. Ejecutar un modelo en una NPU consume una fracción de la energía que una GPU usaría para la misma tarea, razón por la cual tu teléfono puede transcribir una reunión sin sobrecalentarse.
Ajustando los modelos
Un modelo de 70B parámetros en FP16 necesita unos 140 GB de memoria. Ningún teléfono va a tener eso. Llevar modelos a los dispositivos requiere una compresión agresiva.
La cuantización (quantization) reduce la precisión numérica. Pasar de FP16 a INT8 reduce la memoria a la mitad. INT4 la reduce a una cuarta parte. Un modelo de 7B en FP16 necesita unos 14 GB; en INT4, baja a aproximadamente 3.5 GB, lo cual está al alcance de los teléfonos modernos. La pérdida de calidad suele ser insignificante para tareas comunes, aunque las cargas de trabajo con mucho razonamiento sufren de manera más visible.
El pruning elimina los pesos que contribuyen poco a la calidad del resultado. El pruning estructurado elimina neuronas enteras o cabezales de atención. El pruning no estructurado pone a cero pesos individuales. Combinado con la cuantización, el pruning puede reducir los modelos entre 5 y 10 veces con una pérdida mínima de calidad.
La destilación de conocimiento (knowledge distillation) va en la otra dirección. En lugar de comprimir un modelo grande, entrenas uno pequeño para imitar el comportamiento del grande. La serie Phi de Microsoft y Gemini Nano de Google son productos de este enfoque, y rinden muy por encima de lo que sugiere su número de parámetros.
Despliegues reales
Esto no es teórico. Actualmente, hay productos en el mercado que ejecutan IA significativa totalmente on-device.
Apple Intelligence ejecuta un modelo de aproximadamente 3B parámetros localmente para resumen de texto, reescritura y priorización de notificaciones. Las tareas más complejas se desvían a los servidores de Private Cloud Compute de Apple, pero la primera línea de procesamiento es totalmente integrada en el chip.
Gemini Nano se ejecuta en teléfonos Pixel para resúmenes de filtrado de llamadas, Smart Reply y transcripción en Recorder. Google diseñó específicamente este nivel de modelo considerando las limitaciones de la NPU de los chips Tensor G3/G4.
Whisper en dispositivos móviles es otro buen ejemplo. El modelo de reconocimiento de voz de OpenAI, cuantizado y optimizado, ejecuta transcripciones en tiempo real en teléfonos a través de aplicaciones como MacWhisper. Sin necesidad de red.
El punto ideal entre 1B y 7B
Para el despliegue en el edge, el tamaño del modelo se agrupa entre 1B y 7B parámetros.
Los modelos en el rango de 1–3B —Gemini Nano, Phi-3-mini, Llama 3.2 1B— caben en teléfonos, funcionan rápido y manejan bien tareas enfocadas: resumen, clasificación y Q&A simple. El rango de 3–7B cubre Mistral 7B, Llama 3.1 8B y Qwen2.5-7B. Estos requieren laptops o tablets de gama alta, pero alcanzan una calidad cercana a los modelos en la nube en muchas tareas. Por debajo de 1B es demasiado limitado para trabajo de lenguaje general, pero sigue siendo útil para clasificadores específicos y modelos de embeddings.
La brecha entre un modelo de 7B cuantizado y uno de 70B alojado en la nube es real, pero se ha ido reduciendo cada año. Para quizá el 80% de los casos de uso típicos —redacción, resumen, extracción, clasificación— un modelo de 7B bien ajustado es suficiente.
Frameworks y herramientas
El stack de software para la inferencia on-device ha madurado rápidamente.
- llama.cpp: Motor de inferencia en C/C++. Ejecuta modelos en formato GGUF en CPU, Metal, CUDA y Vulkan. Es el estándar de facto para la inferencia local de LLMs.
- MLC-LLM: Compilación de Machine Learning para LLMs. Optimiza modelos para hardware específico, incluyendo GPUs móviles y NPUs.
- ONNX Runtime: El motor de inferencia multiplataforma de Microsoft. Cuenta con un fuerte soporte de cuantización y amplia compatibilidad de hardware.
- Core ML: El framework de Apple para desplegar modelos en Apple silicon, con una integración profunda con el Neural Engine.
- MediaPipe: El framework de Google para pipelines de ML on-device. Es el más robusto para visión y audio.
# Running a 7B model locally with llama.cpp
./llama-server
--model models/mistral-7b-instruct-v0.3.Q4_K_M.gguf
--ctx-size 4096
--n-gpu-layers 35
--port 8080El diferenciador de la privacidad
La privacidad no es solo una característica; se está convirtiendo en un requisito regulatorio. El GDPR, la HIPAA y las regulaciones de IA emergentes restringen cada vez más el envío de datos personales a servicios externos.
La IA on-device evita este problema por completo. Una aplicación de notas para terapeutas que transcribe y resume sesiones localmente nunca transmite datos del paciente. Una herramienta de análisis de documentos de un bufete de abogados que se ejecuta en hardware local mantiene la información privilegiada dentro de la organización.
Para las empresas, la narrativa de adquisición también cambia. "Los datos nunca salen de su red" es una conversación fundamentalmente diferente a "los ciframos en tránsito y los almacenamos en nuestra infraestructura con cumplimiento SOC 2".
Dónde se queda corta la IA en el edge
Es importante ser honestos sobre las limitaciones.
El razonamiento complejo sigue siendo territorio de la nube. El razonamiento lógico de múltiples pasos, la resolución de problemas matemáticos y el análisis de matices aún requieren modelos más grandes. Un modelo de 7B no va a igualar a GPT-4 o Claude en problemas difíciles, sin importar qué tan ingenioso sea el prompting.
La ventana de contexto (context window) es otro factor. Los modelos on-device suelen admitir ventanas de contexto de 4K a 8K. Procesar un documento de 100 páginas requiere estrategias de fragmentación (chunking) que los modelos en la nube con más de 128K de contexto pueden omitir por completo.
Las capacidades multimodales en el edge están emergiendo, pero siguen siendo limitadas en comparación con lo disponible en la nube. Además, entrenar o realizar un fine-tuning en el dispositivo es poco práctico para la mayoría del hardware. El dispositivo ejecuta la inferencia; la nube se encarga del entrenamiento.
Sin embargo, la trayectoria es difícil de cuestionar. Cada generación de hardware trae más TOPS, más ancho de banda de memoria y arquitecturas más eficientes. Los modelos siguen volviéndose más pequeños e inteligentes mediante mejores técnicas de destilación y entrenamiento. El conjunto de tareas que genuinamente necesitan un viaje a la nube se reduce cada año.
La IA en el edge no está reemplazando a la IA en la nube. Está reclamando el territorio donde la latencia, la privacidad y el costo hacen que la nube sea la respuesta incorrecta.
