Enseñar a leer a un modelo ya era suficientemente difícil. Enseñar a uno a mirar resultó ser un problema de una categoría distinta.
Durante años, la computer vision y el procesamiento de lenguaje natural eran campos separados con arquitecturas separadas, benchmarks separados e investigadores separados. Las CNN manejaban imágenes; las RNN y luego los Transformers manejaban texto. Si necesitabas un sistema que pudiera hacer ambas cosas —generar el pie de una imagen, responder una pregunta sobre una foto—, acoplabas dos modelos con una capa de integración delgada y rezabas.
Esa era terminó. La generación actual de modelos multimodales procesa imágenes, texto, audio y video a través de una sola arquitectura con representaciones compartidas. El efecto práctico es que la misma interfaz de chat que uso para depurar Python ahora puede leer una nota manuscrita, interpretar un escaneo médico, extraer datos de un gráfico y describir qué está sucediendo en un clip de video.
De modelos separados a arquitecturas unificadas
Cómo llegamos aquí, en tres fases.
Enfoques de pipeline (2015–2019). Una CNN codificaba la imagen en un vector de características y un modelo de lenguaje independiente se condicionaba a ese vector para generar un texto. Show-and-Tell, Bottom-Up Top-Down attention, toda esa familia. Funcionaban, pero los dos sistemas nunca compartieron realmente una representación. El codificador de imagen no entendía el lenguaje y el modelo de lenguaje no entendía los píxeles. Estaban cosidos por la costura.
Pre-entrenamiento contrastivo (2021). CLIP de OpenAI cambió las cosas al entrenar un codificador de imagen y un codificador de texto de forma conjunta en 400 millones de pares imagen-texto de internet. El objetivo era simple: acercar los pares que coinciden en el espacio de embedding y alejar los que no coinciden. Después del entrenamiento, "la foto de un perro" y una foto real de un perro aterrizaban cerca la una de la otra en el mismo espacio vectorial. CLIP no era generativo —podía clasificar y comparar pero no describir—, pero le dio al campo el backbone visual sobre el cual se construiría todo lo demás.
Modelos de visión y lenguaje (2023–presente). El enfoque actual alimenta la información visual directamente en un LLM como tokens, junto con los tokens de texto. El modelo no está "viendo" en ningún sentido biológico. Está procesando una secuencia de embeddings, algunos derivados de texto y otros de patches de imagen, y razonando sobre todos ellos con el mismo mecanismo de atención.
Cómo funcionan los tokens de visión
El núcleo técnico es la conversión de imágenes en secuencias de tokens que el LLM pueda procesar. El pipeline es el siguiente:
Patch embedding. La imagen de entrada se corta en una cuadrícula de patches, usualmente de 14x14 o 16x16 píxeles. Una imagen de 224x224 se convierte en 256 patches. Una imagen de 1024x1024 se convierte en más de 4,000. Cada patch se proyecta en la dimensión de embedding del modelo a través de una capa lineal o una pequeña red neuronal.
Visual encoding. Los patches pasan por un vision encoder pre-entrenado, a menudo un Vision Transformer entrenado con objetivos CLIP o SigLIP. El codificador ya conoce bordes, texturas, objetos y relaciones espaciales. Su salida es una secuencia de embeddings visuales, uno por patch.
Proyección al espacio del LLM. Los embeddings visuales viven en un espacio vectorial diferente al de los embeddings de texto del LLM. Una capa de proyección —un mapeo lineal, un MLP o un módulo de cross-attention— mueve los tokens visuales al espacio de embedding del LLM.
Interleaving (Intercalado). Los tokens visuales proyectados se insertan en la secuencia de tokens junto con los tokens de texto. Una entrada típica se ve así:
[text] "Describe este gráfico:" [vis_1] [vis_2] ... [vis_256] [text] "\nSé específico sobre la tendencia."
La self-attention del LLM procesa entonces todos esos tokens —texto y visuales— en un solo forward pass. Los tokens visuales atienden a los tokens de texto y viceversa. Eso es lo que permite al modelo anclar su lenguaje en lo que ve.
Los modelos clave
Algunos modelos han definido el estado actual de esta tecnología.
GPT-4V (2023) fue el primer modelo ampliamente disponible en mostrar un razonamiento visual sólido a escala. Podía leer matemáticas manuscritas, identificar componentes de UI en capturas de pantalla y extraer datos estructurados de gráficos desordenados. Los demos de "encierra en un círculo el error en esta captura de pantalla" sorprendieron incluso a los investigadores.
Gemini 1.5 (2024) amplió la ventana de contexto lo suficiente como para aceptar horas de video como entrada. Su multimodalidad nativa, lo que significa que fue entrenado desde el inicio con datos de modalidad mixta en lugar de tener la visión añadida después, le otorgó un razonamiento cross-modal más fuerte.
Claude 3 (2024) demostró que la capacidad multimodal y el razonamiento cuidadoso podían coexistir. Es particularmente fuerte en el entendimiento de documentos, interpretación de gráficos y razonamiento espacial.
Contendientes de código abierto como LLaVA, InternVL y Qwen-VL demostraron que la arquitectura no es magia propietaria. LLaVA, en particular, mostró que hacer fine-tuning de un LLM abierto con un vision encoder CLIP y datos de instruction-tuning relativamente modestos podía producir resultados sorprendentemente capaces. He ejecutado LLaVA localmente en una sola GPU y he obtenido respuestas útiles de él.
Qué desbloquea esto realmente
Las aplicaciones van mucho más allá de la generación de pies de foto.
Entendimiento de documentos. Ingresa un PDF, una factura escaneada o un formulario manuscrito y el modelo extraerá datos estructurados. Esto reemplaza los frágiles pipelines de OCR con un sistema que entiende el contexto: sabe que el número junto a "Total" es un monto en dólares, no una cantidad.
Interpretación de diagramas y gráficas. Gráficos de barras, de líneas, diagramas de dispersión, tablas. El modelo los lee y responde preguntas analíticas: "¿qué trimestre tuvo el mayor crecimiento?", "¿cuál es la correlación aquí?". Una visualización estática se convierte en una fuente de datos consultable.
Entendimiento de código a partir de capturas de pantalla. Pega una captura de pantalla de un error, un bug de UI o un mockup de diseño. El modelo depura, describe o implementa lo que está en pantalla. Esta es la parte que potencia a muchos agentes de uso de computadora y herramientas para desarrolladores.
Análisis de video. Con una ventana de contexto suficiente, el modelo puede tomar frames de video como secuencias de imágenes, narrar lo que sucede, identificar momentos específicos y responder preguntas temporales como "¿cuándo cambia de tema el orador?".
Razonamiento espacial. Dado un plano de planta, un mapa o un diagrama, el modelo razona sobre distancias, adyacencias y contención. Sigue siendo imperfecto, pero mejora rápido.
Qué sigue fallando
Los modelos multimodales no son oráculos. Los modos de falla que sigo viendo son:
Conteo de grano fino. Pregúntale al modelo cuántas ventanas hay en la foto de un edificio y frecuentemente fallará. Contar objetos pequeños y repetidos es sorprendentemente difícil porque la representación a nivel de patches pierde detalles espaciales finos.
Alucinaciones de detalles visuales. El modelo a veces describe objetos o texto que no están en la imagen. Es la versión visual de la alucinación textual, y es más difícil de detectar porque verificarla requiere que yo realmente mire la imagen.
Precisión espacial. El modelo puede razonar sobre relaciones generales ("el gato está sobre la mesa") pero tiene dificultades con mediciones precisas o localización a nivel de píxel. Tareas como "dibuja un cuadro delimitador alrededor del defecto" aún requieren arquitecturas especializadas.
Texto pequeño en imágenes grandes. Cuando una imagen se reduce a la resolución de trabajo del modelo, el texto pequeño se convierte en ruido a nivel de patch. El tiling de alta resolución ayuda, pero se paga con un mayor costo de tokens.
Qué viene después
Más modalidades, integración más estrecha, generación nativa.
Los modelos actuales consumen principalmente entrada visual y producen salida de texto. La próxima generación generará imágenes, audio y video de forma nativa, no llamando a un modelo de difusión separado, sino a través de la misma arquitectura. La generación nativa de imágenes de Gemini ya apunta en esa dirección.
El audio está en el mismo camino que recorrió la visión. Están empezando a aparecer modelos que escuchan el habla, entienden el tono y responden con voz generada dentro de una sola arquitectura. El pipeline separado de speech-to-text, razonamiento de LLM y text-to-speech se está colapsando en un solo forward pass.
Esto no es un solo avance. Es el aprendizaje de representaciones, el escalado y las decisiones arquitectónicas convergiendo en sistemas que manejan el mundo de forma más parecida a como lo hacemos nosotros: no un sentido a la vez, sino todos a la vez.
