JobMap
Describe el trabajo que quieres hacer, explora vacantes relacionadas y revisa la evidencia detrás de los juicios de relevancia de Jev.
Explorar el agente →Soy Oswaldo Orona. Escribo sobre los sistemas que construyo, desde búsqueda y agentes de IA hasta los datos que los sostienen. Lee las decisiones, explora los resultados y revisa el código.
Sistemas que construí, con código y decisiones que puedes revisar.
Describe el trabajo que quieres hacer, explora vacantes relacionadas y revisa la evidencia detrás de los juicios de relevancia de Jev.
Explorar el agente →Un explorador interactivo de quince descripciones de personajes, con puntuaciones de similitud, proyecciones y una comparación al quitar las relaciones con otros personajes.
Explorar el agente →Un agente de búsqueda de cine y música que convierte una frase recordada en un video, con las llamadas a herramientas junto al resultado.
Explorar el agente →Un flujo de transferencia entre bases de datos que enmascara los campos de clientes antes de entregarlos al agente o a su buzón.
Explorar el agente →Un mapa de transporte con un asistente que resuelve lugares y pide a un motor de rutas que calcule el viaje.
Explorar el agente →Un participante de IA en una quiniela mundialista, con pronósticos guardados y una tabla de posiciones calculada junto a jugadores humanos.
Explorar el agente →Una investigación geoespacial creada para cuestionar la versión del gobierno mexicano sobre el derrame con registros de buques, capas satelitales y comunicados fechados.
Explorar el agente →Un endpoint MCP público para que un asistente busque en el blog, recorra el catálogo y recupere artículos completos.
Explorar el agente →Proyectos, análisis y guías sobre los sistemas con los que trabajo.
Ollama es la forma menos complicada de servir modelos locales en una sola GPU, pero sus valores predeterminados están ajustados para demos, no para producción. Analizamos lo que realmente importa (quantization, memoria de contexto, keep-alive) y cómo ejecutar tu propio modelo con fine-tuning tras la misma API.
Un recorrido por una ejecución real de un agente ReAct: la consulta fue "Houston, we have a problem" y el agente devolvió la marca de tiempo exacta de YouTube. Puedes reproducir la ejecución grabada dentro de este artículo, incluyendo los tokens de pensamiento.
Muchos decían que el prompt engineering era una moda pasajera. Se equivocaron: simplemente evolucionó. Del prompting artesanal al diseño sistemático de prompts para sistemas en producción.
Tu sitio de portafolio puede hacer más que mostrar contenido estático. Aprende a integrar chat de IA, RAG y herramientas agénticas en un sitio web personal.
Garantizar una salida válida de los LLMs requiere más que solo prompting. El grammar-constrained decoding impone la estructura a nivel de token; aquí explicamos cómo funciona.
Las APIs en la nube son convenientes pero costosas. Explora cómo ejecutar LLMs de código abierto en tus propios servidores, desde la selección de hardware hasta la optimización de la inferencia.
No necesitas una base de datos vectorial independiente. pgvector convierte a PostgreSQL en un motor de búsqueda semántica con índices HNSW, consultas híbridas y todo el poder de SQL.
Claude Code integra un agente de IA directamente en tu terminal. Explora lo que las herramientas de codificación autónomas significan para los flujos de trabajo de ingeniería de software.
La IA de un solo prompt está alcanzando su límite. Los workflows agénticos encadenan múltiples llamadas a LLM con herramientas, ramificaciones y bucles de retroalimentación para resolver tareas complejas de manera confiable.
El Model Context Protocol estandariza cómo los modelos de IA descubren y utilizan herramientas. Conoce cómo funcionan los servidores MCP y por qué son fundamentales para el futuro de los agentes.
Los modelos grandes son potentes pero costosos. La destilación transfiere su conocimiento a modelos más pequeños, rápidos y económicos, y los resultados son sorprendentemente buenos.
Gemini 1.5 Pro llevó el contexto a 1 millón de tokens y Claude 3.5 le siguió los pasos. Sin embargo, ¿es siempre mejor una ventana de contexto más grande y qué es lo que realmente habilita?
Las alucinaciones ocurren cuando los modelos adivinan. Los knowledge graphs proporcionan a los LLMs un eje estructurado y verificable, y la combinación es más potente que cualquiera de los dos por separado.
Desde el Neural Engine de Apple hasta las NPU de Qualcomm, la IA se está trasladando de la nube a tu dispositivo. Analizamos qué impulsa este cambio y las posibilidades que esto desbloquea.
Ambos enfoques personalizan los LLM para dominios específicos, pero resuelven problemas distintos. Aquí te explicamos cómo elegir la herramienta adecuada y cuándo combinarlas.
La inferencia es lenta porque los tokens se generan uno a uno. El speculative decoding rompe esa restricción sin cambiar la distribución de salida del modelo.
Copilot, Cursor, Claude Code y Codex permiten escribir código más rápido que nunca. Pero, ¿están los desarrolladores mejorando sus capacidades o simplemente volviéndose más dependientes?
Pensamiento extendido, test-time compute y chain-of-thought durante el entrenamiento: desglosamos cómo una nueva clase de modelos intercambia latencia por precisión.
Un laboratorio chino lanzó un modelo de razonamiento que igualó a OpenAI o1 a una fracción del costo, y luego lo liberó como open-source. He aquí por qué esto es sumamente importante.
Desde modelos nativos de razonamiento hasta ingenieros de software autónomos, estas son las tendencias que definirán la IA en 2026.
Una mirada retrospectiva a los avances, sorpresas y giros que definieron la inteligencia artificial en 2025, desde los modelos de razonamiento hasta la revolución de los agentes.
Los espacios latentes codifican el significado en la geometría. Aprenda cómo las técnicas de reducción de dimensionalidad como t-SNE y UMAP hacen visibles estas estructuras invisibles.
Una guía práctica para construir un pipeline de Retrieval-Augmented Generation utilizando la API de Gemini de Google, File Search Store y modelos de embeddings.
Optimiza tu infraestructura de ML con estrategias como MIG y cuantización para reducir costos sin sacrificar el rendimiento.
Una guía técnica paso a paso para construir un sistema de Generación Aumentada por Recuperación (RAG) para datos empresariales.
Un desglose visual de cómo la IA está expandiéndose en diversas industrias, desde la salud hasta las finanzas, durante los próximos cinco años.
Rastrea la caída exponencial en los costos de generación de tokens y lo que esta democratización significa para el futuro del software.
Comprende las leyes de potencia que rigen el rendimiento de la IA: por qué los modelos más grandes y un mayor cómputo generan consistentemente mejores resultados.
Recorre el linaje de las redes neuronales desde el humilde Perceptrón hasta las masivas ResNets que alimentan la IA actual.
Explora las capas de la arquitectura Transformer para visualizar cómo los attention heads procesan la información.
Un experimento de datos divertido: generar embeddings de personajes de Star Wars en un espacio 3D basados en su sensibilidad a la Fuerza y sus facciones.
Aprende cómo el clustering de K-Means revela patrones ocultos en el comportamiento de los usuarios para impulsar estrategias de negocio dirigidas.
Explora la matemática detrás del lenguaje: observa cómo 'King - Man + Woman = Queen' se representa visualmente en un espacio vectorial.
Descubre los secretos de la compresión de datos de alta dimensionalidad y cómo el mapeo de entradas complejas a espacios más simples impulsa la IA generativa.
Los embeddings son el lenguaje de la búsqueda semántica, y las bases de datos vectoriales son el lugar donde residen. Aprende cómo los índices ANN potencian la recuperación a escala.
Una sola frase ('let's think step by step') mejoró drásticamente el razonamiento de los LLM. Explora la ciencia detrás del chain-of-thought y hacia dónde se dirige.
Los modelos de visión y lenguaje ahora pueden describir imágenes, leer gráficos y analizar videos. Así es como su arquitectura permite un verdadero entendimiento cross-modal.
El texto libre funciona bien en una ventana de chat, pero los sistemas en producción necesitan JSON. Una guía sobre decodificación restringida, cumplimiento de esquemas y un ejemplo con Gemini que combina salidas estructuradas con function calling.
Los LLMs fueron solo el comienzo. Explore cómo los agentes de IA autónomos utilizan herramientas, memoria y planificación para actuar, no solo responder.
39 de 39 artículos
Soy Oswaldo Orona, Administrador Principal de Bases de Datos y profesional de IA con base en Denver, CO. Tengo un MCS-DS de UIUC (Tau Beta Pi, Phi Kappa Phi) y aporto más de 25 años de experiencia en bases de datos junto con trabajo práctico profundo en machine learning e ingeniería de IA.
Mis áreas de enfoque incluyen Generación Aumentada por Recuperación (RAG), agentes de IA, Model Context Protocol (MCP), IA geoespacial e IA financiera, todo ejecutándose en un laboratorio casero Proxmox auto-hospedado con Docker y LXC.
Este blog es donde documento exploraciones en el espacio latente: las ideas, experimentos y sistemas que viven entre los datos y el modelo.
Conoce mi experiencia a través de una conversación. Pregunta cómo construí un proyecto, conoce mi trayectoria o comenta cómo mis habilidades encajan en tu equipo.
Estás conversando con un asistente de IA. Puede ayudarte a agendar una llamada o enviar un mensaje. Oswaldo puede recibir un resumen de la conversación.