Ejecutar Ollama correctamente: Modelos locales y tus propios fine-tunes en una sola GPU
Ollama es la forma menos complicada de servir modelos locales en una sola GPU, pero sus valores predeterminados están ajustados para demos, no para producción. Analizamos lo que realmente importa (quantization, memoria de contexto, keep-alive) y cómo ejecutar tu propio modelo con fine-tuning tras la misma API.