Cambiar tema

Guía de Ollama local LLM

18 artículos en esta serie

Una ruta de LLM local para Ollama, modelos, APIs, Web UI, RAG local y decisiones de hardware.

1

Introducción a Ollama: tu primer paso para ejecutar LLM en local

¿Quieres ejecutar un gran modelo de lenguaje en tu propio equipo? Esta guía te enseña paso a paso a instalar y configurar Ollama, con instalación multiplataforma, gestión de modelos, aceleración GPU e integración API.

IA e inteligencia
2

Gestión de modelos en Ollama: guía completa de descarga, cambio, eliminación y control de versiones

Comandos esenciales de gestión de modelos en Ollama: descargar versiones concretas, cambiar de modelo, scripts de eliminación por lotes y buenas prácticas de control de versiones para administrar tu biblioteca local de LLM, liberar espacio en disco y evitar el caos de versiones. Ideal para desarrolladores de IA y quienes despliegan OpenClaw.

IA e inteligencia
3

Rollback de versiones en Ollama: 3 pasos clave que el 90% de desarrolladores ignora

¿El sistema se vuelve inestable tras actualizar Ollama? Esta guía ofrece tres métodos completos de rollback (reemplazo binario, gestor de paquetes y Docker), scripts de automatización en un clic y estrategias para convivir con varias versiones, para resolver rápido los problemas de gestión de versiones.

IA e inteligencia
4

Parámetros de Ollama Modelfile explicados: guía completa para crear modelos personalizados

Guía detallada de los 10 parámetros clave de Ollama Modelfile, con consejos de ajuste para temperature, num_ctx y más. Incluye 4 plantillas listas para usar y ayudarte a crear tu propio modelo personalizado.

IA e inteligencia
5

Llama 70B en local: comparativa de 5700XT, Mac M4 y CUDA con guía de elección

¿Quieres ejecutar Llama 70B en local? Comparamos AMD 5700XT, Mac M4 y NVIDIA CUDA con datos reales para ayudarte a elegir el hardware adecuado: requisitos de VRAM, rendimiento y errores habituales.

IA e inteligencia
6

Guía de hardware Ollama: VRAM, cuantización y tablas comparativas de GPU (2026)

Tabla comparativa completa de hardware Ollama: requisitos de VRAM para modelos 7B/13B/70B, comparativa de cuantización Q4/Q8 y las tres tecnologías de aceleración NVIDIA CUDA, AMD ROCm y Apple Metal. Recomendaciones por niveles de RTX 3060 a 5090 para que encuentres rápido la GPU adecuada para tu modelo.

IA e inteligencia
7

Aceleración GPU en Ollama: guía práctica con CUDA, ROCm y Metal en todas las plataformas

Guía completa de aceleración GPU en Ollama: configuración en NVIDIA CUDA, AMD ROCm y Apple Metal, con pasos de verificación, ajustes multi-GPU y resolución de problemas para multiplicar por 10-20 la velocidad de inferencia local de LLM.

IA e inteligencia
9

Programación GPU y gestión de recursos en Ollama: optimización de VRAM y balanceo multi-GPU

Análisis profundo de la programación GPU y la gestión de recursos en Ollama: configuración de parámetros para optimizar VRAM, arquitectura práctica de balanceo de carga multi-GPU y principios técnicos de llama.cpp. Tres casos reales para ejecutar modelos grandes con estabilidad y aprovechar hardware multi-GPU.

IA e inteligencia
10

Optimización del rendimiento de Ollama: guía completa de cuantización, batch processing y ajuste de memoria

Estrategias de cuantización Q4/Q5/Q8 para Ollama, configuración de num_batch para aumentar el throughput un 50-150%, gestión de memoria GPU y soluciones a OOM. Incluye benchmarks por hardware.

IA e inteligencia
11

Ollama con varios modelos en paralelo: configuración práctica de Qwen, Llama y DeepSeek

Guía detallada para configurar la ejecución en paralelo de varios modelos en Ollama, comparativa de Qwen, Llama y DeepSeek, técnicas de gestión de memoria GPU y cómo crear un sistema inteligente de cambio de modelos.

IA e inteligencia
12

Ollama + Open WebUI: monta una interfaz local tipo ChatGPT (guía completa)

Guía paso a paso para montar en local una interfaz de chat con IA al estilo ChatGPT usando Ollama y Open WebUI: instalación, elección de modelos, base de conocimiento RAG, integración API y optimización del rendimiento en 30 minutos

IA e inteligencia
13

Llamadas a la API de Ollama: de curl a la interfaz compatible con OpenAI SDK

Aprende dos formas de llamar la API de Ollama: REST API nativa (curl) e interfaz compatible con OpenAI SDK. Incluye ejemplos de código completos, manejo de respuestas en streaming y guía de buenas prácticas

IA e inteligencia
14

Ollama API en la práctica: guía de clientes con Python y Node.js

Métodos de llamada a la API de Ollama: SDK nativos en Python y Node.js, respuestas en streaming, Agent Loop con tool calling, modo thinking y comparación con la compatibilidad OpenAI

IA e inteligencia
15

Integración LangChain + Ollama: guía completa de desarrollo con LLM local

Métodos completos de integración LangChain y Ollama: ejemplos de Chat, RAG y Agent, estrategia de cambio entre OpenAI y Ollama, y cómo construir aplicaciones LLM locales de nivel empresarial.

IA e inteligencia
16

Embedding con Ollama en la práctica: búsqueda vectorial local y RAG

Construye un sistema RAG local con Ollama: comparativa mxbai-embed-large vs nomic-embed-text, elección entre ChromaDB/FAISS/Milvus y código Python completo paso a paso.

IA e inteligencia
17

Cuantización de modelos en Ollama: formato GGUF y pérdida de precisión

Principios de cuantización GGUF en Ollama, datos de evaluación Red Hat 500K+ sobre pérdida de precisión y recomendaciones por hardware para ejecutar LLM grandes en GPU de consumo.

IA e inteligencia
18

Monitorización de Ollama en producción: logs, Prometheus y alertas

Plan completo de monitorización para Ollama en producción: configuración de logs, métricas Prometheus, reglas AlertManager y dashboard Grafana, con GPU multi-tarjeta y recuperación automática.

IA e inteligencia
19

Mnemo con Ollama: memoria local, despliegue y control

Mnemo da memoria entre sesiones a Ollama con Rust, SQLite y un grafo. Prueba su API y evalúa borrado, migración y límites al compartir entre agentes.

IA e inteligencia
Easton BlogEaston Blog