1. Introducción
Si ya has leído la guía de IA local, sabrás que para usar modelos en tu ordenador necesitas un motor de inferencia que cargue el modelo en tu VRAM (GPU), o si no tienes hardware potente, en RAM (más lento, pero posible):
Ollama es la forma más sencilla y cómoda de empezar con IA local: sólo tienes que instalarlo, descargar el modelo y abrir una sesión de chat. No necesitas compilar nada ni elegir backends manualmente. A cambio, ofrece menos control y es algo menos eficiente que llama.cpp, el cuál recomiendo para usuarios más avanzados o etapas posteriores.
| Ollama | llama.cpp | |
|---|---|---|
| 🟢 Facilidad | Interfaz simple. Comandos sencillos. | Más complejo: backend, comandos, parámetros... |
| 🎮 GPU | Detección automática (Nvidia/AMD/CPU) | Tú eliges backend (CUDA, ROCm, Vulkan...) |
| 📦 Modelos | Biblioteca propia (ollama pull), similar a Docker |
Cualquier GGUF de HuggingFace |
| ⚙️ Control | Parámetros básicos (Modelfile) |
Control total (gestión, contexto, cuantización...) |
| 🤖 Ideal para | Empezar rápido, probar modelos | Exprimir rendimiento. Soporta OpenCode o Pi |
Mi recomendación: empieza con Ollama para probar o entrar en el sector de IA local. Cuando necesites más velocidad, mayor control o rendimiento, salta a llama.cpp.
2. Instalación
Antes de nada, asegúrate de tener los drivers de tu GPU actualizados (Ollama los usa automáticamente si los detecta). Si no sabes cómo, sigue la instalación de drivers de la guía de llama.cpp.
Ahora selecciona tu sistema operativo:
En Linux, instala con el script oficial desde una terminal:
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
En Windows, descarga el instalador desde ollama.com/download y ejecútalo. Al terminar tendrás el icono de Ollama en la bandeja del sistema y el comando ollama disponible en la terminal.
Si prefieres trabajar como en Linux dentro de Windows, usa WSL y sigue los pasos de Linux. Recuerda que en WSL necesitas drivers específicos de GPU (mira la guía de drivers de arriba).
En macOS, descarga la aplicación desde ollama.com/download y arrástrala a Aplicaciones. Al abrirla tendrás el icono en la barra de menú y el comando ollama disponible en la terminal.
En Mac con chip Apple Silicon (M1 o superior) la memoria es unificada, así que Ollama puede usar modelos más grandes de lo que sugiere la RAM «clásica». Aun así, respeta la tabla de tamaños de la sección 4.
Comprueba que el servidor está en marcha (Ollama levanta uno automáticamente en http://localhost:11434):
ollama list
Si no da error y te aparece Ollama is running, ya lo tienes listo.
3. Tu primer modelo
Vamos a descargar un modelo pequeño de la familia 3.5 de Qwen para probar que todo funciona. Aunque será algo «tonto», es rápido y cabe en cualquier equipo:
ollama run qwen3.5:0.8b
Este comando hace dos cosas:
- Si no tienes el modelo, lo descarga (
ollama pull) - Luego, abre un chat interactivo vía terminal
Escribe tu prompt y pulsa Enter. Para salir del chat escribe /bye.
¿Qué significa
qwen3.5:0.8b? Conqwen3.5nos referimos a la familia del modelo y con0.8ba su tamaño (0.8 billions de parámetros). Cuanto mayor sea ese número, más capaz... y más memoria necesitará. Más info en nuestra guía de Bases de la IA local.
Puedes ir encadenando múltiples preguntas como lo harías con ChatGPT o Claude. Recuerda salir y empezar una nueva sesión si no quieres que la conversación se "contamine" con información escrita anteriormente.
Puedes probar estos comandos especiales dentro del chat para entender como funciona la terminal de ollama:
/set system "Responde siempre con un TLDR (resumen breve) de tu respuesta"
/show info
/help
Es muy probable que con ciertos prompts te escriba textos interminables que son poco prácticos. Un buen consejo es pedirle que sea breve, salvo que te interesen los textos largos. Además, también puedes empezar con
ollama run qwen3.5:0.8b --think=falsesi quieres que no muestre los razonamientos (ver más adelante).
4. Modelo según hardware
No todos los equipos pueden con todos los modelos. Como orientación rápida:
| Modelo | Tamaño | memoria necesaria | Para qué sirve |
|---|---|---|---|
qwen3.5:0.8b |
~500 MB | 2 GB | Probar que todo funciona |
qwen3.5:4b |
~2.5 GB | 6 GB | Tareas simples, equipos modestos |
qwen3.5:9b |
~5 GB | 8-10 GB | Uso diario equilibrado |
qwen2.5-coder:7b |
~4.7 GB | 8-10 GB | Programar |
qwen3:14b |
~9 GB | 16 GB | Más calidad si tienes 16 GB de RAM/VRAM |
Para descargar sin entrar al chat usa pull, y para ver lo que tienes usa list:
ollama pull qwen3:8b
ollama list
Regla práctica: si tu GPU tiene
XGB de VRAM, el modelo debería ocupar como máximo el 70-80% deX(el resto lo necesita el contexto). Si no tienes GPU dedicada, cuenta con tu RAM y resta lo que use el sistema. Tienes la explicación completa en Bases de la IA local.
5. Comandos
Aquí tienes varios comandos de ollama de los más frecuentes y útiles:
ollama run qwen3:8b # Chatear (descarga el modelo si falta)
ollama list # Ver modelos descargados
ollama ps # Ver qué modelo está cargado ahora mismo
ollama show qwen3:8b # Ver detalles (parámetros, cuantización...)
ollama rm qwen3.5:0.8b # Borrar un modelo para liberar disco
Y dos trucos útiles:
# Pregunta directa al LLM, sin chat interactivo
ollama run qwen3:8b "Explícame qué es la fotosíntesis en 2 líneas"
# Copiar/renombrar un modelo
ollama cp qwen3:8b mi-qwen
En algunas plataformas,
ollamaofrece una interfaz visual muy minimalista para realizar preguntas sin utilizar la terminal. Otra opción más avanzada, que requiere algo de configuración e instalación por tu parte es OpenWebUI, un clon de la interfaz de ChatGPT.
6. API de Ollama
Ollama expone automáticamente una API compatible con OpenAI en la dirección http://localhost:11434. Esto significa que cualquier programa que contacte con la API de esa dirección puede usar tus modelos locales gratis y en privado.
Prueba rápida con curl, desde terminal:
curl -sL http://localhost:11434/v1/chat/completions -d '{
"model": "qwen3.5:0.8b",
"messages": [
{
"role": "user",
"content": "Dime un planeta del sistema solar"
}
]
}' | jq .
Dos usos habituales:
- Agentes de código: en OpenCode o Pi apunta el
baseURLahttp://127.0.0.1:11434/v1y usa tu modelo local sin pagar tokens o suscripciones. - Tus propios scripts o webs: cualquier librería de Python/JS para OpenAI funciona cambiando sólo la URL base y el nombre del modelo.
Si quieres exponer Ollama a otros equipos de tu red local, arranca el servidor con
OLLAMA_HOST=0.0.0.0 ollama serve. Ojo: eso lo hace visible en tu red, no lo expongas a internet.
7. Cargar modelos GGUF
La biblioteca de Ollama cubre lo habitual, pero en HuggingFace hay miles de modelos en formato GGUF personalizados. Si quieres usar uno, descargalo:
# Crea una carpeta para tus modelos, por ejemplo:
mkdir -p ~/.models/gguf
# Descarga el fichero GGUF que quieras (este pesa ~500MB)
curl -sL https://huggingface.co/unsloth/Qwen3.5-0.8B-GGUF/resolve/main/Qwen3.5-0.8B-Q4_0.gguf?download=true -o ~/.models/gguf/Qwen3.5-0.8B.gguf
Luego, creamos un fichero Modelfile (al estilo de Dockerfile) para personalizar el funcionamiento de este modelo. Por ejemplo, nano ~/.models/gguf/Qwen3.5-0.8B.Modelfile:
FROM ~/.models/gguf/Qwen3.5-0.8B.gguf
PARAMETER temperature 0.7
SYSTEM "Responde siempre con un TLDR (resumen breve) de tu respuesta."
Con PARAMETER puedes fijar temperatura, tamaño de contexto (num_ctx) y demás. Por último, creamos un modelo en la lista de ollama en base a nuestra configuración:
ollama create qwencito -f ~/.models/gguf/Qwen3.5-0.8B.Modelfile
ollama run qwencito --think=false
Recuerda que estamos usando un modelo super pequeño y muy básico, y es muy posible que responda con información incorrecta o se quede en bucles, ya que es un modelo muy simple y útil sólo para tareas rápidas de configuración. Si quieres algo más capaz, tendrías que buscar modelos un poco más grandes.
¡Ya tienes IA local funcionando! ¿Por dónde seguir?
- Si Ollama se te queda corto en velocidad o control → Guía de llama.cpp
- Si quieres programar con tu modelo local → Guía de OpenCode o Guía de Pi
- Si quieres entender qué significan los tamaños y la cuantización → Bases de la IA local

