ManzGPU

Guía de Ollama

Hype-Generator 3000™: It's a game-changer

Aprenderás a instalar Ollama (motor de inferencia) para descargar y usar modelos de IA.

1. Introducción

Si ya has leído la guía de IA local, sabrás que para usar modelos en tu ordenador necesitas un motor de inferencia que cargue el modelo en tu VRAM (GPU), o si no tienes hardware potente, en RAM (más lento, pero posible):

OLLAMA MODELO IA GPU / CPU

Ollama es la forma más sencilla y cómoda de empezar con IA local: sólo tienes que instalarlo, descargar el modelo y abrir una sesión de chat. No necesitas compilar nada ni elegir backends manualmente. A cambio, ofrece menos control y es algo menos eficiente que llama.cpp, el cuál recomiendo para usuarios más avanzados o etapas posteriores.

Ollamallama.cpp
🟢 Facilidad Interfaz simple. Comandos sencillos. Más complejo: backend, comandos, parámetros...
🎮 GPU Detección automática (Nvidia/AMD/CPU) Tú eliges backend (CUDA, ROCm, Vulkan...)
📦 Modelos Biblioteca propia (ollama pull), similar a Docker Cualquier GGUF de HuggingFace
⚙️ Control Parámetros básicos (Modelfile) Control total (gestión, contexto, cuantización...)
🤖 Ideal para Empezar rápido, probar modelos Exprimir rendimiento. Soporta OpenCode o Pi

Mi recomendación: empieza con Ollama para probar o entrar en el sector de IA local. Cuando necesites más velocidad, mayor control o rendimiento, salta a llama.cpp.

2. Instalación

Antes de nada, asegúrate de tener los drivers de tu GPU actualizados (Ollama los usa automáticamente si los detecta). Si no sabes cómo, sigue la instalación de drivers de la guía de llama.cpp.

Ahora selecciona tu sistema operativo:

En Linux, instala con el script oficial desde una terminal:

curl -fsSL https://ollama.com/install.sh | sh
ollama --version

En Windows, descarga el instalador desde ollama.com/download y ejecútalo. Al terminar tendrás el icono de Ollama en la bandeja del sistema y el comando ollama disponible en la terminal.

Si prefieres trabajar como en Linux dentro de Windows, usa WSL y sigue los pasos de Linux. Recuerda que en WSL necesitas drivers específicos de GPU (mira la guía de drivers de arriba).

En macOS, descarga la aplicación desde ollama.com/download y arrástrala a Aplicaciones. Al abrirla tendrás el icono en la barra de menú y el comando ollama disponible en la terminal.

En Mac con chip Apple Silicon (M1 o superior) la memoria es unificada, así que Ollama puede usar modelos más grandes de lo que sugiere la RAM «clásica». Aun así, respeta la tabla de tamaños de la sección 4.

Comprueba que el servidor está en marcha (Ollama levanta uno automáticamente en http://localhost:11434):

ollama list

Si no da error y te aparece Ollama is running, ya lo tienes listo.

3. Tu primer modelo

Vamos a descargar un modelo pequeño de la familia 3.5 de Qwen para probar que todo funciona. Aunque será algo «tonto», es rápido y cabe en cualquier equipo:

ollama run qwen3.5:0.8b

Este comando hace dos cosas:

  • Si no tienes el modelo, lo descarga (ollama pull)
  • Luego, abre un chat interactivo vía terminal

Escribe tu prompt y pulsa Enter. Para salir del chat escribe /bye.

¿Qué significa qwen3.5:0.8b? Con qwen3.5 nos referimos a la familia del modelo y con 0.8b a su tamaño (0.8 billions de parámetros). Cuanto mayor sea ese número, más capaz... y más memoria necesitará. Más info en nuestra guía de Bases de la IA local.

Puedes ir encadenando múltiples preguntas como lo harías con ChatGPT o Claude. Recuerda salir y empezar una nueva sesión si no quieres que la conversación se "contamine" con información escrita anteriormente.

Puedes probar estos comandos especiales dentro del chat para entender como funciona la terminal de ollama:

/set system "Responde siempre con un TLDR (resumen breve) de tu respuesta"
/show info
/help

Es muy probable que con ciertos prompts te escriba textos interminables que son poco prácticos. Un buen consejo es pedirle que sea breve, salvo que te interesen los textos largos. Además, también puedes empezar con ollama run qwen3.5:0.8b --think=false si quieres que no muestre los razonamientos (ver más adelante).

4. Modelo según hardware

No todos los equipos pueden con todos los modelos. Como orientación rápida:

ModeloTamañomemoria necesariaPara qué sirve
qwen3.5:0.8b ~500 MB 2 GB Probar que todo funciona
qwen3.5:4b ~2.5 GB 6 GB Tareas simples, equipos modestos
qwen3.5:9b ~5 GB 8-10 GB Uso diario equilibrado
qwen2.5-coder:7b ~4.7 GB 8-10 GB Programar
qwen3:14b ~9 GB 16 GB Más calidad si tienes 16 GB de RAM/VRAM

Para descargar sin entrar al chat usa pull, y para ver lo que tienes usa list:

ollama pull qwen3:8b
ollama list

Regla práctica: si tu GPU tiene X GB de VRAM, el modelo debería ocupar como máximo el 70-80% de X (el resto lo necesita el contexto). Si no tienes GPU dedicada, cuenta con tu RAM y resta lo que use el sistema. Tienes la explicación completa en Bases de la IA local.

5. Comandos

Aquí tienes varios comandos de ollama de los más frecuentes y útiles:

ollama run qwen3:8b        # Chatear (descarga el modelo si falta)
ollama list                # Ver modelos descargados
ollama ps                  # Ver qué modelo está cargado ahora mismo
ollama show qwen3:8b       # Ver detalles (parámetros, cuantización...)
ollama rm qwen3.5:0.8b     # Borrar un modelo para liberar disco

Y dos trucos útiles:

# Pregunta directa al LLM, sin chat interactivo
ollama run qwen3:8b "Explícame qué es la fotosíntesis en 2 líneas"

# Copiar/renombrar un modelo
ollama cp qwen3:8b mi-qwen

En algunas plataformas, ollama ofrece una interfaz visual muy minimalista para realizar preguntas sin utilizar la terminal. Otra opción más avanzada, que requiere algo de configuración e instalación por tu parte es OpenWebUI, un clon de la interfaz de ChatGPT.

6. API de Ollama

Ollama expone automáticamente una API compatible con OpenAI en la dirección http://localhost:11434. Esto significa que cualquier programa que contacte con la API de esa dirección puede usar tus modelos locales gratis y en privado.

Prueba rápida con curl, desde terminal:

curl -sL http://localhost:11434/v1/chat/completions -d '{
  "model": "qwen3.5:0.8b",
  "messages": [
    {
      "role": "user",
      "content": "Dime un planeta del sistema solar"
    }
  ]
}' | jq .

Dos usos habituales:

  • Agentes de código: en OpenCode o Pi apunta el baseURL a http://127.0.0.1:11434/v1 y usa tu modelo local sin pagar tokens o suscripciones.
  • Tus propios scripts o webs: cualquier librería de Python/JS para OpenAI funciona cambiando sólo la URL base y el nombre del modelo.

Si quieres exponer Ollama a otros equipos de tu red local, arranca el servidor con OLLAMA_HOST=0.0.0.0 ollama serve. Ojo: eso lo hace visible en tu red, no lo expongas a internet.

7. Cargar modelos GGUF

La biblioteca de Ollama cubre lo habitual, pero en HuggingFace hay miles de modelos en formato GGUF personalizados. Si quieres usar uno, descargalo:

# Crea una carpeta para tus modelos, por ejemplo:
mkdir -p ~/.models/gguf
# Descarga el fichero GGUF que quieras (este pesa ~500MB)
curl -sL https://huggingface.co/unsloth/Qwen3.5-0.8B-GGUF/resolve/main/Qwen3.5-0.8B-Q4_0.gguf?download=true -o ~/.models/gguf/Qwen3.5-0.8B.gguf

Luego, creamos un fichero Modelfile (al estilo de Dockerfile) para personalizar el funcionamiento de este modelo. Por ejemplo, nano ~/.models/gguf/Qwen3.5-0.8B.Modelfile:

FROM ~/.models/gguf/Qwen3.5-0.8B.gguf
PARAMETER temperature 0.7
SYSTEM "Responde siempre con un TLDR (resumen breve) de tu respuesta."

Con PARAMETER puedes fijar temperatura, tamaño de contexto (num_ctx) y demás. Por último, creamos un modelo en la lista de ollama en base a nuestra configuración:

ollama create qwencito -f ~/.models/gguf/Qwen3.5-0.8B.Modelfile
ollama run qwencito --think=false

Recuerda que estamos usando un modelo super pequeño y muy básico, y es muy posible que responda con información incorrecta o se quede en bucles, ya que es un modelo muy simple y útil sólo para tareas rápidas de configuración. Si quieres algo más capaz, tendrías que buscar modelos un poco más grandes.

¡Ya tienes IA local funcionando! ¿Por dónde seguir?