1. Introducción
En las guías anteriores hemos visto cómo generar imágenes mediante stablediffusion.cpp, un motor de inferencia que se maneja mediante comandos desde la terminal. ComfyUI es la alternativa más popular cuando prefieres trabajar con una interfaz gráfica basada en nodos: en lugar de escribir parámetros y comandos, dibujas el flujo de generación conectando bloques.
Captura de ComfyUI Desktop usando Qwen Image 2.1 con una adaptación del prompt de Multi_Serio_Ai
Cada nodo hace una tarea concreta (cargar un modelo, escribir el prompt, muestrear el ruido, guardar la imagen...) y tú decides cómo se conectan entre ellos. Esto tiene varias ventajas:
- 🧩 Flexibilidad total: puedes añadir pasos intermedios (upscalers, LoRAs, ControlNet...)
- 💾 Workflows reusables: se guardan como JSON en los metadatos de la propia imagen generada
- 🖱️ Sin terminal: ideal si no te sientes cómodo con la línea de comandos
- 🌐 Ecosistema enorme: miles de nodos personalizados (custom nodes) creados por la comunidad
Aunque ComfyUI existe desde 2023 como webapp, la forma más sencilla de empezar hoy en día es utilizar ComfyUI Desktop, una aplicación oficial de escritorio simplificada que instala y gestiona todo de forma transparente.
2. Instalación
Antes de nada, revisa que tu equipo cumpla los requisitos mínimos:
| Detalle | Mínimo | Recomendado |
|---|---|---|
| 🎮 GPU | Cualquiera. Ideal CUDA, ROCm o con soporte de Vulkan | NVIDIA con, mínimo, 8GB VRAM |
| 🧠 RAM | 8 GB | 16-32 GB |
| 💾 Disco | 10 GB | mínimo 50 GB (los modelos ocupan mucho) |
| 🖥️ Sistema | Windows 10+, macOS 12+ o Linux | Windows 11 / Ubuntu |
Para instalar ComfyUI, descargamos ComfyUI Desktop desde la página oficial de descargas de comfy.org. Existe instalador para Windows, macOS y Linux. La aplicación se encarga de configurar el entorno de Python y las dependencias automáticamente, no necesitas instalar nada más.
Durante el primer arranque, el asistente te pedirá crear una nueva instancia:
- Marcamos Standalone: La opción Remote es para conectar a un ComfyUI de otra máquina.
- Marcamos
Stableen Release, y la versión recomendada en ComfyUI version para mayor estabilidad. - En Hardware marcamos la GPU que tenemos. CPU es la opción genérica, muy lenta, pero apta para cualquier dispositivo en el peor de los casos.
- Por último, en Install location marcamos la carpeta donde se instalará todo. Asegurate de tener varios GB libres disponibles.
Una vez hecho esto, sólo queda esperar a que descargue e instale todo, que dependerá de la potencia de tu equipo y la velocidad de conexión.
Si ya usabas
stablediffusion.cppy tienes modelos descargados, no hace falta duplicarlos: en el menú (Desktop Settings → Storage) puedes indicar rutas adicionales donde ComfyUI buscará modelos.
3. Interfaz
Al abrir la aplicación verás el canvas, un lienzo infinito donde se colocan los nodos y se conectan entre sí. Puedes partir de un lienzo en blanco o utilizar alguna plantilla (último botón abajo a la izquierda). Las tareas habituales para empezar son:
| Acción | Cómo hacerlo |
|---|---|
| ➕ Añadir un nodo | Doble clic en el lienzo y busca por nombre |
| 🔗 Conectar nodos | Arrastra desde un punto de salida hasta una entrada |
| 🎥 Mover el lienzo | Arrastra con el botón central o manteniendo la barra espaciadora |
| 🔍 Zoom | Rueda del ratón |
| ▶️ Generar | Botón Queue (o Ctrl + Enter) |
| ⏹️ Detener | Botón Cancel durante la generación |
Cada vez que pulsas Queue, ComfyUI añade el trabajo a la cola y lo ejecuta: carga los modelos (solo la primera vez, luego los mantiene en VRAM), recorre los nodos en orden y guarda la imagen en la carpeta output de tu base. El progreso se ve en el propio canvas, iluminando el nodo que se está ejecutando en cada momento.
Un nodo que aparece en rojo indica que falta un modelo o que hay una conexión sin completar. Si ves un borde rojo alrededor de un nodo, revisa qué fichero no ha encontrado o que ha fallado.
4. Modelos
Igual que vimos en modelos de edición, los componentes pueden venir todos juntos en un mismo fichero (los checkpoints clásicos de SD 1.5 o SDXL) o separados (modelos modernos como FLUX, Qwen Image o Z-Image). Básicamente siguen este esquema:
Cada tipo de componente tiene su propia carpeta dentro del directorio base de ComfyUI. Respeta esta estructura, porque es donde la aplicación busca los ficheros. Las carpetas más importantes son las siguientes (no las necesitamos todas para nuestros primeros ejemplos):
| Componente | Carpeta | Función |
|---|---|---|
| Checkpoint | models/checkpoints/ |
Modelo todo-en-uno (unet + text encoder + VAE) |
| Modelo de difusión | models/diffusion_models/ |
Solo el generador (FLUX, Qwen, Z-Image...) |
| Text encoder | models/text_encoders/ |
Traduce el prompt (CLIP, T5, Qwen2.5-VL...) |
| VAE | models/vae/ |
Codifica/decodifica la imagen |
| LoRA | models/loras/ |
Pequeños ajustes que modifican estilo o concepto |
| Upscaler | models/upscale_models/ |
Aumentan la resolución de la imagen |
| ControlNet | models/controlnet/ |
Guían la generación con poses, bordes, profundidad... |
| Embeddings | models/embeddings/ |
Conceptos preentrenados para usar en el prompt |
En ComfyUI, los ficheros
.safetensorsson el formato estándar, y los.ggufson versiones cuantizadas que ahorran VRAM. Para usar GGUF en ComfyUI necesitarás el custom node ComfyUI-GGUF del que hablamos más abajo.
5. Workflows
Nuestro primer workflow en ComfyUI será el clásico t2i: text-to-image. Consta de los siguientes nodos:
Vamos a ver la función de cada uno:
-
Load Checkpoint: carga el modelo de la carpeta
checkpointsque elijas y expone sus tres componentes: el modelo de difusión, el CLIP y el VAE. Es el nodo inicial del que parte todo. Para empezar, puedes descargar el checkpoint Juggernaut-XL de SDXL. -
CLIP Text Encode (x2): traduce el prompt a un lenguaje que entiende el modelo. Hay dos nodos: el positivo (lo que quieres ver) y el negativo (lo que quieres evitar).
-
Empty Latent Image: crea el lienzo vacío en formato latente con las dimensiones que indiques (por defecto
1024x1024). Cuanto más grande sea, más consumirá/tardará. Empieza con pruebas pequeñas. -
KSampler: el núcleo del sistema. Aquí se concentra el trabajo de generación:
Parámetro Función seedSemilla aleatoria. Fijándola genera siempre misma imagen. Con -1cambia en cada generación.stepsPasos de refinado. 20es un buen punto de partidacfgFidelidad al prompt. Entre 3.0y7.0según el modelosamplerAlgoritmo de muestreo. euleroeuler_ancestralpara empezarschedulerReparto del ruido. simpleokarrasfuncionan biendenoiseCuánto ruido se elimina. En text-to-image usa siempre 1.0Si estos conceptos te suenan, es porque son los mismos parámetros que usábamos con
sd-clien la guía de generación:--steps,--cfg-scale,--sampling-method... -
VAE Decode: convierte el resultado latente (salida del KSampler) en una imagen visible.
-
Save Image: guarda la imagen en la carpeta
outputcon un nombre personalizable.
Escribe tu prompt en el nodo positivo, pulsa Queue y espera un poco. ¡Ya habrás generado tu primera imagen!
6. Descargar modelos
Los dos repositorios de referencia para descargar modelos son:
-
Civitai: la mayor comunidad de modelos de imagen. Cada fichero indica su tipo (checkpoint, LoRA, VAE...) y su modelo base, para que sepas en qué carpeta colocarlo.
-
Hugging Face: donde publican los autores originales. Es la fuente habitual para modelos modernos y para las versiones GGUF.
Empieza con SDXL si tienes 8GB de VRAM (o menos). Si tu gráfica tiene más de 12 GB, los modelos modernos como Qwen Image o Z-Image ofrecen resultados espectaculares, y son los mismos que utilizamos en las guías de creación T2I y edición con
sd.cpp.
7. Ampliando ComfyUI
La comunidad amplía ComfyUI con custom nodes, paquetes que añaden nodos nuevos (soporte GGUF, ControlNet avanzado, generación de vídeo con WAN, integraciones...). En ComfyUI Desktop tienes el Manager integrado: desde la pestaña Custom Nodes puedes buscar, instalar y actualizar todo sin tocar la terminal.
Otra de las grandes ventajas del sistema de nodos es que, como comentamos anteriormente, las imágenes guardadas con ComfyUI incrustan el workflow en JSON dentro del PNG, por lo que puedes arrastrar cualquier imagen generada con ComfyUI al canvas y la composición se creará sola. Además, en Internet encontrarás miles de workflows listos para descargar y utilizar.
Si quieres seguir explorando, un buen punto de partida es probar a insertar un nodo LoRA Loader (entre checkpoint y sampler), o un Upscale Latent para generar imágenes a mayor resolución. ¡Investiga un poco!
Si quieres ampliar todo esto y verlo desde un punto de vista más profundo, te dejo un vídeo donde puedes ver el proceso completo más detallado y los primeros pasos con ComfyUI Desktop:

