Cambiar tema

Crear videos en ComfyUI con Wan y AnimateDiff

Easton editorial illustration: one large rounded charcoal node-canvas console, one orange video filmstrip emerging from the workflow

"El tutorial oficial de ComfyUI para Wan 2.2 incluye workflows text-to-video e image-to-video, ubicaciones de modelos y opciones de precisión."

Ya puedes crear en ComfyUI una imagen fija que te convence y ahora quieres darle movimiento. Al importar el workflow de video, aparecen bloques rojos de Missing Nodes o el uso de VRAM sube de inmediato al 99 %. ¿Debes elegir Wan o AnimateDiff? ¿En qué carpetas van los modelos? ¿Cómo equilibras frames y memoria, y cómo conviertes una secuencia de imágenes en mp4? Empieza por la ruta, la lista de preparación y un presupuesto conservador, y luego revisa los fallos más comunes en orden.

1. Elegir entre Wan y AnimateDiff

Elige la ruta antes de construir el workflow. Wan y AnimateDiff son sistemas distintos, con requisitos, casos de uso y niveles de complejidad diferentes.

1.1 Wan: una ruta de modelo de video dedicado

Wan 2.2 es una familia abierta de modelos de video compatible con text-to-video (T2V), image-to-video (I2V) y text-image-to-video (TI2V). Usa una arquitectura mixture-of-experts y sus propios pesos, VAE y text encoder. Para algunos workflows FP8, el tutorial oficial de ComfyUI sugiere partir de más de 16 GB de VRAM; las variantes con precisión original suelen exigir más. Wan se adapta a videos nuevos y a una mayor necesidad de coherencia temporal.

El ecosistema Wan está separado de un checkpoint SD normal. Debes reunir todos los archivos que exige el workflow, como diffusion model, VAE y text encoder. Para la primera prueba, un clip de dos a cuatro segundos es un punto razonable.

1.2 AnimateDiff: añadir movimiento al ecosistema SD

AnimateDiff añade movimiento a modelos Stable Diffusion compatibles, como SD 1.5 o SDXL. Su componente central es un motion module que funciona junto a un base checkpoint. Como la carpeta puede cambiar con AnimateDiff-Evolved, sigue el README actual y la lista del node. Un workflow típico carga un checkpoint SD y un motion module compatible para crear una animación corta.

AnimateDiff encaja cuando ya tienes checkpoints de estilo. Puedes reutilizar checkpoint y VAE, pero la duración y la consistencia dependen de base model, motion module, context, frames y resolución.

1.3 Tabla de decisión Wan vs AnimateDiff

CriterioWan 2.2AnimateDiff
TareaText-to-video, image-to-video, text-image-to-videoAnimación corta basada en un modelo SD
EcosistemaModelo de video dedicadoSD 1.5/SDXL
Punto de partida de VRAMAlgunos workflows FP8 parten de la clase de 16 GB; la precisión original necesita másDepende de base model, motion module y ajustes; prueba pequeño y corto
RequisitosWan diffusion model + VAE + text encoderCheckpoint SD + motion module
Uso adecuadoVideo nuevo y mayor necesidad de consistenciaModelos de estilo existentes y animaciones cortas
ComplejidadAlta: varios modelos y nodesMedia: motion module más base checkpoint

Elige Wan si quieres un clip nuevo y aceptas una pila de modelos mayor. Elige AnimateDiff si ya tienes un checkpoint SD compatible, necesitas una animación corta o prefieres evitar un gran modelo de video dedicado.

2. Preparar el workflow de Wan

Muchos intentos de Wan fallan durante la preparación: modelo en la carpeta equivocada, node ausente o workflow para otra tarea. Una revisión breve evita buscar cada error después de iniciar la queue.

2.1 Preparar los archivos de modelo

Los archivos de Wan deben estar en las ubicaciones esperadas. Una carpeta o un nombre incorrectos suelen dejar vacía la lista de modelos.

Carpetas habituales:

CarpetaTipo de archivoNota
models/diffusion_models/Modelo T2V/I2VVariantes 480P/720P y fp16/fp8
models/vae/VAE de videoUsa el VAE indicado por el workflow Wan
models/clip_vision/Vision encoderNecesario para algunos workflows I2V
models/text_encoders/Text encoderUsa el encoder indicado

Elegir precisión:

  • fp16: precisión original y mayor consumo de VRAM
  • fp8: menor precisión que puede reducir VRAM; mide el requisito con el workflow actual y tus logs
  • bf16: solo si hardware y workflow son compatibles

Wan cambia con rapidez. Revisa nombres exactos, enlaces y variantes en el tutorial oficial vigente.

2.2 Instalar Custom Nodes

Un workflow de video puede depender de varios node packs de terceros. VideoHelperSuite se usa con frecuencia para importar y exportar; AnimateDiff suele requerir ComfyUI-AnimateDiff-Evolved.

Pasos:

  1. Abre ComfyUI Manager e instala los nodes indicados; instala ComfyUI-VideoHelperSuite si se requiere VHS
  2. Instala ComfyUI-AnimateDiff-Evolved para AnimateDiff
  3. Comprueba ffmpeg y las dependencias en el README actual de VideoHelperSuite
  4. Reinicia ComfyUI

Comprobar ffmpeg:

ffmpeg -version

Si muestra una versión, ffmpeg está disponible. Si aparece command not found, usa winget install ffmpeg en Windows, sudo apt install ffmpeg en Linux o brew install ffmpeg en macOS.

2.3 Importar una plantilla de workflow

Para la primera prueba, utiliza un workflow T2V o I2V del tutorial oficial en lugar de montar cada node desde cero.

Pasos:

  1. Descarga el JSON de Wan T2V o I2V desde el tutorial oficial
  2. Arrastra a ComfyUI el JSON o una imagen de ejemplo con metadatos
  3. Ante Missing Nodes, busca cada node en Manager o instala manualmente el repositorio correcto

Orden de diagnóstico:

  1. Comprueba en ComfyUI Manager que el node pack está instalado
  2. Busca el nombre exacto del node ausente
  3. Si Manager no lo encuentra, clona el repositorio correcto en custom_nodes/
  4. Reinicia ComfyUI

La guía para reutilizar workflows de ComfyUI explica la importación y Missing Nodes con más detalle.

3. Ejecutar Wan Text-to-Video

Con modelos y nodes listos, lanza un workflow T2V mínimo.

3.1 Nodes clave del workflow

Un workflow Wan T2V suele cubrir estas responsabilidades; los nombres exactos dependen de la plantilla oficial actual:

  1. Model loaders: cargar Wan T2V diffusion model, VAE y text encoder
  2. Video latent node: definir width, height y frames
  3. Text encoding: introducir prompts positivo y negativo
  4. Sampling: configurar steps, CFG, seed y opciones relacionadas
  5. VAE Decode: decodificar frames de video
  6. VideoHelperSuite o equivalente: combinar frames en un archivo

Diferencias respecto a una imagen fija:

  • Se configura frames en lugar de una imagen única
  • Se usa el VAE de video compatible
  • La salida suele incluir secuencia y etapa de combinación

3.2 Escribir el prompt de video

El prompt debe describir continuidad temporal.

Puntos clave:

  • Describe movimiento concreto: cámara (camera following, slow pan) y sujeto (walking, turning head)
  • Evita cambios de escena: mantén una sola acción continua
  • Separa cámara y sujeto: la primera cambia el punto de vista; el segundo cambia el contenido del cuadro

Ejemplos:

A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background

La guía de prompts de Stable Diffusion explica la estructura base.

3.3 Ajustar frames, FPS y resolución

La relación es:

ParámetroSignificadoValores de prueba
framesNúmero total de frames16/24/48/72
FPSFrames reproducidos por segundo12/16/24/30
durationSegundos = frames / FPSCalcular con la fórmula

Ejemplos:

  • 48 frames @ 16 FPS = 3 segundos
  • 72 frames @ 12 FPS = 6 segundos

La resolución debe corresponder al modelo y workflow. Las plantillas comunes suelen separar rutas 480P y 720P.

Más frames y mayor resolución aumentan normalmente la carga de sampling y VAE. La sección 6 ofrece puntos de partida prudentes.

3.4 Exportar el video

Muchos workflows Wan generan una secuencia y luego usan Video Combine de VideoHelperSuite o un node similar.

Ajustes frecuentes:

  • frame_rate: FPS de reproducción
  • format: mp4, gif, webp u otro formato compatible
  • output_path: ubicación de salida según la versión del node

Fallos habituales:

  • Falta ffmpeg o una dependencia: sigue el README y revisa ffmpeg -version
  • Sin permisos de escritura: cambia la carpeta
  • Encoder incompatible: guarda primero los frames y elige un formato compatible

4. Ejecutar Wan Image-to-Video

Image-to-video utiliza una imagen fija como frame inicial y genera movimiento desde ese estado.

4.1 Conectar el workflow I2V

Diferencias principales entre I2V y T2V:

  1. Load Image: cargar una imagen del tamaño esperado
  2. I2V model loader: cargar el modelo Wan I2V correspondiente, no la variante T2V
  3. CLIP Vision y text encoding: procesar imagen y prompt según el workflow
  4. Sampling, VAE Decode y Video Combine: generar y guardar

I2V y T2V pueden usar archivos y plantillas diferentes. Compara cada descarga con la plantilla oficial.

4.2 Preparar la imagen inicial

La entrada influye mucho en los frames posteriores.

Requisitos:

  • Ajustar el tamaño al workflow
  • Usar un sujeto claro con bordes definidos
  • Evitar exceso de detalle; un fondo cargado o texturas densas pueden aumentar la deriva

La imagen puede venir de ComfyUI o de una fuente externa que tengas derecho a usar.

4.3 Diagnosticar ajustes I2V

Un fallo común empieza con una primera imagen reconocible y después aparecen deriva, deformación o parpadeo en cara y manos.

Causas y correcciones:

  • Prompt incompatible: describe un movimiento lógico para la imagen
  • Imagen demasiado compleja: simplifica el fondo o crea una entrada más limpia
  • VRAM saturada: reduce frames, resolución o precisión
  • Movimiento excesivo: baja motion o strength si el workflow lo ofrece

Prueba otra variante I2V o seed si el modelo no encaja con el estilo.

5. Preparar un workflow AnimateDiff

AnimateDiff utiliza una pila distinta de Wan.

5.1 Preparar el Motion Module

El motion module es el componente central. Como carpeta y formatos pueden cambiar con AnimateDiff-Evolved, toma como referencia el README actual, el workflow de ejemplo y la lista del node.

Comprueba si está destinado a SD 1.5, SDXL u otra arquitectura y si coincide con base checkpoint y workflow. Reinicia ComfyUI tras descargarlo y verifica que aparece en el loader.

5.2 Elegir el Base Checkpoint

AnimateDiff no reemplaza el modelo base; añade movimiento a un modelo de difusión de imagen compatible.

Selección:

  • Usa un checkpoint SD 1.5 o SDXL compatible con motion module y workflow
  • Prueba checkpoints de estilo existentes con pocos frames
  • No trates un checkpoint normal como modelo de video completo

Consulta la guía para elegir modelos Stable Diffusion.

5.3 Conectar el workflow

Un workflow AnimateDiff suele incluir:

  1. Checkpoint Loader: cargar base checkpoint compatible
  2. Motion Model Loader: cargar motion module o motion model
  3. Context Options: configurar la ventana de contexto
  4. Video latent node: definir resolución y frames
  5. Text encoding, sampling, VAE Decode y combinación de video

La relación entre frames y context length depende de la versión. Empieza con los valores del ejemplo y cambia un ajuste cada vez.

6. Definir un presupuesto de parámetros y rendimiento

VRAM y duración son los principales límites locales. Estos valores son puntos de partida, no garantías de GPU.

6.1 Matriz inicial de VRAM, frames y resolución

VRAMInicio prudenteSe puede probarEvitar al principio
8 GBAnimateDiff, resolución baja, unos 16 frames, batch 1Workflows low-VRAM comunitariosWan en alta resolución, clips largos, varias ramas
12 GBAnimateDiff corto y pequeñoWan de baja precisión, tamaño pequeño y pocos framesClips 720P largos y posprocesado complejo
16 GBPrueba Wan FP8 corta según indicaciones oficialesPlantilla 480P o 720P correspondienteVarias ramas simultáneas y videos largos
24 GB+Más margen para clips cortosMayor resolución o framesBatch, VAE y posprocesado siguen necesitando límites

El requisito real varía con versión, GPU, VAE, custom nodes y workflow. La tabla solo sirve para elegir la primera prueba.

6.2 Reducir la carga en este orden

Si falta VRAM:

  1. Reduce frames, por ejemplo de 48 a 24 o 16
  2. Baja de 720P a 480P o a otro tamaño compatible
  3. Mantén batch en 1 y desactiva ramas de control y posprocesado innecesarias
  4. Si es compatible, cambia de fp16 a fp8 u otra precisión inferior
  5. Prueba tiles espaciales y ajustes temporales de VAEDecodeTiled o VAEEncodeTiled
  6. Usa --lowvram u otra opción compatible
  7. Desactiva preview y cierra otras aplicaciones de GPU

Opciones low-VRAM, cache y VAE tiled deben probarse con la versión y el workflow actuales.

6.3 Equilibrar duración y calidad

Más largo no significa mejor. Los clips cortos son más fáciles de controlar; los largos suelen requerir movimiento menor y generación por segmentos.

Riesgos:

  • Parpadeo: cambian color o brillo entre frames
  • Deformación: derivan cara, manos o contornos
  • Movimiento débil: prompt o ajuste motion insuficiente

Para un video largo, valida un segmento corto y después usa continuation, I2V o posproducción compatible. Duplicar frames no garantiza consistencia.

7. Entender la salida y el guardado de video

Muchos workflows de ComfyUI producen primero frames y los combinan después mediante VideoHelperSuite o un node similar.

7.1 Funciones de los nodes VideoHelperSuite

FunciónUsoAjustes frecuentes
Load VideoImportar video o secuenciaframe_count, frame_rate, width/height
Video CombineCombinar framesframe_rate, format, salida
Node Save VideoGuardar el archivoformat, quality, save_output

Nombres, parámetros y formatos cambian con la extensión. Load Video importa un video existente; Video Combine o equivalente convierte los frames en archivo.

7.2 Convertir FPS, frames y duración

La fórmula es:

duration (segundos) = frames / FPS

Ejemplos:

  • 48 frames @ 16 FPS = 3 segundos
  • 72 frames @ 12 FPS = 6 segundos

Opciones de FPS:

FPSEfecto
12Los mismos frames duran más, pero el movimiento puede verse entrecortado
16Equilibrio entre duración y fluidez
24La secuencia se reproduce más rápido y termina antes
30Se necesitan más frames para mantener la duración

FPS controla la velocidad, pero no crea imágenes intermedias. Un clip más largo requiere más frames o segmentos; mayor fluidez puede exigir interpolación.

7.3 Corregir fallos de guardado

FalloCorrección
Falta ffmpeg o dependenciaSigue el README y revisa ffmpeg -version
Carpeta sin permisosDa acceso de escritura o usa la salida predeterminada
Encoder o formato incompatibleGuarda frames y elige un formato compatible
No llegan frames al saverRevisa latent, VAE Decode y conexiones de salida

8. Resolver errores comunes

Un workflow de video puede fallar en varios niveles. Revísalos en orden sin cambiar ajustes inconexos a la vez.

8.1 Resolver Missing Nodes

El workflow importado muestra bloques rojos Missing Nodes.

Orden:

  1. Comprueba en ComfyUI Manager los node packs necesarios
  2. Busca el nombre exacto del node ausente
  3. Si Manager no lo encuentra, clona el repositorio en custom_nodes/
  4. Reinicia ComfyUI

La guía para reutilizar workflows de ComfyUI ofrece más detalle.

8.2 Corregir rutas de modelos

Una carpeta incorrecta suele dejar la lista vacía.

TipoCarpeta habitual
Wan diffusion modelmodels/diffusion_models/
Wan VAEmodels/vae/
CLIP Visionmodels/clip_vision/
text encodermodels/text_encoders/
AnimateDiff motion moduleSigue el README actual y la lista del node

Haz coincidir nombre, tarea, resolución y precisión con el workflow.

8.3 Resolver OOM

Agotar VRAM es el error de recursos más común.

Orden:

  1. Reduce frames, resolución y precisión
  2. Mantén batch en 1 y corta ramas extra
  3. Prueba VAEDecodeTiled o temporal chunk
  4. Usa una opción compatible como --lowvram
  5. Desactiva preview y cierra otras aplicaciones GPU

8.4 Corregir parpadeo, deformación o movimiento débil

ProblemaCausa probableAjuste
ParpadeoCoherencia temporal baja o context/motion inadecuadoFija seed, acorta la prueba y ajusta context o motion
DeformaciónImagen compleja, movimiento excesivo o límite del modeloSimplifica la entrada, reduce movimiento o cambia de modelo
Movimiento débilPrompt sin acción o motion bajoAñade una acción concreta y ajusta motion gradualmente
Calidad bajaCheckpoint, motion module o VAE incompatiblesRevisa la combinación y vuelve al workflow de ejemplo

La guía de prompts Stable Diffusion ayuda a estructurar las acciones.

8.5 Corregir VAE Decode bloqueado

VAE Decode se bloquea, funciona muy lento o llega a OOM.

Soluciones:

  • Reduce frames y resolución
  • Prueba VAEDecodeTiled con tiles espaciales o temporal chunks
  • Verifica que el VAE corresponde al workflow
  • Vuelve a descargar un modelo dañado desde una fuente fiable y compruébalo

8.6 Corregir deriva I2V tras el primer frame

Es un patrón frecuente en I2V.

CausaAjuste
Prompt incompatible con la imagenDescribe un movimiento coherente con la entrada
Imagen inicial demasiado detalladaSimplifica el fondo o crea una entrada más limpia
Movimiento demasiado grandeEmpieza con subtle motion o slow camera push-in
Modelo I2V inadecuado para el estiloPrueba otra variante, workflow o seed

9. Continuar con control, posprocesado y automatización

Cuando el primer workflow sea estable, elige el siguiente paso según el límite real que hayas encontrado.

9.1 Guías relacionadas de la serie

Este es el capítulo de video de la serie práctica ComfyUI y Stable Diffusion. Consulta estos requisitos cuando sea necesario:

Otros artículos cubren low-VRAM, reparación frame a frame, automatización API y conflictos de versiones. Estabiliza un workflow corto antes de añadir capas.

9.2 Documentación oficial y proyectos

Empieza por fuentes oficiales:

9.3 Licencias y uso comercial

Comprueba la licencia actual de cada modelo:

Antes del uso comercial, verifica:

  • Si la licencia permite uso comercial
  • Si tienes derechos sobre el material, sobre todo la imagen inicial I2V
  • Cómo se aplican los derechos del contenido generado al proyecto y la plataforma

Esto no es asesoría legal. La licencia actual del repositorio es la referencia.

Conclusión

Wan y AnimateDiff cubren workflows de video ComfyUI distintos. Wan crea video desde texto o imagen inicial; AnimateDiff reutiliza checkpoints compatibles para animaciones cortas. Carpetas, versiones de nodes y plantillas deben coincidir con el workflow real. La matriz es un comienzo prudente, no una garantía de GPU. Si faltan recursos, reduce frames, resolución, ramas, precisión y carga del VAE en ese orden.

Para Missing Nodes, rutas de modelos, OOM, parpadeo, deformación, VAE Decode bloqueado o fallos de exportación, diagnostica capa por capa. Empieza con pocos frames, resolución baja y batch 1, valida toda la cadena y aumenta una sola variable por prueba.

Ejecutar el primer workflow de video corto en ComfyUI

Valida toda la cadena, desde la elección de la ruta y los modelos hasta una prueba mínima y la exportación.

  1. 1

    Step 1: Comprobar el workflow básico

    Confirma que ComfyUI genera imágenes fijas de forma estable y que puedes importar un workflow, identificar nodes ausentes y revisar rutas de modelos.
  2. 2

    Step 2: Elegir la ruta de video

    Usa Wan T2V para texto, Wan I2V para una imagen inicial o AnimateDiff si necesitas reutilizar un checkpoint SD.
  3. 3

    Step 3: Preparar los modelos

    Sigue el workflow y la documentación oficial para obtener diffusion model, VAE, text encoder, CLIP Vision o motion module.
  4. 4

    Step 4: Instalar los nodes necesarios

    Instala los custom nodes desde ComfyUI Manager y prepara una extensión de exportación como VideoHelperSuite.
  5. 5

    Step 5: Ejecutar una prueba mínima

    Empieza con pocos frames, resolución baja y batch 1, sin ControlNet, upscale ni posprocesado complejo.
  6. 6

    Step 6: Combinar y guardar el video

    Cuando se generen los frames, configura frame rate y formato, y exporta con Video Combine, Save Video o un node equivalente.
  7. 7

    Step 7: Aumentar una variable cada vez

    Fija el seed y cambia un solo valor por prueba; ante OOM, parpadeo o deriva, retrocede en frames, resolución, precisión y VAE.

FAQ

¿Conviene empezar con Wan o AnimateDiff para video en ComfyUI?
Wan sirve para crear un video nuevo desde texto o imagen. AnimateDiff es una buena opción si ya tienes checkpoints SD, LoRA y recursos de estilo y buscas una animación corta.
¿Cuál es la diferencia entre frames y FPS en ComfyUI?
Frames es el número total de imágenes generadas; FPS indica cuántas se reproducen por segundo. La duración se obtiene dividiendo frames entre FPS.
¿Por qué ComfyUI entrega imágenes en vez de un archivo mp4?
Muchos workflows crean primero los frames y luego usan VideoHelperSuite, Video Combine o un node similar para generar mp4, gif o webp.
¿Se puede generar video en ComfyUI con 8 GB de VRAM?
Puedes probar AnimateDiff con resolución baja y pocos frames o workflows low-VRAM comunitarios. El resultado depende de precisión, VAE, custom nodes, backend de GPU y workflow; no se puede prometer un video Wan largo y de alta resolución.
¿Por qué image-to-video se aleja de la imagen inicial?
Una imagen inicial no fija todo el clip. Un movimiento amplio, una entrada compleja y más frames aumentan los cambios en caras, manos, ropa y fondos.
¿Qué hago si la generación se bloquea en VAE Decode?
Reduce primero frames y resolución. Después prueba tiles espaciales o temporal chunks de VAEDecodeTiled, verifica el VAE y aplica ajustes low-VRAM.

15 min de lectura · Publicado el: 23 jul 2026 · Actualizado el: 24 jul 2026

Comentarios

Inicia sesión con GitHub para dejar un comentario

Easton BlogEaston Blog