Cambia tema

Creare video in ComfyUI con Wan e AnimateDiff

Easton editorial illustration: one large rounded charcoal node-canvas console, one orange video filmstrip emerging from the workflow

"Il tutorial ufficiale ComfyUI per Wan 2.2 include workflow text-to-video e image-to-video, posizioni dei modelli e opzioni di precisione."

Hai già creato in ComfyUI un’immagine statica convincente e ora vuoi animarla. Quando importi il workflow video, però, compaiono blocchi rossi Missing Nodes oppure la VRAM arriva subito al 99%. È meglio Wan o AnimateDiff? In quali cartelle vanno i modelli? Come bilanciare frames e memoria, e come trasformare una sequenza di immagini in mp4? Parti dal metodo, dalla lista di preparazione e da un budget prudente, poi diagnostica gli errori più comuni in ordine.

1. Scegliere tra Wan e AnimateDiff

Scegli il metodo prima di costruire il workflow. Wan e AnimateDiff sono sistemi diversi, con requisiti, impieghi e complessità differenti.

1.1 Wan: un modello video dedicato

Wan 2.2 è una famiglia aperta di modelli video che supporta text-to-video (T2V), image-to-video (I2V) e text-image-to-video (TI2V). Usa un’architettura mixture-of-experts e pesi, VAE e text encoder propri. Per alcuni workflow FP8, il tutorial ufficiale ComfyUI suggerisce di partire da oltre 16 GB di VRAM; le varianti nella precisione originale in genere richiedono di più. Wan serve per nuovi video e per esigenze maggiori di coerenza temporale.

L’ecosistema Wan è separato da un normale checkpoint SD. Devi quindi preparare tutti i file richiesti dal workflow, come diffusion model, VAE e text encoder. Un clip da due a quattro secondi è un buon primo test.

1.2 AnimateDiff: aggiungere movimento all’ecosistema SD

AnimateDiff aggiunge movimento a modelli Stable Diffusion compatibili, come SD 1.5 o SDXL. Il componente centrale è un motion module associato a un base checkpoint. La cartella può cambiare con AnimateDiff-Evolved, quindi segui il README attuale e l’elenco del nodo. Un workflow tipico carica checkpoint SD e motion module compatibile per creare una breve animazione.

AnimateDiff funziona bene se possiedi checkpoint di stile. Checkpoint e VAE possono essere riutilizzati, ma durata e coerenza dipendono da base model, motion module, context, frames e risoluzione.

1.3 Tabella di scelta Wan vs AnimateDiff

CriterioWan 2.2AnimateDiff
AttivitàText-to-video, image-to-video, text-image-to-videoAnimazione breve basata su un modello SD
EcosistemaModello video dedicatoSD 1.5/SDXL
Punto di partenza VRAMAlcuni workflow FP8 iniziano nella fascia 16 GB; la precisione originale richiede di piùDipende da base model, motion module e impostazioni; prova piccolo e breve
RequisitiWan diffusion model + VAE + text encoderCheckpoint SD + motion module
ImpiegoNuovo video e maggiore coerenzaModelli di stile esistenti e animazioni brevi
ComplessitàAlta: diversi modelli e nodiMedia: motion module più base checkpoint

Scegli Wan se vuoi un nuovo clip e puoi accettare una pila di modelli più grande. Scegli AnimateDiff se hai già un checkpoint SD compatibile, ti basta un’animazione breve o vuoi evitare un grande modello video dedicato.

2. Preparare il workflow Wan

Molti test Wan falliscono nella preparazione: modello nella cartella sbagliata, nodo assente o workflow per un’altra attività. Una verifica breve evita di correggere ogni errore dopo l’avvio della queue.

2.1 Preparare i file dei modelli

I file Wan devono trovarsi nelle posizioni attese. Cartella o nome errati spesso lasciano vuoto l’elenco dei modelli.

Cartelle comuni:

CartellaTipoNota
models/diffusion_models/Modello T2V/I2VVarianti 480P/720P e fp16/fp8
models/vae/VAE videoUsa il VAE indicato dal workflow Wan
models/clip_vision/Vision encoderRichiesto da alcuni workflow I2V
models/text_encoders/Text encoderUsa l’encoder indicato

Scegliere la precisione:

  • fp16: precisione originale e consumo VRAM maggiore
  • fp8: precisione inferiore che può ridurre la VRAM; misura con il workflow attuale e i log
  • bf16: solo se hardware e workflow sono compatibili

Wan cambia rapidamente. Controlla nomi esatti, link e varianti nel tutorial ufficiale corrente.

2.2 Installare i Custom Nodes

Un workflow video può dipendere da diversi node pack di terze parti. VideoHelperSuite è comune per importazione ed esportazione; AnimateDiff di solito richiede ComfyUI-AnimateDiff-Evolved.

Passaggi:

  1. Apri ComfyUI Manager e installa i nodi indicati; installa ComfyUI-VideoHelperSuite se serve VHS
  2. Installa ComfyUI-AnimateDiff-Evolved per AnimateDiff
  3. Controlla ffmpeg e dipendenze nel README attuale di VideoHelperSuite
  4. Riavvia ComfyUI

Controllare ffmpeg:

ffmpeg -version

Se appare una versione, ffmpeg è disponibile. Con command not found, usa winget install ffmpeg su Windows, sudo apt install ffmpeg su Linux o brew install ffmpeg su macOS.

2.3 Importare un template di workflow

Per il primo test usa un workflow T2V o I2V del tutorial ufficiale invece di costruire tutti i nodi.

Passaggi:

  1. Scarica il JSON Wan T2V o I2V dal tutorial ufficiale
  2. Trascina in ComfyUI il JSON o un’immagine con metadati
  3. Con Missing Nodes, cerca ogni nodo in Manager o installa manualmente il repository corretto

Ordine di diagnosi:

  1. Controlla in ComfyUI Manager che il node pack sia installato
  2. Cerca il nome esatto del nodo mancante
  3. Se Manager non lo trova, clona il repository corretto in custom_nodes/
  4. Riavvia ComfyUI

La guida al riuso dei workflow ComfyUI approfondisce importazione e Missing Nodes.

3. Eseguire Wan Text-to-Video

Con modelli e nodi pronti, avvia un workflow T2V minimo.

3.1 Nodi chiave del workflow

Un workflow Wan T2V copre in genere queste funzioni; i nomi esatti dipendono dal template ufficiale attuale:

  1. Model loaders: caricare Wan T2V diffusion model, VAE e text encoder
  2. Video latent node: impostare width, height e frames
  3. Text encoding: inserire prompt positivo e negativo
  4. Sampling: configurare steps, CFG, seed e opzioni correlate
  5. VAE Decode: decodificare i frames video
  6. VideoHelperSuite o equivalente: unire i frames in un file

Differenze rispetto a un’immagine statica:

  • Si imposta frames invece di una sola immagine
  • Si usa il VAE video compatibile
  • L’output spesso include sequenza e unione video

3.2 Scrivere il prompt video

Il prompt deve descrivere continuità temporale.

Punti chiave:

  • Descrivi movimenti concreti: camera (camera following, slow pan) e soggetto (walking, turning head)
  • Evita cambi di scena e mantieni un’unica azione continua
  • Distingui camera e soggetto: la prima cambia il punto di vista, il secondo il contenuto del frame

Esempi:

A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background

La guida ai prompt Stable Diffusion spiega la struttura di base.

3.3 Regolare frames, FPS e risoluzione

La relazione è:

ParametroSignificatoValori di test
framesNumero totale di frames16/24/48/72
FPSFrames riprodotti al secondo12/16/24/30
durationSecondi = frames / FPSCalcolare con la formula

Esempi:

  • 48 frames @ 16 FPS = 3 secondi
  • 72 frames @ 12 FPS = 6 secondi

La risoluzione deve corrispondere al modello e al workflow. I template comuni separano spesso 480P e 720P.

Più frames e risoluzione maggiore aumentano in genere il carico di sampling e VAE. La sezione 6 propone punti prudenti.

3.4 Esportare il video

Molti workflow Wan generano una sequenza e poi usano Video Combine di VideoHelperSuite o un nodo simile.

Impostazioni comuni:

  • frame_rate: FPS di riproduzione
  • format: mp4, gif, webp o altro formato supportato
  • output_path: posizione in base alla versione del nodo

Problemi comuni:

  • Manca ffmpeg o una dipendenza: segui il README e controlla ffmpeg -version
  • Nessun permesso di scrittura: cambia cartella
  • Encoder non supportato: salva prima i frames e scegli un formato compatibile

4. Eseguire Wan Image-to-Video

Image-to-video usa un’immagine statica come frame iniziale e genera movimento da quello stato.

4.1 Collegare il workflow I2V

Differenze principali tra I2V e T2V:

  1. Load Image: caricare un’immagine della dimensione prevista
  2. I2V model loader: caricare il modello Wan I2V, non la variante T2V
  3. CLIP Vision e text encoding: elaborare immagine e prompt secondo il workflow
  4. Sampling, VAE Decode e Video Combine: generare e salvare

I2V e T2V possono usare file e template diversi. Confronta ogni download con il template ufficiale.

4.2 Preparare l’immagine iniziale

L’input influenza molto i frames successivi.

Requisiti:

  • Adattare la dimensione al workflow
  • Usare un soggetto chiaro con bordi definiti
  • Evitare dettagli eccessivi; sfondo affollato e texture dense possono aumentare la deriva

L’immagine può provenire da ComfyUI o da una fonte esterna che hai diritto di usare.

4.3 Diagnosticare le impostazioni I2V

Un problema comune parte con un primo frame riconoscibile, poi volto e mani derivano, si deformano o sfarfallano.

Cause e soluzioni:

  • Prompt incompatibile: descrivere un movimento coerente con l’immagine
  • Immagine complessa: semplificare lo sfondo o creare un input più pulito
  • VRAM esaurita: ridurre frames, risoluzione o precisione
  • Movimento troppo ampio: ridurre motion o strength se disponibili

Prova una variante I2V o un seed diverso se il modello non si adatta allo stile.

5. Preparare un workflow AnimateDiff

AnimateDiff usa una pila diversa da Wan.

5.1 Preparare il Motion Module

Il motion module è il componente centrale. Poiché cartella e formati possono cambiare in AnimateDiff-Evolved, usa il README attuale, il workflow di esempio e l’elenco del nodo.

Verifica se è destinato a SD 1.5, SDXL o altra architettura e se coincide con base checkpoint e workflow. Riavvia ComfyUI dopo il download e conferma che appaia nel loader.

5.2 Scegliere il Base Checkpoint

AnimateDiff non sostituisce il modello base; aggiunge movimento a un modello di diffusione immagini compatibile.

Scelta:

  • Usa checkpoint SD 1.5 o SDXL compatibile con motion module e workflow
  • Prova checkpoint di stile con pochi frames
  • Non trattare un checkpoint normale come modello video completo

Consulta la guida alla scelta dei modelli Stable Diffusion.

5.3 Collegare il workflow

Un workflow AnimateDiff include in genere:

  1. Checkpoint Loader: caricare base checkpoint compatibile
  2. Motion Model Loader: caricare motion module o motion model
  3. Context Options: configurare context window
  4. Video latent node: impostare risoluzione e frames
  5. Text encoding, sampling, VAE Decode e unione video

Il rapporto tra frames e context length dipende dalla versione. Parti dai valori dell’esempio e modifica una sola impostazione.

6. Definire il budget di parametri e prestazioni

VRAM e durata sono i principali limiti locali. Questi valori sono punti iniziali, non garanzie GPU.

6.1 Matrice iniziale di VRAM, frames e risoluzione

VRAMInizio prudenteDa provareDa evitare all’inizio
8 GBAnimateDiff, bassa risoluzione, circa 16 frames, batch 1Workflow low-VRAM della communityWan ad alta risoluzione, clip lunghi, più branch
12 GBAnimateDiff breve e piccoloWan a bassa precisione, piccolo e con pochi framesClip 720P lunghi e post-produzione complessa
16 GBTest Wan FP8 breve secondo indicazioni ufficialiTemplate 480P o 720P corrispondentePiù branch simultanei e video lunghi
24 GB+Più margine per clip breviRisoluzione o frames maggioriBatch, VAE e post-produzione richiedono comunque limiti

Il requisito reale varia con versione, GPU, VAE, custom nodes e workflow. La tabella serve solo a scegliere il primo test.

6.2 Ridurre il carico in questo ordine

Se manca VRAM:

  1. Riduci frames, per esempio da 48 a 24 o 16
  2. Scendi da 720P a 480P o a una dimensione compatibile inferiore
  3. Mantieni batch a 1 e disattiva branch di controllo e post-produzione non necessari
  4. Se supportato, passa da fp16 a fp8 o precisione inferiore
  5. Prova tile spaziali e impostazioni temporali di VAEDecodeTiled o VAEEncodeTiled
  6. Usa --lowvram o un’opzione compatibile
  7. Disattiva preview e chiudi altre applicazioni GPU

Opzioni low-VRAM, cache e VAE tiled devono essere provati con versione e workflow correnti.

6.3 Bilanciare durata e qualità

Più lungo non significa migliore. I clip brevi sono più facili da controllare; quelli lunghi richiedono spesso movimenti ridotti e generazione a segmenti.

Rischi:

  • Sfarfallio: colore o luminosità cambiano tra frames
  • Deformazione: volto, mani o contorni derivano
  • Movimento debole: prompt o motion insufficiente

Per un video lungo, verifica un segmento breve e poi usa continuation, I2V o post-produzione compatibile. Raddoppiare frames non garantisce coerenza.

7. Capire output e salvataggio video

Molti workflow ComfyUI producono prima frames e li uniscono in seguito con VideoHelperSuite o un nodo simile.

7.1 Funzioni dei nodi VideoHelperSuite

FunzioneUsoImpostazioni comuni
Load VideoImportare video o sequenzaframe_count, frame_rate, width/height
Video CombineUnire framesframe_rate, format, output
Nodo Save VideoSalvare il fileformat, quality, save_output

Nomi, parametri e formati cambiano con l’estensione. Load Video importa un video esistente; Video Combine o equivalente converte i frames in un file.

7.2 Convertire FPS, frames e durata

La formula è:

duration (secondi) = frames / FPS

Esempi:

  • 48 frames @ 16 FPS = 3 secondi
  • 72 frames @ 12 FPS = 6 secondi

Scelte FPS:

FPSEffetto
12Gli stessi frames durano di più, ma il movimento può apparire scattoso
16Equilibrio tra durata e fluidità
24La sequenza viene riprodotta più velocemente e termina prima
30Servono più frames per mantenere la durata

FPS controlla la velocità ma non crea immagini intermedie. Un clip lungo richiede più frames o segmenti; maggiore fluidità può richiedere interpolazione.

7.3 Risolvere problemi di salvataggio

ProblemaSoluzione
Manca ffmpeg o una dipendenzaSegui il README e controlla ffmpeg -version
Cartella non scrivibileConcedi accesso o usa l’output predefinito
Encoder o formato non supportatoSalva i frames e scegli un formato compatibile
Nessun frame arriva al saverControlla latent, VAE Decode e collegamenti

8. Risolvere gli errori comuni

Un workflow video può fallire a più livelli. Controllali in ordine senza cambiare insieme impostazioni scollegate.

8.1 Risolvere Missing Nodes

Il workflow importato mostra blocchi rossi Missing Nodes.

Ordine:

  1. Controlla in ComfyUI Manager i node pack richiesti
  2. Cerca il nome esatto del nodo mancante
  3. Se non compare, clona il repository in custom_nodes/
  4. Riavvia ComfyUI

La guida al riuso dei workflow ComfyUI offre più dettagli.

8.2 Correggere i percorsi dei modelli

Una cartella errata spesso lascia vuoto l’elenco.

TipoCartella comune
Wan diffusion modelmodels/diffusion_models/
Wan VAEmodels/vae/
CLIP Visionmodels/clip_vision/
text encodermodels/text_encoders/
AnimateDiff motion moduleSegui README attuale ed elenco del nodo

Fai coincidere nome, attività, risoluzione e precisione con il workflow.

8.3 Risolvere OOM

L’esaurimento della VRAM è l’errore di risorse più comune.

Ordine:

  1. Riduci frames, risoluzione e precisione
  2. Mantieni batch a 1 e disattiva branch aggiuntivi
  3. Prova VAEDecodeTiled o temporal chunk
  4. Usa un’opzione compatibile come --lowvram
  5. Disattiva preview e chiudi altre applicazioni GPU

8.4 Correggere sfarfallio, deformazione o movimento debole

ProblemaCausa probabileRegolazione
SfarfallioBassa coerenza temporale o context/motion inadattoFissa seed, accorcia test e regola context o motion
DeformazioneImmagine complessa, movimento eccessivo o limite del modelloSemplifica input, riduci movimento o cambia modello
Movimento debolePrompt senza azione o motion bassoAggiungi azione concreta e regola motion gradualmente
Qualità bassaCheckpoint, motion module o VAE incompatibiliControlla la combinazione e torna al workflow di esempio

La guida ai prompt Stable Diffusion aiuta a strutturare le azioni.

8.5 Correggere VAE Decode bloccato

VAE Decode si blocca, è molto lento o raggiunge OOM.

Soluzioni:

  • Riduci frames e risoluzione
  • Prova VAEDecodeTiled con tile spaziali o temporal chunks
  • Verifica che il VAE corrisponda al workflow
  • Scarica di nuovo un modello danneggiato da una fonte affidabile e verificalo

8.6 Correggere la deriva I2V dopo il primo frame

È un caso frequente in I2V.

CausaRegolazione
Prompt incompatibile con l’immagineDescrivi un movimento coerente con l’input
Immagine iniziale troppo dettagliataSemplifica lo sfondo o crea un input più pulito
Movimento troppo grandeParti da subtle motion o slow camera push-in
Modello I2V inadatto allo stileProva altra variante, workflow o seed

9. Continuare con controllo, post-produzione e automazione

Quando il primo workflow è stabile, scegli il passo successivo in base al limite realmente incontrato.

9.1 Guide correlate della serie

Questo è il capitolo video della serie pratica ComfyUI e Stable Diffusion. Consulta questi prerequisiti quando necessario:

Altri articoli trattano low-VRAM, riparazione frame per frame, automazione API e conflitti di versione. Stabilizza un workflow breve prima di aggiungere livelli.

9.2 Documentazione ufficiale e progetti

Parti dalle fonti ufficiali:

9.3 Licenze e uso commerciale

Controlla la licenza attuale di ogni modello:

Prima dell’uso commerciale, verifica:

  • Se la licenza consente l’uso commerciale
  • Se possiedi i diritti sul materiale, soprattutto sull’immagine iniziale I2V
  • Come si applicano i diritti del contenuto generato al progetto e alla piattaforma

Questo testo non è una consulenza legale. Fa fede la licenza corrente del repository.

Conclusione

Wan e AnimateDiff coprono workflow video ComfyUI diversi. Wan crea video da testo o immagine iniziale; AnimateDiff riutilizza checkpoint compatibili per animazioni brevi. Cartelle, versioni dei nodi e template devono corrispondere al workflow reale. La matrice è un inizio prudente, non una garanzia GPU. Se mancano risorse, riduci frames, risoluzione, branch, precisione e carico VAE in quest’ordine.

Per Missing Nodes, percorsi, OOM, sfarfallio, deformazione, VAE Decode bloccato o esportazione fallita, procedi per livelli. Inizia con pochi frames, risoluzione bassa e batch 1, valida l’intera catena e aumenta una sola variabile per test.

Eseguire il primo workflow video breve in ComfyUI

Verifica l’intera catena, dalla scelta del metodo e dei modelli al test minimo e all’esportazione.

  1. 1

    Step 1: Verificare il workflow di base

    Controlla che ComfyUI generi immagini statiche in modo stabile e che tu sappia importare un workflow, riconoscere i nodi mancanti e verificare i percorsi.
  2. 2

    Step 2: Scegliere il metodo video

    Usa Wan T2V per il testo, Wan I2V per un’immagine iniziale o AnimateDiff per riutilizzare un checkpoint SD.
  3. 3

    Step 3: Preparare i modelli

    Segui workflow e documentazione ufficiale per ottenere diffusion model, VAE, text encoder, CLIP Vision o motion module.
  4. 4

    Step 4: Installare i nodi richiesti

    Installa i custom nodes con ComfyUI Manager e prepara un’estensione di esportazione come VideoHelperSuite.
  5. 5

    Step 5: Avviare un test minimo

    Parti con pochi frames, risoluzione ridotta e batch 1, senza ControlNet, upscale o post-produzione complessa.
  6. 6

    Step 6: Unire e salvare il video

    Dopo la generazione dei frames, imposta frame rate e formato ed esporta con Video Combine, Save Video o un nodo equivalente.
  7. 7

    Step 7: Aumentare una variabile alla volta

    Fissa il seed e modifica un solo valore per test; con OOM, sfarfallio o deriva, riduci frames, risoluzione, precisione e carico VAE.

FAQ

Conviene iniziare con Wan o AnimateDiff per i video ComfyUI?
Scegli Wan per creare un video nuovo da testo o immagine. Scegli AnimateDiff se possiedi già checkpoint SD, LoRA e risorse di stile e vuoi un’animazione breve.
Qual è la differenza tra frames e FPS in ComfyUI?
Frames è il numero totale di immagini generate; FPS indica quante vengono riprodotte ogni secondo. La durata si calcola dividendo frames per FPS.
Perché ComfyUI produce immagini invece di un file mp4?
Molti workflow creano prima i frames e poi usano VideoHelperSuite, Video Combine o un nodo simile per generare mp4, gif o webp.
Si possono generare video ComfyUI con 8 GB di VRAM?
Puoi provare AnimateDiff a bassa risoluzione e con pochi frames oppure workflow low-VRAM della community. Precisione, VAE, custom nodes, backend GPU e workflow cambiano il risultato; un video Wan lungo e ad alta risoluzione non è garantito.
Perché image-to-video si allontana dall’immagine iniziale?
L’immagine iniziale non blocca tutto il clip. Movimento ampio, input complesso e più frames aumentano le variazioni di volti, mani, vestiti e sfondi.
Cosa fare se la generazione si blocca su VAE Decode?
Riduci prima frames e risoluzione, quindi prova tile spaziali o temporal chunks in VAEDecodeTiled. Controlla poi il VAE e applica impostazioni low-VRAM.

14 min di lettura · Pubblicato il: 23 lug 2026 · Aggiornato il: 24 lug 2026

Commenti

Accedi con GitHub per lasciare un commento

Easton BlogEaston Blog