Creare video in ComfyUI con Wan e AnimateDiff

"Il tutorial ufficiale ComfyUI per Wan 2.2 include workflow text-to-video e image-to-video, posizioni dei modelli e opzioni di precisione."
Hai già creato in ComfyUI un’immagine statica convincente e ora vuoi animarla. Quando importi il workflow video, però, compaiono blocchi rossi Missing Nodes oppure la VRAM arriva subito al 99%. È meglio Wan o AnimateDiff? In quali cartelle vanno i modelli? Come bilanciare frames e memoria, e come trasformare una sequenza di immagini in mp4? Parti dal metodo, dalla lista di preparazione e da un budget prudente, poi diagnostica gli errori più comuni in ordine.
1. Scegliere tra Wan e AnimateDiff
Scegli il metodo prima di costruire il workflow. Wan e AnimateDiff sono sistemi diversi, con requisiti, impieghi e complessità differenti.
1.1 Wan: un modello video dedicato
Wan 2.2 è una famiglia aperta di modelli video che supporta text-to-video (T2V), image-to-video (I2V) e text-image-to-video (TI2V). Usa un’architettura mixture-of-experts e pesi, VAE e text encoder propri. Per alcuni workflow FP8, il tutorial ufficiale ComfyUI suggerisce di partire da oltre 16 GB di VRAM; le varianti nella precisione originale in genere richiedono di più. Wan serve per nuovi video e per esigenze maggiori di coerenza temporale.
L’ecosistema Wan è separato da un normale checkpoint SD. Devi quindi preparare tutti i file richiesti dal workflow, come diffusion model, VAE e text encoder. Un clip da due a quattro secondi è un buon primo test.
1.2 AnimateDiff: aggiungere movimento all’ecosistema SD
AnimateDiff aggiunge movimento a modelli Stable Diffusion compatibili, come SD 1.5 o SDXL. Il componente centrale è un motion module associato a un base checkpoint. La cartella può cambiare con AnimateDiff-Evolved, quindi segui il README attuale e l’elenco del nodo. Un workflow tipico carica checkpoint SD e motion module compatibile per creare una breve animazione.
AnimateDiff funziona bene se possiedi checkpoint di stile. Checkpoint e VAE possono essere riutilizzati, ma durata e coerenza dipendono da base model, motion module, context, frames e risoluzione.
1.3 Tabella di scelta Wan vs AnimateDiff
| Criterio | Wan 2.2 | AnimateDiff |
|---|---|---|
| Attività | Text-to-video, image-to-video, text-image-to-video | Animazione breve basata su un modello SD |
| Ecosistema | Modello video dedicato | SD 1.5/SDXL |
| Punto di partenza VRAM | Alcuni workflow FP8 iniziano nella fascia 16 GB; la precisione originale richiede di più | Dipende da base model, motion module e impostazioni; prova piccolo e breve |
| Requisiti | Wan diffusion model + VAE + text encoder | Checkpoint SD + motion module |
| Impiego | Nuovo video e maggiore coerenza | Modelli di stile esistenti e animazioni brevi |
| Complessità | Alta: diversi modelli e nodi | Media: motion module più base checkpoint |
Scegli Wan se vuoi un nuovo clip e puoi accettare una pila di modelli più grande. Scegli AnimateDiff se hai già un checkpoint SD compatibile, ti basta un’animazione breve o vuoi evitare un grande modello video dedicato.
2. Preparare il workflow Wan
Molti test Wan falliscono nella preparazione: modello nella cartella sbagliata, nodo assente o workflow per un’altra attività. Una verifica breve evita di correggere ogni errore dopo l’avvio della queue.
2.1 Preparare i file dei modelli
I file Wan devono trovarsi nelle posizioni attese. Cartella o nome errati spesso lasciano vuoto l’elenco dei modelli.
Cartelle comuni:
| Cartella | Tipo | Nota |
|---|---|---|
models/diffusion_models/ | Modello T2V/I2V | Varianti 480P/720P e fp16/fp8 |
models/vae/ | VAE video | Usa il VAE indicato dal workflow Wan |
models/clip_vision/ | Vision encoder | Richiesto da alcuni workflow I2V |
models/text_encoders/ | Text encoder | Usa l’encoder indicato |
Scegliere la precisione:
- fp16: precisione originale e consumo VRAM maggiore
- fp8: precisione inferiore che può ridurre la VRAM; misura con il workflow attuale e i log
- bf16: solo se hardware e workflow sono compatibili
Wan cambia rapidamente. Controlla nomi esatti, link e varianti nel tutorial ufficiale corrente.
2.2 Installare i Custom Nodes
Un workflow video può dipendere da diversi node pack di terze parti. VideoHelperSuite è comune per importazione ed esportazione; AnimateDiff di solito richiede ComfyUI-AnimateDiff-Evolved.
Passaggi:
- Apri ComfyUI Manager e installa i nodi indicati; installa
ComfyUI-VideoHelperSuitese serve VHS - Installa
ComfyUI-AnimateDiff-Evolvedper AnimateDiff - Controlla ffmpeg e dipendenze nel README attuale di VideoHelperSuite
- Riavvia ComfyUI
Controllare ffmpeg:
ffmpeg -version
Se appare una versione, ffmpeg è disponibile. Con command not found, usa winget install ffmpeg su Windows, sudo apt install ffmpeg su Linux o brew install ffmpeg su macOS.
2.3 Importare un template di workflow
Per il primo test usa un workflow T2V o I2V del tutorial ufficiale invece di costruire tutti i nodi.
Passaggi:
- Scarica il JSON Wan T2V o I2V dal tutorial ufficiale
- Trascina in ComfyUI il JSON o un’immagine con metadati
- Con Missing Nodes, cerca ogni nodo in Manager o installa manualmente il repository corretto
Ordine di diagnosi:
- Controlla in ComfyUI Manager che il node pack sia installato
- Cerca il nome esatto del nodo mancante
- Se Manager non lo trova, clona il repository corretto in
custom_nodes/ - Riavvia ComfyUI
La guida al riuso dei workflow ComfyUI approfondisce importazione e Missing Nodes.
3. Eseguire Wan Text-to-Video
Con modelli e nodi pronti, avvia un workflow T2V minimo.
3.1 Nodi chiave del workflow
Un workflow Wan T2V copre in genere queste funzioni; i nomi esatti dipendono dal template ufficiale attuale:
- Model loaders: caricare Wan T2V diffusion model, VAE e text encoder
- Video latent node: impostare width, height e frames
- Text encoding: inserire prompt positivo e negativo
- Sampling: configurare steps, CFG, seed e opzioni correlate
- VAE Decode: decodificare i frames video
- VideoHelperSuite o equivalente: unire i frames in un file
Differenze rispetto a un’immagine statica:
- Si imposta
framesinvece di una sola immagine - Si usa il VAE video compatibile
- L’output spesso include sequenza e unione video
3.2 Scrivere il prompt video
Il prompt deve descrivere continuità temporale.
Punti chiave:
- Descrivi movimenti concreti: camera (
camera following,slow pan) e soggetto (walking,turning head) - Evita cambi di scena e mantieni un’unica azione continua
- Distingui camera e soggetto: la prima cambia il punto di vista, il secondo il contenuto del frame
Esempi:
A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background
La guida ai prompt Stable Diffusion spiega la struttura di base.
3.3 Regolare frames, FPS e risoluzione
La relazione è:
| Parametro | Significato | Valori di test |
|---|---|---|
| frames | Numero totale di frames | 16/24/48/72 |
| FPS | Frames riprodotti al secondo | 12/16/24/30 |
| duration | Secondi = frames / FPS | Calcolare con la formula |
Esempi:
- 48 frames @ 16 FPS = 3 secondi
- 72 frames @ 12 FPS = 6 secondi
La risoluzione deve corrispondere al modello e al workflow. I template comuni separano spesso 480P e 720P.
Più frames e risoluzione maggiore aumentano in genere il carico di sampling e VAE. La sezione 6 propone punti prudenti.
3.4 Esportare il video
Molti workflow Wan generano una sequenza e poi usano Video Combine di VideoHelperSuite o un nodo simile.
Impostazioni comuni:
frame_rate: FPS di riproduzioneformat: mp4, gif, webp o altro formato supportatooutput_path: posizione in base alla versione del nodo
Problemi comuni:
- Manca ffmpeg o una dipendenza: segui il README e controlla
ffmpeg -version - Nessun permesso di scrittura: cambia cartella
- Encoder non supportato: salva prima i frames e scegli un formato compatibile
4. Eseguire Wan Image-to-Video
Image-to-video usa un’immagine statica come frame iniziale e genera movimento da quello stato.
4.1 Collegare il workflow I2V
Differenze principali tra I2V e T2V:
- Load Image: caricare un’immagine della dimensione prevista
- I2V model loader: caricare il modello Wan I2V, non la variante T2V
- CLIP Vision e text encoding: elaborare immagine e prompt secondo il workflow
- Sampling, VAE Decode e Video Combine: generare e salvare
I2V e T2V possono usare file e template diversi. Confronta ogni download con il template ufficiale.
4.2 Preparare l’immagine iniziale
L’input influenza molto i frames successivi.
Requisiti:
- Adattare la dimensione al workflow
- Usare un soggetto chiaro con bordi definiti
- Evitare dettagli eccessivi; sfondo affollato e texture dense possono aumentare la deriva
L’immagine può provenire da ComfyUI o da una fonte esterna che hai diritto di usare.
4.3 Diagnosticare le impostazioni I2V
Un problema comune parte con un primo frame riconoscibile, poi volto e mani derivano, si deformano o sfarfallano.
Cause e soluzioni:
- Prompt incompatibile: descrivere un movimento coerente con l’immagine
- Immagine complessa: semplificare lo sfondo o creare un input più pulito
- VRAM esaurita: ridurre frames, risoluzione o precisione
- Movimento troppo ampio: ridurre motion o strength se disponibili
Prova una variante I2V o un seed diverso se il modello non si adatta allo stile.
5. Preparare un workflow AnimateDiff
AnimateDiff usa una pila diversa da Wan.
5.1 Preparare il Motion Module
Il motion module è il componente centrale. Poiché cartella e formati possono cambiare in AnimateDiff-Evolved, usa il README attuale, il workflow di esempio e l’elenco del nodo.
Verifica se è destinato a SD 1.5, SDXL o altra architettura e se coincide con base checkpoint e workflow. Riavvia ComfyUI dopo il download e conferma che appaia nel loader.
5.2 Scegliere il Base Checkpoint
AnimateDiff non sostituisce il modello base; aggiunge movimento a un modello di diffusione immagini compatibile.
Scelta:
- Usa checkpoint SD 1.5 o SDXL compatibile con motion module e workflow
- Prova checkpoint di stile con pochi frames
- Non trattare un checkpoint normale come modello video completo
Consulta la guida alla scelta dei modelli Stable Diffusion.
5.3 Collegare il workflow
Un workflow AnimateDiff include in genere:
- Checkpoint Loader: caricare base checkpoint compatibile
- Motion Model Loader: caricare motion module o motion model
- Context Options: configurare context window
- Video latent node: impostare risoluzione e frames
- Text encoding, sampling, VAE Decode e unione video
Il rapporto tra frames e context length dipende dalla versione. Parti dai valori dell’esempio e modifica una sola impostazione.
6. Definire il budget di parametri e prestazioni
VRAM e durata sono i principali limiti locali. Questi valori sono punti iniziali, non garanzie GPU.
6.1 Matrice iniziale di VRAM, frames e risoluzione
| VRAM | Inizio prudente | Da provare | Da evitare all’inizio |
|---|---|---|---|
| 8 GB | AnimateDiff, bassa risoluzione, circa 16 frames, batch 1 | Workflow low-VRAM della community | Wan ad alta risoluzione, clip lunghi, più branch |
| 12 GB | AnimateDiff breve e piccolo | Wan a bassa precisione, piccolo e con pochi frames | Clip 720P lunghi e post-produzione complessa |
| 16 GB | Test Wan FP8 breve secondo indicazioni ufficiali | Template 480P o 720P corrispondente | Più branch simultanei e video lunghi |
| 24 GB+ | Più margine per clip brevi | Risoluzione o frames maggiori | Batch, VAE e post-produzione richiedono comunque limiti |
Il requisito reale varia con versione, GPU, VAE, custom nodes e workflow. La tabella serve solo a scegliere il primo test.
6.2 Ridurre il carico in questo ordine
Se manca VRAM:
- Riduci
frames, per esempio da 48 a 24 o 16 - Scendi da 720P a 480P o a una dimensione compatibile inferiore
- Mantieni batch a 1 e disattiva branch di controllo e post-produzione non necessari
- Se supportato, passa da fp16 a fp8 o precisione inferiore
- Prova tile spaziali e impostazioni temporali di VAEDecodeTiled o VAEEncodeTiled
- Usa
--lowvramo un’opzione compatibile - Disattiva preview e chiudi altre applicazioni GPU
Opzioni low-VRAM, cache e VAE tiled devono essere provati con versione e workflow correnti.
6.3 Bilanciare durata e qualità
Più lungo non significa migliore. I clip brevi sono più facili da controllare; quelli lunghi richiedono spesso movimenti ridotti e generazione a segmenti.
Rischi:
- Sfarfallio: colore o luminosità cambiano tra frames
- Deformazione: volto, mani o contorni derivano
- Movimento debole: prompt o motion insufficiente
Per un video lungo, verifica un segmento breve e poi usa continuation, I2V o post-produzione compatibile. Raddoppiare frames non garantisce coerenza.
7. Capire output e salvataggio video
Molti workflow ComfyUI producono prima frames e li uniscono in seguito con VideoHelperSuite o un nodo simile.
7.1 Funzioni dei nodi VideoHelperSuite
| Funzione | Uso | Impostazioni comuni |
|---|---|---|
| Load Video | Importare video o sequenza | frame_count, frame_rate, width/height |
| Video Combine | Unire frames | frame_rate, format, output |
| Nodo Save Video | Salvare il file | format, quality, save_output |
Nomi, parametri e formati cambiano con l’estensione. Load Video importa un video esistente; Video Combine o equivalente converte i frames in un file.
7.2 Convertire FPS, frames e durata
La formula è:
duration (secondi) = frames / FPS
Esempi:
- 48 frames @ 16 FPS = 3 secondi
- 72 frames @ 12 FPS = 6 secondi
Scelte FPS:
| FPS | Effetto |
|---|---|
| 12 | Gli stessi frames durano di più, ma il movimento può apparire scattoso |
| 16 | Equilibrio tra durata e fluidità |
| 24 | La sequenza viene riprodotta più velocemente e termina prima |
| 30 | Servono più frames per mantenere la durata |
FPS controlla la velocità ma non crea immagini intermedie. Un clip lungo richiede più frames o segmenti; maggiore fluidità può richiedere interpolazione.
7.3 Risolvere problemi di salvataggio
| Problema | Soluzione |
|---|---|
| Manca ffmpeg o una dipendenza | Segui il README e controlla ffmpeg -version |
| Cartella non scrivibile | Concedi accesso o usa l’output predefinito |
| Encoder o formato non supportato | Salva i frames e scegli un formato compatibile |
| Nessun frame arriva al saver | Controlla latent, VAE Decode e collegamenti |
8. Risolvere gli errori comuni
Un workflow video può fallire a più livelli. Controllali in ordine senza cambiare insieme impostazioni scollegate.
8.1 Risolvere Missing Nodes
Il workflow importato mostra blocchi rossi Missing Nodes.
Ordine:
- Controlla in ComfyUI Manager i node pack richiesti
- Cerca il nome esatto del nodo mancante
- Se non compare, clona il repository in
custom_nodes/ - Riavvia ComfyUI
La guida al riuso dei workflow ComfyUI offre più dettagli.
8.2 Correggere i percorsi dei modelli
Una cartella errata spesso lascia vuoto l’elenco.
| Tipo | Cartella comune |
|---|---|
| Wan diffusion model | models/diffusion_models/ |
| Wan VAE | models/vae/ |
| CLIP Vision | models/clip_vision/ |
| text encoder | models/text_encoders/ |
| AnimateDiff motion module | Segui README attuale ed elenco del nodo |
Fai coincidere nome, attività, risoluzione e precisione con il workflow.
8.3 Risolvere OOM
L’esaurimento della VRAM è l’errore di risorse più comune.
Ordine:
- Riduci frames, risoluzione e precisione
- Mantieni batch a 1 e disattiva branch aggiuntivi
- Prova VAEDecodeTiled o temporal chunk
- Usa un’opzione compatibile come
--lowvram - Disattiva preview e chiudi altre applicazioni GPU
8.4 Correggere sfarfallio, deformazione o movimento debole
| Problema | Causa probabile | Regolazione |
|---|---|---|
| Sfarfallio | Bassa coerenza temporale o context/motion inadatto | Fissa seed, accorcia test e regola context o motion |
| Deformazione | Immagine complessa, movimento eccessivo o limite del modello | Semplifica input, riduci movimento o cambia modello |
| Movimento debole | Prompt senza azione o motion basso | Aggiungi azione concreta e regola motion gradualmente |
| Qualità bassa | Checkpoint, motion module o VAE incompatibili | Controlla la combinazione e torna al workflow di esempio |
La guida ai prompt Stable Diffusion aiuta a strutturare le azioni.
8.5 Correggere VAE Decode bloccato
VAE Decode si blocca, è molto lento o raggiunge OOM.
Soluzioni:
- Riduci frames e risoluzione
- Prova VAEDecodeTiled con tile spaziali o temporal chunks
- Verifica che il VAE corrisponda al workflow
- Scarica di nuovo un modello danneggiato da una fonte affidabile e verificalo
8.6 Correggere la deriva I2V dopo il primo frame
È un caso frequente in I2V.
| Causa | Regolazione |
|---|---|
| Prompt incompatibile con l’immagine | Descrivi un movimento coerente con l’input |
| Immagine iniziale troppo dettagliata | Semplifica lo sfondo o crea un input più pulito |
| Movimento troppo grande | Parti da subtle motion o slow camera push-in |
| Modello I2V inadatto allo stile | Prova altra variante, workflow o seed |
9. Continuare con controllo, post-produzione e automazione
Quando il primo workflow è stabile, scegli il passo successivo in base al limite realmente incontrato.
9.1 Guide correlate della serie
Questo è il capitolo video della serie pratica ComfyUI e Stable Diffusion. Consulta questi prerequisiti quando necessario:
- Introduzione a ComfyUI: stabilizza prima le immagini statiche
- Riutilizzare workflow ComfyUI: importa JSON e risolvi custom nodes
- Scegliere modelli Stable Diffusion: seleziona un checkpoint compatibile
- Prompt Stable Diffusion: aggiungi azione e camera a una struttura solida
Altri articoli trattano low-VRAM, riparazione frame per frame, automazione API e conflitti di versione. Stabilizza un workflow breve prima di aggiungere livelli.
9.2 Documentazione ufficiale e progetti
Parti dalle fonti ufficiali:
- Documentazione ComfyUI
- ComfyUI Wan2.2 Tutorial: fonte principale per Wan
- Wan-Video/Wan2.2 su GitHub: varianti e attività
- ComfyUI-AnimateDiff-Evolved: implementazione AnimateDiff
- ComfyUI-VideoHelperSuite: importazione ed esportazione
- Documentazione VAEDecodeTiled: VAE tiled
- ComfyUI Startup Flags: opzioni low-VRAM
9.3 Licenze e uso commerciale
Controlla la licenza attuale di ogni modello:
- Per Wan 2.2, consulta LICENSE in Wan-Video/Wan2.2
- Per AnimateDiff, consulta LICENSE in AnimateDiff
Prima dell’uso commerciale, verifica:
- Se la licenza consente l’uso commerciale
- Se possiedi i diritti sul materiale, soprattutto sull’immagine iniziale I2V
- Come si applicano i diritti del contenuto generato al progetto e alla piattaforma
Questo testo non è una consulenza legale. Fa fede la licenza corrente del repository.
Conclusione
Wan e AnimateDiff coprono workflow video ComfyUI diversi. Wan crea video da testo o immagine iniziale; AnimateDiff riutilizza checkpoint compatibili per animazioni brevi. Cartelle, versioni dei nodi e template devono corrispondere al workflow reale. La matrice è un inizio prudente, non una garanzia GPU. Se mancano risorse, riduci frames, risoluzione, branch, precisione e carico VAE in quest’ordine.
Per Missing Nodes, percorsi, OOM, sfarfallio, deformazione, VAE Decode bloccato o esportazione fallita, procedi per livelli. Inizia con pochi frames, risoluzione bassa e batch 1, valida l’intera catena e aumenta una sola variabile per test.
Eseguire il primo workflow video breve in ComfyUI
Verifica l’intera catena, dalla scelta del metodo e dei modelli al test minimo e all’esportazione.
- 1
Step 1: Verificare il workflow di base
Controlla che ComfyUI generi immagini statiche in modo stabile e che tu sappia importare un workflow, riconoscere i nodi mancanti e verificare i percorsi. - 2
Step 2: Scegliere il metodo video
Usa Wan T2V per il testo, Wan I2V per un’immagine iniziale o AnimateDiff per riutilizzare un checkpoint SD. - 3
Step 3: Preparare i modelli
Segui workflow e documentazione ufficiale per ottenere diffusion model, VAE, text encoder, CLIP Vision o motion module. - 4
Step 4: Installare i nodi richiesti
Installa i custom nodes con ComfyUI Manager e prepara un’estensione di esportazione come VideoHelperSuite. - 5
Step 5: Avviare un test minimo
Parti con pochi frames, risoluzione ridotta e batch 1, senza ControlNet, upscale o post-produzione complessa. - 6
Step 6: Unire e salvare il video
Dopo la generazione dei frames, imposta frame rate e formato ed esporta con Video Combine, Save Video o un nodo equivalente. - 7
Step 7: Aumentare una variabile alla volta
Fissa il seed e modifica un solo valore per test; con OOM, sfarfallio o deriva, riduci frames, risoluzione, precisione e carico VAE.
FAQ
Conviene iniziare con Wan o AnimateDiff per i video ComfyUI?
Qual è la differenza tra frames e FPS in ComfyUI?
Perché ComfyUI produce immagini invece di un file mp4?
Si possono generare video ComfyUI con 8 GB di VRAM?
Perché image-to-video si allontana dall’immagine iniziale?
Cosa fare se la generazione si blocca su VAE Decode?
14 min di lettura · Pubblicato il: 23 lug 2026 · Aggiornato il: 24 lug 2026
Guida pratica a ComfyUI e Stable Diffusion
Se arrivi dalla ricerca, il modo più veloce per orientarti è passare all’articolo precedente o successivo della stessa serie.
Precedente
Ottimizzare ComfyUI con poca VRAM: SDXL, FLUX e video su GPU da 6–8 GB
Esegui ComfyUI con 6–8 GB di VRAM gestendo modello, T5, VAE, risoluzione e batch, quindi diagnostica OOM e workflow FLUX o video troppo lenti.
Parte 8 di 10
Successivo
Automatizzare la generazione di immagini con l’API ComfyUI
Esporta un workflow API, invialo a /prompt, attendi via WebSocket, scarica i risultati e aggiungi parametri, limiti di coda e tracciamento backend.
Parte 10 di 10



Commenti
Accedi con GitHub per lasciare un commento