Créer des vidéos ComfyUI avec Wan et AnimateDiff

"Le tutoriel officiel ComfyUI sur Wan 2.2 fournit des workflows text-to-video et image-to-video, les emplacements des modèles et les choix de précision."
Vous savez déjà produire une image fixe satisfaisante dans ComfyUI et voulez maintenant l’animer. Après import du workflow vidéo, l’interface se remplit pourtant de Missing Nodes, ou la VRAM atteint immédiatement 99 %. Faut-il choisir Wan ou AnimateDiff ? Dans quels dossiers placer les modèles ? Comment équilibrer frames et mémoire, puis transformer une suite d’images en mp4 ? Commencez par la méthode, la liste de préparation et un budget prudent, avant de diagnostiquer les échecs fréquents.
1. Choisir entre Wan et AnimateDiff
Choisissez la méthode avant de construire le workflow. Wan et AnimateDiff sont deux systèmes différents, avec leurs prérequis, leurs usages et leur complexité.
1.1 Wan : un modèle vidéo dédié
Wan 2.2 est une famille ouverte de modèles vidéo prenant en charge text-to-video (T2V), image-to-video (I2V) et text-image-to-video (TI2V). Elle utilise une architecture mixture-of-experts ainsi que ses propres poids, VAE et text encoder. Pour certains workflows FP8, le tutoriel officiel ComfyUI propose de partir de plus de 16 Go de VRAM ; les variantes en précision originale demandent généralement davantage. Wan vise la création de nouvelles vidéos avec une meilleure continuité temporelle.
L’écosystème Wan est distinct d’un checkpoint SD classique. Il faut donc réunir toutes les ressources exigées par le workflow, notamment diffusion model, VAE et text encoder. Un clip court de deux à quatre secondes constitue un bon premier test.
1.2 AnimateDiff : ajouter du mouvement à l’écosystème SD
AnimateDiff apporte du mouvement aux modèles Stable Diffusion compatibles, comme SD 1.5 ou SDXL. Son élément central est un motion module associé à un base checkpoint. Le dossier des modèles pouvant évoluer avec AnimateDiff-Evolved, consultez le README actuel et la liste du node. Un workflow courant charge un checkpoint SD et un motion module compatible pour générer une animation courte.
Cette méthode convient si vous possédez déjà des checkpoints de style. Le checkpoint et le VAE peuvent être réutilisés, mais la durée et la cohérence dépendent du base model, du motion module, du context, des frames et de la résolution.
1.3 Tableau de décision Wan vs AnimateDiff
| Critère | Wan 2.2 | AnimateDiff |
|---|---|---|
| Tâche | Text-to-video, image-to-video, text-image-to-video | Animation courte basée sur un modèle SD |
| Écosystème | Modèle vidéo dédié | SD 1.5/SDXL |
| Point de départ VRAM | Certains workflows FP8 démarrent autour de 16 Go ; la précision originale exige plus | Dépend du base model, du motion module et des réglages ; tester petit et court |
| Prérequis | Wan diffusion model + VAE + text encoder | Checkpoint SD + motion module |
| Usage adapté | Nouvelle vidéo et cohérence accrue | Modèles de style existants et animations courtes |
| Complexité | Élevée : plusieurs modèles et nodes | Moyenne : motion module plus base checkpoint |
Choisissez Wan pour créer un nouveau clip si la pile de modèles plus lourde est acceptable. Choisissez AnimateDiff si vous possédez un checkpoint SD compatible, si une animation courte suffit ou si vous préférez éviter un grand modèle vidéo dédié.
2. Préparer le workflow Wan
De nombreux essais Wan échouent pendant la préparation : modèle dans le mauvais dossier, node absent ou workflow conçu pour une autre tâche. Une vérification préalable évite de corriger chaque erreur après lancement de la queue.
2.1 Préparer les fichiers de modèle
Les fichiers Wan doivent se trouver aux emplacements attendus. Une erreur de dossier ou de nom produit souvent une liste de modèles vide.
Dossiers fréquents :
| Dossier | Type | Remarque |
|---|---|---|
models/diffusion_models/ | Modèle T2V/I2V | Variantes 480P/720P et fp16/fp8 |
models/vae/ | VAE vidéo | Utiliser le VAE du workflow Wan |
models/clip_vision/ | Vision encoder | Requis pour certains workflows I2V |
models/text_encoders/ | Text encoder | Utiliser celui du workflow |
Choix de précision :
- fp16 : précision originale et consommation VRAM la plus élevée
- fp8 : précision réduite pouvant alléger la VRAM ; mesurez le besoin réel avec le workflow actuel et les logs
- bf16 : uniquement si matériel et workflow sont compatibles
Wan évolue rapidement. Vérifiez les noms exacts, liens de téléchargement et variantes dans le tutoriel officiel actuel.
2.2 Installer les Custom Nodes
Un workflow vidéo peut dépendre de plusieurs node packs tiers. VideoHelperSuite sert souvent à l’import et l’export ; AnimateDiff nécessite généralement ComfyUI-AnimateDiff-Evolved.
Étapes :
- Ouvrir ComfyUI Manager et installer les nodes indiqués ; installer
ComfyUI-VideoHelperSuitesi VHS est requis - Installer
ComfyUI-AnimateDiff-Evolvedpour AnimateDiff - Vérifier ffmpeg et les dépendances dans le README actuel de VideoHelperSuite
- Redémarrer ComfyUI
Vérifier ffmpeg :
ffmpeg -version
Si une version apparaît, ffmpeg est disponible. Avec command not found, utilisez winget install ffmpeg sous Windows, sudo apt install ffmpeg sous Linux ou brew install ffmpeg sous macOS.
2.3 Importer un modèle de workflow
Pour le premier essai, partez d’un workflow T2V ou I2V du tutoriel officiel au lieu d’assembler tous les nodes.
Étapes :
- Télécharger le JSON Wan T2V ou I2V depuis le tutoriel officiel
- Déposer dans ComfyUI le JSON ou une image d’exemple contenant les métadonnées
- En cas de Missing Nodes, rechercher chaque node dans Manager ou installer le bon dépôt manuellement
Ordre de diagnostic :
- Vérifier dans ComfyUI Manager que le node pack requis est installé
- Rechercher le nom exact du node manquant
- Si Manager ne le trouve pas, cloner le bon dépôt dans
custom_nodes/ - Redémarrer ComfyUI
Le guide de réutilisation des workflows ComfyUI détaille l’import et Missing Nodes.
3. Exécuter Wan Text-to-Video
Une fois modèles et nodes prêts, lancez un workflow T2V minimal.
3.1 Nodes essentiels du workflow
Un workflow Wan T2V couvre généralement les responsabilités suivantes ; les noms exacts dépendent du modèle officiel actuel :
- Model loaders : charger Wan T2V diffusion model, VAE et text encoder
- Video latent node : définir width, height et frames
- Text encoding : saisir prompt positif et négatif
- Sampling : régler steps, CFG, seed et options associées
- VAE Decode : décoder les frames vidéo
- VideoHelperSuite ou équivalent : réunir les frames dans un fichier vidéo
Différences avec une image fixe :
- Le workflow règle
framesplutôt qu’une image unique - Il utilise le VAE vidéo compatible
- La sortie comprend souvent la séquence et une étape d’assemblage
3.2 Écrire le prompt vidéo
Le prompt vidéo doit décrire la continuité temporelle.
Points clés :
- Décrire précisément le mouvement : caméra (
camera following,slow pan) et sujet (walking,turning head) - Éviter les changements de scène : rester dans une scène continue
- Distinguer caméra et sujet : l’une change le point de vue, l’autre le contenu du cadre
Exemples :
A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background
Le guide des prompts Stable Diffusion explique la structure de base.
3.3 Régler frames, FPS et résolution
La relation est simple :
| Paramètre | Signification | Valeurs de test |
|---|---|---|
| frames | Nombre total de frames | 16/24/48/72 |
| FPS | Frames lues par seconde | 12/16/24/30 |
| duration | Secondes = frames / FPS | Calculer avec la formule |
Exemples :
- 48 frames @ 16 FPS = 3 secondes
- 72 frames @ 12 FPS = 6 secondes
La résolution doit correspondre au modèle et au workflow. Les modèles courants distinguent souvent 480P et 720P.
Davantage de frames et une résolution supérieure augmentent généralement la charge du sampling et du VAE. La section 6 propose des points de départ prudents.
3.4 Exporter la vidéo
De nombreux workflows Wan créent une séquence puis utilisent Video Combine de VideoHelperSuite ou un node similaire.
Réglages fréquents :
frame_rate: FPS de lectureformat: mp4, gif, webp ou autre format pris en chargeoutput_path: emplacement de sortie, selon la version du node
Échecs fréquents :
- ffmpeg ou dépendance manquante : suivre le README et vérifier
ffmpeg -version - Droits insuffisants : choisir un dossier accessible en écriture
- Encodeur non pris en charge : enregistrer d’abord les frames puis choisir un format compatible
4. Exécuter Wan Image-to-Video
Image-to-video utilise une image fixe comme frame initiale et génère le mouvement à partir de cet état.
4.1 Connecter le workflow I2V
Différences principales entre I2V et T2V :
- Load Image : charger une image à la taille attendue
- I2V model loader : charger le modèle Wan I2V correspondant, pas la variante T2V
- CLIP Vision et text encoding : traiter l’image et le prompt selon le workflow
- Sampling, VAE Decode et Video Combine : générer puis enregistrer
I2V et T2V peuvent employer des fichiers et modèles distincts. Comparez chaque téléchargement au modèle officiel.
4.2 Préparer l’image initiale
L’image d’entrée influence fortement les frames suivantes.
Conditions :
- Adapter sa taille au workflow
- Choisir un sujet clair et des contours propres
- Éviter trop de détails ; arrière-plan chargé et texture dense peuvent accroître la dérive
L’image peut venir de ComfyUI ou d’une source externe que vous avez le droit d’utiliser.
4.3 Diagnostiquer les réglages I2V
Un échec courant commence par une première frame correcte, puis le visage et les mains dérivent, se déforment ou scintillent.
Causes et corrections :
- Prompt incompatible : décrire un mouvement plausible pour l’image
- Image trop complexe : simplifier le décor ou produire une entrée plus nette
- VRAM saturée : réduire frames, résolution ou précision
- Mouvement trop ample : diminuer motion ou strength si le workflow l’expose
Essayez une autre variante I2V ou un autre seed si le modèle convient mal au style.
5. Préparer un workflow AnimateDiff
AnimateDiff utilise une pile de modèles différente de Wan.
5.1 Préparer le Motion Module
Le motion module est le composant central. Dossier et formats pouvant changer avec AnimateDiff-Evolved, prenez comme référence le README actuel, le workflow d’exemple et la liste du node.
Vérifiez s’il cible SD 1.5, SDXL ou une autre architecture et s’il correspond au base checkpoint. Après téléchargement, redémarrez ComfyUI et confirmez sa présence dans le loader AnimateDiff-Evolved.
5.2 Choisir le Base Checkpoint
AnimateDiff ne remplace pas le modèle de base ; il ajoute le mouvement à un modèle d’image compatible.
Choix :
- Utiliser un checkpoint SD 1.5 ou SDXL compatible avec motion module et workflow
- Tester les checkpoints de style existants avec peu de frames
- Ne pas traiter un checkpoint ordinaire comme modèle vidéo complet
Consultez le guide de sélection des modèles Stable Diffusion.
5.3 Connecter le workflow
Un workflow AnimateDiff comprend généralement :
- Checkpoint Loader : charger un base checkpoint compatible
- Motion Model Loader : charger motion module ou motion model
- Context Options : régler la fenêtre de contexte
- Video latent node : définir résolution et frames
- Text encoding, sampling, VAE Decode et assemblage vidéo
Le rapport entre frames et context length dépend de la version des nodes. Commencez par les valeurs de l’exemple, puis changez un seul réglage.
6. Définir le budget de paramètres et de performances
VRAM et durée sont les principales contraintes locales. Ces valeurs sont des départs prudents, pas des garanties GPU.
6.1 Matrice de départ VRAM, frames et résolution
| VRAM | Départ prudent | À tester | À éviter au début |
|---|---|---|---|
| 8 Go | AnimateDiff, petite résolution, environ 16 frames, batch 1 | Workflows low-VRAM communautaires | Wan haute résolution, clips longs, branches multiples |
| 12 Go | AnimateDiff court et petit | Wan basse précision, petite taille et peu de frames | Longs clips 720P et post-traitement complexe |
| 16 Go | Test Wan FP8 court selon les indications officielles | Modèle 480P ou 720P correspondant | Branches simultanées et vidéos longues |
| 24 Go+ | Plus de marge pour les clips courts | Résolution ou frames supérieures | Batch, VAE et post-traitement restent à limiter |
Le besoin réel varie selon version, GPU, VAE, custom nodes et implémentation. Cette matrice sert uniquement au premier test.
6.2 Réduire la charge dans cet ordre
Si la VRAM manque :
- Réduire
frames, par exemple de 48 à 24 ou 16 - Passer de 720P à 480P ou à une taille plus petite prise en charge
- Garder batch à 1 et désactiver les branches de contrôle et de post-traitement inutiles
- Si possible, passer de fp16 à fp8 ou à une précision inférieure
- Tester tiles spatiales et réglages temporels de VAEDecodeTiled ou VAEEncodeTiled
- Utiliser
--lowvramou une option compatible - Désactiver preview et fermer les applications GPU
Options low-VRAM, cache et VAE tiled doivent être testés avec la version actuelle et le workflow concret.
6.3 Arbitrer durée et qualité
Plus long ne signifie pas meilleur. Les clips courts se contrôlent plus facilement ; les longs exigent souvent des mouvements réduits et une génération segmentée.
Risques :
- Scintillement : couleur ou luminosité change entre les frames
- Déformation : visage, mains ou contours dérivent
- Mouvement faible : prompt ou réglage motion insuffisant
Pour une vidéo longue, validez d’abord un segment court puis utilisez les méthodes de continuation, I2V ou de post-production prises en charge. Doubler frames ne garantit pas la cohérence.
7. Comprendre la sortie et l’enregistrement vidéo
De nombreux workflows ComfyUI produisent d’abord des frames, ensuite assemblées avec VideoHelperSuite ou un node similaire.
7.1 Rôle des nodes VideoHelperSuite
| Rôle | Fonction | Réglages fréquents |
|---|---|---|
| Load Video | Importer vidéo ou séquence d’images | frame_count, frame_rate, width/height |
| Video Combine | Assembler les frames | frame_rate, format, sortie |
| Node Save Video | Enregistrer le fichier | format, quality, save_output |
Noms, paramètres et formats évoluent avec l’extension. Load Video importe une vidéo existante ; Video Combine ou équivalent transforme les frames produites en fichier vidéo.
7.2 Convertir FPS, frames et durée
La formule est :
duration (secondes) = frames / FPS
Exemples :
- 48 frames @ 16 FPS = 3 secondes
- 72 frames @ 12 FPS = 6 secondes
Choix du FPS :
| FPS | Effet |
|---|---|
| 12 | Les mêmes frames durent plus longtemps, avec un mouvement parfois plus saccadé |
| 16 | Compromis entre durée et fluidité |
| 24 | La même séquence est lue plus vite et finit plus tôt |
| 30 | Il faut plus de frames pour conserver la même durée |
Le FPS contrôle la vitesse de lecture, sans créer d’images intermédiaires. Un clip plus long demande plus de frames ou des segments ; une animation plus fluide peut demander une interpolation.
7.3 Corriger les échecs d’enregistrement
| Échec | Correction |
|---|---|
| ffmpeg ou dépendance absente | Suivre le README et vérifier ffmpeg -version |
| Dossier non accessible en écriture | Donner les droits ou utiliser le dossier de sortie par défaut |
| Encodeur ou format non pris en charge | Sauver les frames puis choisir un format compatible |
| Aucune frame au node de sauvegarde | Vérifier latent, VAE Decode et connexions de sortie |
8. Résoudre les erreurs courantes
Un workflow vidéo peut échouer à plusieurs niveaux. Contrôlez-les dans l’ordre au lieu de modifier plusieurs paramètres sans rapport.
8.1 Résoudre Missing Nodes
Le workflow importé affiche des blocs rouges Missing Nodes.
Ordre :
- Vérifier dans ComfyUI Manager que les node packs sont installés
- Rechercher le nom exact du node absent
- Si Manager ne le trouve pas, cloner le bon dépôt dans
custom_nodes/ - Redémarrer ComfyUI
Le guide de réutilisation des workflows ComfyUI fournit plus de détails.
8.2 Corriger les chemins de modèle
Un mauvais dossier produit souvent une liste vide.
| Type | Dossier fréquent |
|---|---|
| Wan diffusion model | models/diffusion_models/ |
| Wan VAE | models/vae/ |
| CLIP Vision | models/clip_vision/ |
| text encoder | models/text_encoders/ |
| AnimateDiff motion module | Suivre le README actuel et la liste du node |
Faites correspondre noms, tâche, résolution et précision au workflow.
8.3 Résoudre OOM
L’épuisement de VRAM est l’erreur de ressources la plus courante.
Ordre :
- Réduire frames, résolution et précision
- Garder batch à 1 et couper les branches supplémentaires
- Tester VAEDecodeTiled ou temporal chunk
- Utiliser une option compatible telle que
--lowvram - Désactiver preview et fermer les autres applications GPU
8.4 Corriger scintillement, déformation ou mouvement faible
| Problème | Cause probable | Ajustement |
|---|---|---|
| Scintillement | Cohérence temporelle faible ou context/motion inadapté | Fixer seed, raccourcir le test, ajuster context ou motion |
| Déformation | Image complexe, mouvement trop grand ou limite du modèle | Simplifier l’image, réduire le mouvement, changer de modèle |
| Mouvement faible | Prompt peu précis ou motion trop bas | Ajouter une action concrète et ajuster progressivement motion |
| Qualité faible | Checkpoint, motion module ou VAE incompatibles | Vérifier la combinaison et revenir au workflow d’exemple |
Le guide des prompts Stable Diffusion aide à structurer les actions.
8.5 Corriger un VAE Decode bloqué
VAE Decode se bloque, devient très lent ou atteint OOM.
Corrections :
- Réduire frames et résolution
- Tester VAEDecodeTiled avec tiles spatiales ou temporal chunks
- Vérifier que le VAE correspond au workflow
- Retélécharger un modèle endommagé depuis une source fiable et le vérifier
8.6 Corriger la dérive I2V après la première frame
Ce schéma est fréquent en I2V.
| Cause | Ajustement |
|---|---|
| Prompt incompatible avec l’image | Décrire un mouvement cohérent avec l’entrée |
| Image initiale trop détaillée | Simplifier l’arrière-plan ou créer une image plus nette |
| Mouvement trop important | Commencer par subtle motion ou slow camera push-in |
| Modèle I2V mal adapté au style | Tester une autre variante, un autre workflow ou seed |
9. Poursuivre avec contrôle, post-traitement et automatisation
Une fois le premier workflow stable, choisissez la suite en fonction de la limite réellement rencontrée.
9.1 Guides associés de la série
Cet article est consacré à la vidéo dans la série pratique ComfyUI et Stable Diffusion. Consultez ces prérequis si nécessaire :
- Débuter avec ComfyUI : fiabiliser d’abord les images fixes
- Réutiliser les workflows ComfyUI : importer JSON et résoudre les custom nodes
- Choisir un modèle Stable Diffusion : sélectionner un checkpoint compatible
- Prompts Stable Diffusion : ajouter mouvement et caméra à une structure solide
D’autres articles traitent de low-VRAM, réparation frame par frame, automatisation API et conflits de versions. Stabilisez un workflow court avant d’ajouter des couches.
9.2 Documentation officielle et projets
Commencez par les sources officielles :
- Documentation ComfyUI
- ComfyUI Wan2.2 Tutorial : source principale pour Wan
- Wan-Video/Wan2.2 sur GitHub : variantes et tâches
- ComfyUI-AnimateDiff-Evolved : implémentation AnimateDiff
- ComfyUI-VideoHelperSuite : import et export vidéo
- Documentation VAEDecodeTiled : VAE vidéo tiled
- ComfyUI Startup Flags : options low-VRAM
9.3 Licences et usage commercial
Vérifiez la licence actuelle de chaque modèle :
- Pour Wan 2.2, consulter la LICENSE de Wan-Video/Wan2.2
- Pour AnimateDiff, consulter la LICENSE de AnimateDiff
Avant un usage commercial, vérifiez :
- Si la licence du modèle autorise l’usage commercial
- Si vous détenez les droits sur la source, surtout l’image initiale I2V
- Comment les droits des contenus générés s’appliquent au projet et à la plateforme
Ce texte ne constitue pas un conseil juridique. La licence actuelle du dépôt fait foi.
Conclusion
Wan et AnimateDiff répondent à des workflows vidéo ComfyUI différents. Wan crée une vidéo depuis du texte ou une image initiale ; AnimateDiff réutilise des checkpoints compatibles pour de courtes animations. Dossiers, versions de nodes et modèles doivent correspondre au workflow réel. La matrice est un départ prudent, pas une garantie GPU. Si les ressources manquent, réduisez successivement frames, résolution, branches, précision et charge VAE.
Pour Missing Nodes, chemins de modèles, OOM, scintillement, déformation, VAE Decode bloqué ou échec d’export, procédez couche par couche. Commencez avec peu de frames, une petite résolution et batch 1, validez toute la chaîne, puis augmentez une seule variable par test.
Exécuter un premier workflow vidéo court dans ComfyUI
Validez toute la chaîne, du choix de la méthode et des modèles au test minimal puis à l’export.
- 1
Step 1: Vérifier le workflow de base
Confirmez que ComfyUI produit des images fixes et que vous savez importer un workflow, repérer les nodes manquants et vérifier les chemins des modèles. - 2
Step 2: Choisir la méthode vidéo
Prenez Wan T2V pour le texte, Wan I2V pour une image initiale, ou AnimateDiff pour réutiliser un checkpoint SD. - 3
Step 3: Préparer les modèles
Suivez le workflow et la documentation officielle pour obtenir diffusion model, VAE, text encoder, CLIP Vision ou motion module. - 4
Step 4: Installer les nodes requis
Installez les custom nodes dans ComfyUI Manager et préparez une extension d’export telle que VideoHelperSuite. - 5
Step 5: Lancer un test minimal
Commencez avec peu de frames, une petite résolution et batch 1, sans ControlNet, upscale ni post-traitement complexe. - 6
Step 6: Assembler et enregistrer la vidéo
Une fois les frames produites, réglez frame rate et format puis exportez avec Video Combine, Save Video ou un node équivalent. - 7
Step 7: Augmenter une variable à la fois
Fixez le seed et ne modifiez qu’un réglage par test ; en cas d’OOM, de scintillement ou de dérive, revenez sur frames, résolution, précision et VAE.
FAQ
Faut-il commencer la vidéo ComfyUI avec Wan ou AnimateDiff ?
Quelle différence entre frames et FPS dans ComfyUI ?
Pourquoi ComfyUI produit-il des images au lieu d’un mp4 ?
Peut-on générer une vidéo ComfyUI avec 8 Go de VRAM ?
Pourquoi l’image-to-video s’éloigne-t-il de l’image source ?
Que faire si la génération reste bloquée sur VAE Decode ?
15 min de lecture · Publié le: 23 juil. 2026 · Mis à jour le: 24 juil. 2026
Guide pratique ComfyUI et Stable Diffusion
Si vous arrivez depuis la recherche, le plus rapide est de passer à l’article précédent ou suivant de cette série.
Précédent
Optimiser ComfyUI avec peu de VRAM : SDXL, FLUX et vidéo sur un GPU de 6 à 8 Go
Exécutez ComfyUI avec 6 à 8 Go de VRAM en maîtrisant modèle, T5, VAE, résolution et batch, puis diagnostiquez les OOM et les workflows FLUX ou vidéo trop lents.
Partie 8 sur 10
Suivant
Automatiser des séries d’images avec l’API ComfyUI
Exportez un workflow API, envoyez-le à /prompt, attendez via WebSocket, récupérez les sorties, puis ajoutez paramètres, limites de file et suivi backend.
Partie 10 sur 10



Commentaires
Connectez-vous avec GitHub pour laisser un commentaire