Criar vídeos no ComfyUI com Wan e AnimateDiff

"O tutorial oficial do ComfyUI para Wan 2.2 fornece workflows text-to-video e image-to-video, locais de modelos e opções de precisão."
Você já consegue gerar no ComfyUI uma imagem estática satisfatória e agora quer fazê-la se mover. Ao importar o workflow de vídeo, porém, surgem blocos vermelhos de Missing Nodes ou o uso de VRAM chega imediatamente a 99%. Qual rota usar, Wan ou AnimateDiff? Em quais pastas ficam os modelos? Como equilibrar frames e memória e transformar uma sequência de imagens em mp4? Comece pela escolha da rota, pela lista de preparação e por um orçamento conservador; depois investigue os erros mais comuns na ordem.
1. Escolher entre Wan e AnimateDiff
Defina a rota antes de montar o workflow. Wan e AnimateDiff são sistemas diferentes, com pré-requisitos, usos e complexidade distintos.
1.1 Wan: uma rota com modelo de vídeo dedicado
Wan 2.2 é uma família aberta de modelos de vídeo compatível com text-to-video (T2V), image-to-video (I2V) e text-image-to-video (TI2V). Usa arquitetura mixture-of-experts e seus próprios pesos, VAE e text encoder. Para alguns workflows FP8, o tutorial oficial do ComfyUI sugere partir de mais de 16 GB de VRAM; variantes na precisão original costumam exigir mais. Wan atende à criação de novos vídeos e a uma necessidade maior de consistência temporal.
O ecossistema Wan é separado de um checkpoint SD normal. Reúna todos os arquivos exigidos pelo workflow, como diffusion model, VAE e text encoder. Um clipe de dois a quatro segundos é um início prático.
1.2 AnimateDiff: adicionar movimento ao ecossistema SD
AnimateDiff adiciona movimento a modelos Stable Diffusion compatíveis, como SD 1.5 ou SDXL. O componente central é um motion module usado com um base checkpoint. Como a pasta pode mudar no AnimateDiff-Evolved, siga o README atual e a lista exibida pelo node. Um workflow típico carrega checkpoint SD e motion module compatível para gerar animação curta.
AnimateDiff funciona bem quando já existem checkpoints de estilo. Checkpoint e VAE podem ser reutilizados, mas duração e consistência dependem de base model, motion module, context, frames e resolução.
1.3 Tabela de decisão Wan vs AnimateDiff
| Critério | Wan 2.2 | AnimateDiff |
|---|---|---|
| Tarefa | Text-to-video, image-to-video, text-image-to-video | Animação curta baseada em modelo SD |
| Ecossistema | Modelo de vídeo dedicado | SD 1.5/SDXL |
| Início de VRAM | Alguns workflows FP8 começam na classe de 16 GB; precisão original exige mais | Depende de base model, motion module e ajustes; teste pequeno e curto |
| Requisitos | Wan diffusion model + VAE + text encoder | Checkpoint SD + motion module |
| Uso indicado | Novo vídeo e maior necessidade de consistência | Modelos de estilo existentes e animações curtas |
| Complexidade | Alta: vários modelos e nodes | Média: motion module mais base checkpoint |
Escolha Wan quando quiser um clipe novo e aceitar uma pilha de modelos maior. Escolha AnimateDiff se já tiver um checkpoint SD compatível, precisar de uma animação curta ou quiser evitar um grande modelo de vídeo dedicado.
2. Preparar o workflow do Wan
Muitos testes falham na preparação: modelo na pasta errada, node ausente ou workflow para outra tarefa. Uma revisão breve evita corrigir cada erro depois de iniciar a queue.
2.1 Preparar os arquivos de modelo
Os arquivos Wan devem estar nos locais esperados. Pasta ou nome incorretos costumam deixar a lista de modelos vazia.
Pastas comuns:
| Pasta | Tipo | Observação |
|---|---|---|
models/diffusion_models/ | Modelo T2V/I2V | Variantes 480P/720P e fp16/fp8 |
models/vae/ | VAE de vídeo | Use o VAE indicado pelo workflow Wan |
models/clip_vision/ | Vision encoder | Necessário em alguns workflows I2V |
models/text_encoders/ | Text encoder | Use o encoder indicado |
Escolha de precisão:
- fp16: precisão original e maior consumo de VRAM
- fp8: menor precisão pode reduzir VRAM; meça com o workflow atual e seus logs
- bf16: use apenas quando hardware e workflow forem compatíveis
Wan muda rapidamente. Confira nomes exatos, links e variantes no tutorial oficial atual.
2.2 Instalar Custom Nodes
Um workflow de vídeo pode depender de vários node packs de terceiros. VideoHelperSuite é comum para importação e exportação; AnimateDiff normalmente exige ComfyUI-AnimateDiff-Evolved.
Etapas:
- Abra o ComfyUI Manager e instale os nodes indicados; instale
ComfyUI-VideoHelperSuitequando VHS for necessário - Instale
ComfyUI-AnimateDiff-Evolvedpara AnimateDiff - Verifique ffmpeg e dependências no README atual do VideoHelperSuite
- Reinicie o ComfyUI
Verificar ffmpeg:
ffmpeg -version
Se uma versão aparecer, ffmpeg está disponível. Com command not found, use winget install ffmpeg no Windows, sudo apt install ffmpeg no Linux ou brew install ffmpeg no macOS.
2.3 Importar um template de workflow
No primeiro teste, use um workflow T2V ou I2V do tutorial oficial em vez de montar todos os nodes.
Etapas:
- Baixe o JSON Wan T2V ou I2V no tutorial oficial
- Arraste para o ComfyUI o JSON ou uma imagem com metadados
- Diante de Missing Nodes, procure cada node no Manager ou instale manualmente o repositório correto
Ordem de diagnóstico:
- Confirme no ComfyUI Manager que o node pack está instalado
- Pesquise o nome exato do node ausente
- Se o Manager não encontrar, clone o repositório correto em
custom_nodes/ - Reinicie o ComfyUI
O guia de reutilização de workflows do ComfyUI detalha importação e Missing Nodes.
3. Executar Wan Text-to-Video
Com modelos e nodes prontos, rode um workflow T2V mínimo.
3.1 Nodes principais do workflow
Um workflow Wan T2V costuma cobrir estas funções; nomes exatos dependem do template oficial atual:
- Model loaders: carregar Wan T2V diffusion model, VAE e text encoder
- Video latent node: definir width, height e frames
- Text encoding: inserir prompts positivo e negativo
- Sampling: configurar steps, CFG, seed e opções relacionadas
- VAE Decode: decodificar frames de vídeo
- VideoHelperSuite ou equivalente: combinar frames em um arquivo
Diferenças para uma imagem estática:
- Configura
framesem vez de uma imagem única - Usa o VAE de vídeo compatível
- A saída geralmente inclui sequência e combinação de vídeo
3.2 Escrever o prompt de vídeo
O prompt precisa descrever continuidade temporal.
Pontos:
- Descreva movimento concreto: câmera (
camera following,slow pan) e personagem (walking,turning head) - Evite mudanças de cena: mantenha uma ação contínua
- Separe câmera e personagem: uma muda o ponto de vista, o outro muda o conteúdo do quadro
Exemplos:
A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background
O guia de prompts do Stable Diffusion explica a estrutura básica.
3.3 Ajustar frames, FPS e resolução
A relação é:
| Parâmetro | Significado | Valores de teste |
|---|---|---|
| frames | Total de frames | 16/24/48/72 |
| FPS | Frames reproduzidos por segundo | 12/16/24/30 |
| duration | Segundos = frames / FPS | Calcule com a fórmula |
Exemplos:
- 48 frames @ 16 FPS = 3 segundos
- 72 frames @ 12 FPS = 6 segundos
A resolução deve corresponder ao modelo e ao workflow. Templates comuns separam rotas 480P e 720P.
Mais frames e maior resolução aumentam normalmente a carga de sampling e VAE. A seção 6 oferece pontos prudentes.
3.4 Exportar o vídeo
Muitos workflows Wan geram uma sequência e depois usam Video Combine do VideoHelperSuite ou node semelhante.
Ajustes frequentes:
frame_rate: FPS de reproduçãoformat: mp4, gif, webp ou formato compatíveloutput_path: local de saída conforme a versão do node
Falhas comuns:
- Falta ffmpeg ou dependência: siga o README e verifique
ffmpeg -version - Sem permissão de escrita: altere a pasta
- Encoder incompatível: salve primeiro os frames e escolha formato aceito
4. Executar Wan Image-to-Video
Image-to-video usa uma imagem estática como frame inicial e gera movimento desse estado.
4.1 Conectar o workflow I2V
Diferenças principais entre I2V e T2V:
- Load Image: carregar imagem no tamanho esperado
- I2V model loader: carregar o modelo Wan I2V correspondente, não T2V
- CLIP Vision e text encoding: processar imagem e prompt conforme o workflow
- Sampling, VAE Decode e Video Combine: gerar e salvar
I2V e T2V podem usar arquivos e templates diferentes. Compare cada download com o template oficial.
4.2 Preparar a imagem inicial
A entrada influencia os frames posteriores.
Requisitos:
- Ajustar tamanho ao workflow
- Usar assunto claro e bordas definidas
- Evitar detalhes excessivos; fundo carregado e texturas densas aumentam a deriva
A imagem pode vir do ComfyUI ou de fonte externa que você tenha direito de usar.
4.3 Diagnosticar ajustes I2V
Uma falha comum começa com primeiro frame reconhecível e depois rosto e mãos derivam, deformam ou cintilam.
Causas e correções:
- Prompt incompatível: descreva movimento coerente com a imagem
- Imagem complexa: simplifique o fundo ou crie entrada mais limpa
- VRAM esgotada: reduza frames, resolução ou precisão
- Movimento grande: reduza motion ou strength quando disponível
Teste outra variante I2V ou seed se o modelo não combinar com o estilo.
5. Preparar um workflow AnimateDiff
AnimateDiff usa uma pilha diferente da Wan.
5.1 Preparar o Motion Module
O motion module é o componente central. Como pasta e formatos podem mudar no AnimateDiff-Evolved, use README atual, workflow de exemplo e lista do node.
Verifique se foi feito para SD 1.5, SDXL ou outra arquitetura e se combina com base checkpoint e workflow. Reinicie o ComfyUI depois do download e confirme que aparece no loader.
5.2 Escolher o Base Checkpoint
AnimateDiff não substitui o modelo base; adiciona movimento a um modelo de difusão de imagem compatível.
Escolha:
- Use checkpoint SD 1.5 ou SDXL compatível com motion module e workflow
- Teste checkpoints de estilo com poucos frames
- Não trate checkpoint normal como modelo de vídeo completo
Consulte o guia para escolher modelos Stable Diffusion.
5.3 Conectar o workflow
Um workflow AnimateDiff costuma incluir:
- Checkpoint Loader: carregar base checkpoint compatível
- Motion Model Loader: carregar motion module ou motion model
- Context Options: configurar context window
- Video latent node: definir resolução e frames
- Text encoding, sampling, VAE Decode e combinação de vídeo
A relação entre frames e context length depende da versão. Comece com valores do exemplo e mude um ajuste por vez.
6. Definir orçamento de parâmetros e desempenho
VRAM e duração são os principais limites locais. Estes valores são pontos iniciais, não garantias de GPU.
6.1 Matriz inicial de VRAM, frames e resolução
| VRAM | Início prudente | Pode testar | Evite no começo |
|---|---|---|---|
| 8 GB | AnimateDiff, resolução baixa, cerca de 16 frames, batch 1 | Workflows low-VRAM da comunidade | Wan em alta resolução, clipes longos, várias branches |
| 12 GB | AnimateDiff curto e pequeno | Wan de baixa precisão, pequeno e com poucos frames | Clipes 720P longos e pós-processamento complexo |
| 16 GB | Teste Wan FP8 curto conforme indicação oficial | Template 480P ou 720P correspondente | Várias branches simultâneas e vídeos longos |
| 24 GB+ | Mais margem para clipes curtos | Maior resolução ou frames | Batch, VAE e pós-processamento continuam limitados |
O requisito real varia com versão, GPU, VAE, custom nodes e workflow. A tabela serve apenas para escolher o primeiro teste.
6.2 Reduzir a carga nesta ordem
Se faltar VRAM:
- Reduza
frames, por exemplo de 48 para 24 ou 16 - Baixe de 720P para 480P ou tamanho compatível menor
- Mantenha batch em 1 e desative branches de controle e pós-processamento desnecessárias
- Se compatível, troque fp16 por fp8 ou precisão inferior
- Teste tiles espaciais e ajustes temporais de VAEDecodeTiled ou VAEEncodeTiled
- Use
--lowvramou opção compatível - Desative preview e feche outros aplicativos de GPU
Opções low-VRAM, cache e VAE tiled precisam ser testados com versão e workflow atuais.
6.3 Equilibrar duração e qualidade
Mais longo não significa melhor. Clipes curtos são mais fáceis; longos costumam exigir movimento menor e geração segmentada.
Riscos:
- Cintilação: cor ou brilho mudam entre frames
- Deformação: rosto, mãos ou contornos derivam
- Movimento fraco: prompt ou motion insuficiente
Para vídeo longo, valide um segmento curto e depois use continuation, I2V ou pós-produção compatível. Duplicar frames não garante consistência.
7. Entender saída e gravação de vídeo
Muitos workflows do ComfyUI produzem primeiro frames e os combinam depois com VideoHelperSuite ou node semelhante.
7.1 Funções dos nodes VideoHelperSuite
| Função | Uso | Ajustes frequentes |
|---|---|---|
| Load Video | Importar vídeo ou sequência | frame_count, frame_rate, width/height |
| Video Combine | Combinar frames | frame_rate, format, saída |
| Node Save Video | Salvar o arquivo | format, quality, save_output |
Nomes, parâmetros e formatos mudam com a extensão. Load Video importa vídeo existente; Video Combine ou equivalente converte frames em arquivo.
7.2 Converter FPS, frames e duração
A fórmula é:
duration (segundos) = frames / FPS
Exemplos:
- 48 frames @ 16 FPS = 3 segundos
- 72 frames @ 12 FPS = 6 segundos
Opções de FPS:
| FPS | Efeito |
|---|---|
| 12 | Os mesmos frames duram mais, mas o movimento pode parecer truncado |
| 16 | Equilíbrio entre duração e fluidez |
| 24 | A sequência roda mais rápido e termina antes |
| 30 | Mais frames são necessários para manter duração |
FPS controla a velocidade, mas não cria imagens intermediárias. Um clipe longo exige mais frames ou segmentos; maior fluidez pode exigir interpolação.
7.3 Corrigir falhas de gravação
| Falha | Correção |
|---|---|
| Falta ffmpeg ou dependência | Siga o README e verifique ffmpeg -version |
| Pasta sem permissão | Dê acesso de escrita ou use saída padrão |
| Encoder ou formato incompatível | Salve frames e escolha formato compatível |
| Frames não chegam ao saver | Revise latent, VAE Decode e conexões de saída |
8. Resolver erros comuns
Um workflow de vídeo pode falhar em várias camadas. Revise na ordem sem mudar ajustes desconectados ao mesmo tempo.
8.1 Resolver Missing Nodes
O workflow importado mostra blocos vermelhos Missing Nodes.
Ordem:
- Confirme no ComfyUI Manager os node packs necessários
- Pesquise o nome exato do node ausente
- Se não encontrar, clone o repositório em
custom_nodes/ - Reinicie o ComfyUI
O guia de reutilização de workflows do ComfyUI traz mais detalhes.
8.2 Corrigir caminhos de modelos
Uma pasta incorreta costuma deixar a lista vazia.
| Tipo | Pasta comum |
|---|---|
| Wan diffusion model | models/diffusion_models/ |
| Wan VAE | models/vae/ |
| CLIP Vision | models/clip_vision/ |
| text encoder | models/text_encoders/ |
| AnimateDiff motion module | Siga README atual e lista do node |
Faça nome, tarefa, resolução e precisão corresponderem ao workflow.
8.3 Resolver OOM
Esgotar VRAM é o erro de recurso mais comum.
Ordem:
- Reduza frames, resolução e precisão
- Mantenha batch em 1 e corte branches extras
- Teste VAEDecodeTiled ou temporal chunk
- Use opção compatível como
--lowvram - Desative preview e feche outros aplicativos GPU
8.4 Corrigir cintilação, deformação ou movimento fraco
| Problema | Causa provável | Ajuste |
|---|---|---|
| Cintilação | Consistência temporal baixa ou context/motion inadequado | Fixe seed, encurte teste e ajuste context ou motion |
| Deformação | Imagem complexa, movimento excessivo ou limite do modelo | Simplifique entrada, reduza movimento ou mude modelo |
| Movimento fraco | Prompt sem ação ou motion baixo | Adicione ação concreta e ajuste motion gradualmente |
| Qualidade baixa | Checkpoint, motion module ou VAE incompatíveis | Revise combinação e volte ao workflow de exemplo |
O guia de prompts Stable Diffusion ajuda a estruturar ações.
8.5 Corrigir VAE Decode travado
VAE Decode trava, fica muito lento ou chega a OOM.
Soluções:
- Reduza frames e resolução
- Teste VAEDecodeTiled com tiles espaciais ou temporal chunks
- Confirme que VAE corresponde ao workflow
- Baixe novamente um modelo danificado de fonte confiável e verifique
8.6 Corrigir deriva I2V após o primeiro frame
É um padrão comum em I2V.
| Causa | Ajuste |
|---|---|
| Prompt incompatível com imagem | Descreva movimento coerente com a entrada |
| Imagem inicial detalhada demais | Simplifique o fundo ou crie entrada mais limpa |
| Movimento grande demais | Comece com subtle motion ou slow camera push-in |
| Modelo I2V inadequado ao estilo | Teste outra variante, workflow ou seed |
9. Continuar com controle, pós-processamento e automação
Quando o primeiro workflow estiver estável, escolha o próximo passo conforme o limite real encontrado.
9.1 Guias relacionados da série
Este é o capítulo de vídeo da série prática ComfyUI e Stable Diffusion. Consulte estes pré-requisitos quando necessário:
- Introdução ao ComfyUI: estabilize primeiro imagens estáticas
- Reutilizar workflows do ComfyUI: importe JSON e resolva custom nodes
- Escolher modelos Stable Diffusion: selecione checkpoint compatível
- Prompts para Stable Diffusion: adicione ação e câmera a uma estrutura sólida
Outros artigos cobrem low-VRAM, reparo frame a frame, automação de API e conflitos de versão. Estabilize um workflow curto antes de adicionar camadas.
9.2 Documentação oficial e projetos
Comece pelas fontes oficiais:
- Documentação do ComfyUI
- ComfyUI Wan2.2 Tutorial: fonte principal para Wan
- Wan-Video/Wan2.2 no GitHub: variantes e tarefas
- ComfyUI-AnimateDiff-Evolved: implementação AnimateDiff
- ComfyUI-VideoHelperSuite: importação e exportação
- Documentação do VAEDecodeTiled: VAE tiled
- ComfyUI Startup Flags: opções low-VRAM
9.3 Licenças e uso comercial
Verifique a licença atual de cada modelo:
- Para Wan 2.2, consulte LICENSE em Wan-Video/Wan2.2
- Para AnimateDiff, consulte LICENSE em AnimateDiff
Antes do uso comercial, confirme:
- Se a licença permite uso comercial
- Se você tem direitos sobre o material, principalmente a imagem inicial I2V
- Como os direitos do conteúdo gerado se aplicam ao projeto e à plataforma
Isto não é aconselhamento jurídico. A licença atual do repositório é a referência.
Conclusão
Wan e AnimateDiff atendem workflows de vídeo diferentes no ComfyUI. Wan cria vídeo desde texto ou imagem inicial; AnimateDiff reutiliza checkpoints compatíveis em animações curtas. Pastas, versões de nodes e templates devem corresponder ao workflow real. A matriz é um começo prudente, não garantia de GPU. Se faltarem recursos, reduza frames, resolução, branches, precisão e carga do VAE nessa ordem.
Para Missing Nodes, caminhos de modelos, OOM, cintilação, deformação, VAE Decode travado ou falha de exportação, diagnostique camada por camada. Comece com poucos frames, resolução baixa e batch 1, valide a cadeia completa e aumente uma variável por teste.
Executar o primeiro workflow de vídeo curto no ComfyUI
Valide a cadeia completa, da escolha da rota e dos modelos ao teste mínimo e à exportação.
- 1
Step 1: Verificar o workflow básico
Confirme que o ComfyUI gera imagens estáticas com estabilidade e que você sabe importar workflow, identificar nodes ausentes e revisar caminhos de modelos. - 2
Step 2: Escolher a rota de vídeo
Use Wan T2V para texto, Wan I2V para uma imagem inicial ou AnimateDiff quando precisar reutilizar um checkpoint SD. - 3
Step 3: Preparar os modelos
Siga o workflow e a documentação oficial para obter diffusion model, VAE, text encoder, CLIP Vision ou motion module. - 4
Step 4: Instalar os nodes necessários
Instale os custom nodes pelo ComfyUI Manager e prepare uma extensão de exportação como VideoHelperSuite. - 5
Step 5: Rodar um teste mínimo
Comece com poucos frames, resolução pequena e batch 1, sem ControlNet, upscale ou pós-processamento complexo. - 6
Step 6: Combinar e salvar o vídeo
Depois de gerar frames, defina frame rate e formato e exporte com Video Combine, Save Video ou node equivalente. - 7
Step 7: Aumentar uma variável por vez
Fixe o seed e mude apenas um valor por teste; diante de OOM, cintilação ou deriva, recue em frames, resolução, precisão e VAE.
FAQ
É melhor começar com Wan ou AnimateDiff para vídeo no ComfyUI?
Qual é a diferença entre frames e FPS no ComfyUI?
Por que o ComfyUI gera imagens em vez de um arquivo mp4?
É possível gerar vídeo no ComfyUI com 8 GB de VRAM?
Por que image-to-video se afasta da imagem inicial?
O que fazer quando a geração trava em VAE Decode?
14 min de leitura · Publicado em: 23 jul 2026 · Atualizado em: 24 jul 2026
Guia prático de ComfyUI e Stable Diffusion
Se você chegou pela busca, o caminho mais rápido é ir para o post anterior ou próximo desta série.
Anterior
Otimizar o ComfyUI com pouca VRAM: SDXL, FLUX e vídeo em GPUs de 6–8 GB
Execute o ComfyUI com 6–8 GB de VRAM controlando modelo, T5, VAE, resolução e batch, e diagnostique OOM e workflows FLUX ou de vídeo lentos.
Parte 8 de 10
Próximo
Automatizar a geração de imagens com a API do ComfyUI
Exporte um workflow API, envie para /prompt, aguarde pelo WebSocket, baixe resultados e adicione parâmetros, limites de fila e rastreamento backend.
Parte 10 de 10



Comentários
Entre com GitHub para comentar