Design wechseln

ComfyUI-Videos mit Wan und AnimateDiff erstellen

Easton editorial illustration: one large rounded charcoal node-canvas console, one orange video filmstrip emerging from the workflow

"Das offizielle ComfyUI-Tutorial zu Wan 2.2 enthält Text-to-Video- und Image-to-Video-Workflows, Modellpfade und Präzisionsvarianten."

Du kannst in ComfyUI bereits ein gelungenes Standbild erzeugen und möchtest es nun bewegen. Nach dem Import des Video-Workflows erscheinen jedoch überall Missing Nodes oder die VRAM-Anzeige springt sofort auf 99 %. Solltest du Wan oder AnimateDiff verwenden? In welche Ordner gehören die Modelle? Wie lassen sich Frames und Speicherbedarf abwägen, und wie wird aus einer Bildfolge eine mp4-Datei? Beginne mit der Verfahrenswahl, einer Vorbereitungsliste und einem vorsichtigen Parameterbudget; danach lassen sich die häufigsten Fehler systematisch prüfen.

1. Wan oder AnimateDiff wählen

Wähle das Verfahren, bevor du den Workflow aufbaust. Wan und AnimateDiff sind unterschiedliche Systeme mit anderen Voraussetzungen, Einsatzbereichen und Komplexitätsstufen.

1.1 Wan als eigenständiges Videomodell

Wan 2.2 ist eine offene Videomodellfamilie für Text-to-Video (T2V), Image-to-Video (I2V) und Text-Image-to-Video (TI2V). Sie nutzt eine Mixture-of-Experts-Architektur sowie eigene Gewichte, VAE und Text Encoder. Für einige FP8-Workflows nennt das offizielle ComfyUI-Tutorial mehr als 16 GB VRAM als Ausgangspunkt; Varianten in ursprünglicher Präzision brauchen gewöhnlich mehr. Wan eignet sich für neue Videos und höhere Anforderungen an zeitliche Konsistenz.

Das Wan-Ökosystem ist von normalen SD-Checkpoints getrennt. Daher brauchst du alle vom Workflow verlangten Dateien, etwa Diffusion Model, VAE und Text Encoder. Für den Einstieg sind kurze Clips von zwei bis vier Sekunden sinnvoll.

1.2 AnimateDiff erweitert das SD-Ökosystem um Bewegung

AnimateDiff ergänzt kompatible Stable-Diffusion-Modelle wie SD 1.5 oder SDXL um Bewegung. Zentral ist ein Motion Module, das mit einem Base Checkpoint zusammenarbeitet. Da sich Modellordner mit AnimateDiff-Evolved ändern können, gelten das aktuelle README und die Modellauswahl im Node. Ein typischer Workflow lädt SD-Checkpoint und passendes Motion Module für eine kurze Animation.

AnimateDiff eignet sich, wenn bereits Stil-Checkpoints vorhanden sind und kurze oder stilisierte Animationen entstehen sollen. Checkpoint und VAE lassen sich wiederverwenden, doch Dauer und Konsistenz hängen von Base Model, Motion Module, Context-Einstellungen, Frames und Auflösung ab.

1.3 Entscheidungstabelle Wan vs AnimateDiff

KriteriumWan 2.2AnimateDiff
AufgabeText-to-Video, Image-to-Video, Text-Image-to-VideoKurze Animation auf Basis eines SD-Modells
ModellökosystemEigenständiges VideomodellSD 1.5/SDXL
VRAM-EinstiegEinige FP8-Workflows beginnen in der 16-GB-Klasse; Originalpräzision braucht mehrAbhängig von Base Model, Motion Module und Einstellungen; klein und kurz testen
VoraussetzungenWan Diffusion Model + VAE + Text EncoderSD-Checkpoint + Motion Module
Geeignet fürNeue Videos und höhere KonsistenzanforderungenVorhandene Stilmodelle und kurze Animationen
Workflow-KomplexitätHöher: mehrere Modelle und NodesMittel: Motion Module plus Base Checkpoint

Wan passt, wenn ein neuer Clip entstehen soll und ein größerer Modellstapel akzeptabel ist. AnimateDiff ist sinnvoll, wenn ein kompatibler stilisierter SD-Checkpoint bereits vorliegt, eine kurze Animation genügt oder kein großes eigenständiges Videomodell geladen werden soll.

2. Wan-Workflow vorbereiten

Viele Wan-Läufe scheitern schon bei der Vorbereitung: Modell im falschen Ordner, fehlender Node oder Workflow für die falsche Aufgabe. Eine kurze Prüfung spart spätere Fehlersuche in der Queue.

2.1 Modelldateien vorbereiten

Wan-Dateien müssen an den vom Workflow erwarteten Orten liegen. Falsche Ordner oder Dateinamen führen oft zu leeren Modelllisten.

Übliche Wan-Ordner:

OrdnerDateitypHinweis
models/diffusion_models/T2V/I2V Diffusion ModelVarianten für 480P/720P und fp16/fp8
models/vae/Video-VAEDie zum Workflow gehörende Wan-VAE verwenden
models/clip_vision/Vision EncoderFür einige I2V-Workflows erforderlich
models/text_encoders/Text EncoderDen im Workflow genannten Encoder verwenden

Präzision wählen:

  • fp16: ursprüngliche Präzision und höchster VRAM-Bedarf
  • fp8: geringere Präzision kann VRAM sparen; tatsächlichen Bedarf mit aktuellem Workflow und eigenen Logs bestimmen
  • bf16: nur verwenden, wenn Hardware und Workflow es unterstützen

Wan entwickelt sich schnell. Prüfe genaue Dateinamen, Downloadlinks und Präzisionsvarianten im aktuellen offiziellen Tutorial.

2.2 Custom Nodes installieren

Video-Workflows können von mehreren Node-Paketen Dritter abhängen. VideoHelperSuite wird oft für Import und Export verwendet; AnimateDiff erfordert gewöhnlich ComfyUI-AnimateDiff-Evolved.

Installation:

  1. ComfyUI Manager öffnen und die vom Workflow genannten Nodes installieren; bei Bedarf ComfyUI-VideoHelperSuite installieren
  2. Für AnimateDiff ComfyUI-AnimateDiff-Evolved installieren
  3. ffmpeg und weitere Abhängigkeiten anhand des aktuellen VideoHelperSuite-README prüfen
  4. ComfyUI neu starten

ffmpeg prüfen:

ffmpeg -version

Wenn Versionsdaten erscheinen, ist ffmpeg verfügbar. Bei command not found installierst du es unter Windows mit winget install ffmpeg, unter Linux mit sudo apt install ffmpeg oder unter macOS mit brew install ffmpeg.

2.3 Workflow-Vorlage importieren

Für den ersten Wan-Lauf ist eine offizielle T2V- oder I2V-Vorlage besser als ein vollständig selbst gebauter Graph.

Import:

  1. Wan-T2V- oder I2V-Workflow-JSON aus dem offiziellen Tutorial laden
  2. JSON oder Beispielbild mit Workflow-Metadaten in ComfyUI ziehen
  3. Bei Missing Nodes jeden Namen in Manager suchen oder das richtige Repository manuell installieren

Reihenfolge bei Missing Nodes:

  1. Prüfen, ob ComfyUI Manager das benötigte Paket als installiert anzeigt
  2. Exakten Namen des fehlenden Nodes suchen
  3. Falls Manager nichts findet, das korrekte Repository nach custom_nodes/ klonen
  4. ComfyUI neu starten

Der Leitfaden zur Wiederverwendung von ComfyUI-Workflows erklärt Import und Missing Nodes ausführlicher.

3. Wan Text-to-Video ausführen

Nach der Modell- und Node-Vorbereitung folgt ein minimaler T2V-Lauf.

3.1 Wichtige Workflow-Nodes

Ein Wan-T2V-Workflow enthält gewöhnlich folgende Aufgaben; die konkreten Namen richten sich nach der aktuellen offiziellen Vorlage:

  1. Model Loader: Wan T2V Diffusion Model, VAE und Text Encoder laden
  2. Video Latent Node: Breite, Höhe und Frames einstellen
  3. Text Encoding: positiven und negativen Prompt eingeben
  4. Sampling: Steps, CFG, Seed und verwandte Werte setzen
  5. VAE Decode: Videoframes decodieren
  6. VideoHelperSuite oder gleichwertiger Saver: Frames als Videodatei zusammenführen

Unterschiede zum Standbild-Workflow:

  • Statt eines einzelnen Bildes werden frames festgelegt
  • Die passende Video-VAE wird verwendet, nicht irgendeine Standbild-VAE
  • Die Ausgabekette enthält häufig Bildfolge und Videozusammenführung

3.2 Video-Prompt formulieren

Ein Video-Prompt muss zeitliche Kontinuität beschreiben.

Wichtige Punkte:

  • Bewegung konkret benennen: Kamerabewegung wie camera following oder slow pan und Motivbewegung wie walking oder turning head
  • Szenenwechsel vermeiden: eine zusammenhängende Szene statt „erst im Park, danach im Café“
  • Kamera und Motiv trennen: Die Kamera verändert den Blickwinkel, das Motiv den Inhalt im Bild

Beispiele:

A woman walking in a park, camera following from behind, soft sunlight, 4K
A cat playing with a ball, slow motion, bokeh background

Der Stable-Diffusion-Prompt-Leitfaden erklärt die grundlegende Prompt-Struktur.

3.3 Frames, FPS und Auflösung einstellen

Frames, FPS und Dauer hängen so zusammen:

ParameterBedeutungÜbliche Testwerte
framesGesamtzahl erzeugter Frames16/24/48/72
FPSWiedergabeframes pro Sekunde12/16/24/30
durationSekunden = frames / FPSMit der Formel berechnen

Beispiele:

  • 48 frames @ 16 FPS = 3 Sekunden
  • 72 frames @ 12 FPS = 6 Sekunden

Die Auflösung muss zum Modell und Workflow passen. Häufig unterscheiden Vorlagen zwischen 480P und 720P.

Mehr Frames und höhere Auflösung steigern gewöhnlich die Last beim Sampling und VAE-Prozess. Abschnitt 6 enthält vorsichtige Startwerte.

3.4 Video exportieren

Viele Wan-Workflows erzeugen zuerst eine Bildfolge und kombinieren sie dann mit Video Combine aus VideoHelperSuite oder einem ähnlichen Node.

Typische Einstellungen:

  • frame_rate: Wiedergabe-FPS
  • format: unterstütztes Format wie mp4, gif oder webp
  • output_path: Ausgabeort; der genaue Feldname hängt von der Node-Version ab

Typische Exportfehler:

  • ffmpeg oder Node-Abhängigkeit fehlt: Extension-README befolgen und ffmpeg -version prüfen
  • Keine Schreibrechte: Zielordner anpassen
  • Encoder nicht unterstützt: zuerst Frames speichern, danach ein unterstütztes Format wählen

4. Wan Image-to-Video ausführen

Image-to-Video verwendet ein Standbild als Startframe und erzeugt daraus Bewegung.

4.1 I2V-Workflow verbinden

Die wichtigsten Unterschiede zwischen I2V und T2V:

  1. Load Image: Startbild in kompatibler Größe laden
  2. I2V Model Loader: passendes Wan-I2V-Modell statt einer T2V-Variante laden
  3. CLIP Vision und Text Encoding: Bild und Prompt gemäß Workflow verarbeiten
  4. Sampling, VAE Decode und Video Combine: Ergebnis erzeugen und speichern

I2V und T2V können andere Dateien und Vorlagen verwenden. Gleiche jeden Download mit der offiziellen Vorlage ab.

4.2 Startbild vorbereiten

Das Eingangsbild beeinflusst die späteren Frames stark.

Anforderungen:

  • Bildgröße an den Workflow anpassen
  • Klares Motiv mit sauberen Kanten verwenden
  • Zu viele Details vermeiden; unruhige Hintergründe und feine Texturen können Drift verstärken

Das Bild kann aus ComfyUI stammen oder aus einer externen Quelle, deren Nutzungsrechte du besitzt.

4.3 I2V-Probleme eingrenzen

Ein typischer Fehler beginnt mit einem ähnlichen ersten Frame, danach driften Gesicht und Hände, verformen sich oder flackern.

Ursachen und Maßnahmen:

  • Prompt passt nicht zum Bild: eine für das Motiv plausible Bewegung beschreiben
  • Startbild zu komplex: Hintergrund vereinfachen oder ein klareres Bild erzeugen
  • VRAM erschöpft: Frames, Auflösung oder Präzision senken
  • Bewegung zu stark: vorhandene Motion- oder Strength-Werte verringern

Bei ungeeignetem Stil eine andere I2V-Modellvariante oder einen anderen Seed testen.

5. AnimateDiff-Workflow vorbereiten

AnimateDiff verwendet einen anderen Modellstapel als Wan.

5.1 Motion Module vorbereiten

Das Motion Module ist die zentrale AnimateDiff-Komponente. Ordner und Formate können sich mit AnimateDiff-Evolved ändern; maßgeblich sind aktuelles README, Beispiel-Workflow und Modellliste des Nodes.

Prüfe mindestens, ob das Modul für SD 1.5, SDXL oder eine andere Architektur gedacht ist und zu Base Checkpoint und Workflow passt. Nach dem Download ComfyUI neu starten und prüfen, ob es im AnimateDiff-Evolved-Loader erscheint.

5.2 Base Checkpoint wählen

AnimateDiff ersetzt das Basismodell nicht, sondern ergänzt ein kompatibles Bild-Diffusionsmodell um Bewegung.

Auswahl:

  • Einen zum Motion Module und Workflow passenden SD-1.5- oder SDXL-Checkpoint verwenden
  • Vorhandene Stil-Checkpoints mit wenigen Frames auf Kompatibilität testen
  • Einen normalen Checkpoint nicht als vollständiges Videomodell behandeln

Grundlagen enthält der Leitfaden zur Stable-Diffusion-Modellwahl.

5.3 Workflow verbinden

Ein AnimateDiff-Workflow umfasst gewöhnlich:

  1. Checkpoint Loader: kompatiblen Base Checkpoint laden
  2. Motion Model Loader: Motion Module oder Motion Model laden
  3. Context Options: Context Window einstellen
  4. Video Latent Node: Auflösung und Frames festlegen
  5. Text Encoding, Sampling, VAE Decode und Videozusammenführung

Der Zusammenhang von Gesamtframes und Context Length hängt von Node-Version und Workflow ab. Mit kompatiblen Beispielwerten beginnen und jeweils nur einen Wert ändern.

6. Parameter- und Leistungsbudget festlegen

VRAM und Cliplänge sind die wichtigsten Grenzen lokaler Video-Workflows. Die folgenden Werte sind vorsichtige Startpunkte, keine GPU-Garantie.

6.1 Startmatrix für VRAM, Frames und Auflösung

VRAMSicherer StartTestbarZunächst vermeiden
8 GBAnimateDiff, kleine Auflösung, etwa 16 Frames, Batch 1Community-Low-VRAM-WorkflowsHochauflösendes Wan, lange Clips, mehrere Kontrollzweige
12 GBAnimateDiff mit wenigen Frames und kleiner AuflösungWan mit niedriger Präzision, klein und kurzLange 720P-Clips und komplexe Nachbearbeitung
16 GBKurzer Wan-FP8-Test nach offizieller EmpfehlungPassende 480P- oder 720P-VorlageMehrere parallele Zweige und lange Videos
24 GB+Mehr Spielraum für die meisten kurzen ExperimenteHöhere Auflösung oder mehr FramesBatch, VAE und Nachbearbeitung brauchen weiter Grenzen

Der tatsächliche Bedarf variiert mit Modellversion, GPU-Architektur, VAE, Custom Nodes und Workflow. Die Tabelle bestimmt nur den ersten Test und garantiert keinen erfolgreichen Lauf auf einer bestimmten GPU.

6.2 Last in dieser Reihenfolge reduzieren

Bei zu wenig VRAM:

  1. frames etwa von 48 auf 24 oder 16 reduzieren
  2. Auflösung von 720P auf 480P oder eine kleinere unterstützte Größe senken
  3. Batch auf 1 lassen und unnötige Kontroll- und Nachbearbeitungszweige deaktivieren
  4. Wenn unterstützt, von fp16 auf fp8 oder eine andere niedrigere Präzision wechseln
  5. Räumliche Tiles und temporale Videoeinstellungen in VAEDecodeTiled oder VAEEncodeTiled testen
  6. Unterstützte Startoptionen wie --lowvram verwenden
  7. Vorschau deaktivieren und andere GPU-intensive Anwendungen schließen

Low-VRAM-Flags, Cache und Tiled VAE müssen mit aktueller ComfyUI-Version und konkretem Workflow getestet werden.

6.3 Dauer und Qualität abwägen

Länger ist nicht automatisch besser. Kurze Clips lassen sich leichter kontrollieren; längere brauchen kleinere Bewegungen und häufig eine Segmentierung.

Risiken:

  • Flackern: Farbe oder Helligkeit springen zwischen Frames
  • Verformung: Gesicht, Hände oder Konturen driften
  • Schwache Bewegung: Prompt oder Motion-Einstellung beschreibt zu wenig Bewegung

Für längere Videos zuerst einen kurzen Abschnitt validieren und danach unterstützte Continuation-, I2V- oder Nachbearbeitungsverfahren verwenden. Doppelte frames garantieren keine Konsistenz.

7. Videoausgabe und Speicherung verstehen

Viele ComfyUI-Video-Workflows erzeugen zuerst Frames und kombinieren sie anschließend mit VideoHelperSuite oder einem ähnlichen Node.

7.1 Aufgaben der VideoHelperSuite-Nodes

Node-AufgabeFunktionHäufige Einstellungen
Load VideoVideo oder Bildfolge importierenframe_count, frame_rate, width/height
Video CombineFrames zu Video verbindenframe_rate, format, Ausgabeeinstellungen
Save-Video-NodeVideodatei speichernformat, quality, save_output

Node-Namen, Parameter und Formate ändern sich mit der Extension. Load Video importiert vorhandene Videos; Video Combine oder ein gleichwertiger Node erzeugt aus Frames eine Videodatei.

7.2 FPS, Frames und Dauer umrechnen

Die Dauer lautet:

duration (Sekunden) = frames / FPS

Beispiele:

  • 48 frames @ 16 FPS = 3 Sekunden
  • 72 frames @ 12 FPS = 6 Sekunden

FPS-Auswahl:

FPSWirkung
12Gleiche Frames laufen länger, Bewegung kann ruckeliger wirken
16Kompromiss aus Dauer und Flüssigkeit
24Gleiche Bildfolge läuft schneller und endet früher
30Für gleiche Dauer werden mehr Frames benötigt

FPS steuert die Wiedergabegeschwindigkeit und erzeugt keine Zwischenbilder. Längere Clips brauchen mehr Frames oder Segmente; flüssigere Bewegung kann Interpolation oder Nachbearbeitung erfordern.

7.3 Speicherfehler beheben

FehlerMaßnahme
ffmpeg oder Node-Abhängigkeit fehltExtension-README befolgen und ffmpeg -version prüfen
Ausgabeordner nicht beschreibbarSchreibrechte geben oder Standardordner verwenden
Encoder oder Format nicht unterstütztZuerst Frames speichern, dann ein unterstütztes Format wählen
Keine Frames am SaverVerbindung von Latent, VAE Decode und Saver prüfen

8. Häufige Fehler beheben

Video-Workflows besitzen mehrere Fehlerstellen. Prüfe sie von oben nach unten, statt unabhängige Einstellungen gleichzeitig zu ändern.

8.1 Missing Nodes beheben

Der importierte Workflow zeigt rote Missing-Nodes-Blöcke.

Reihenfolge:

  1. In ComfyUI Manager prüfen, ob die benötigten Pakete installiert sind
  2. Nach dem exakten Namen des fehlenden Nodes suchen
  3. Falls Manager ihn nicht findet, das richtige Repository nach custom_nodes/ klonen
  4. ComfyUI neu starten

Mehr Details liefert der Leitfaden zur Wiederverwendung von ComfyUI-Workflows.

8.2 Fehlerhafte Modellpfade korrigieren

Ein falscher Modellordner führt häufig zu leeren Auswahllisten.

ModelltypÜblicher Ordner
Wan Diffusion Modelmodels/diffusion_models/
Wan VAEmodels/vae/
CLIP Visionmodels/clip_vision/
Text Encodermodels/text_encoders/
AnimateDiff Motion ModuleAktuelles AnimateDiff-Evolved-README und Node-Liste beachten

Dateinamen an den Workflow anpassen und Aufgabe, Auflösung sowie Präzision unterscheiden.

8.3 OOM beheben

VRAM-Erschöpfung ist der häufigste Ressourcenfehler bei Videos.

Reihenfolge:

  1. Frames, Auflösung und Modellpräzision senken
  2. Batch auf 1 lassen und zusätzliche Kontroll- oder Nachbearbeitungszweige deaktivieren
  3. VAEDecodeTiled oder Temporal Chunk testen
  4. Unterstützte Startoptionen wie --lowvram verwenden
  5. Vorschau deaktivieren und andere GPU-Anwendungen schließen

8.4 Flackern, Verformung oder zu wenig Bewegung korrigieren

ProblemMögliche UrsacheAnpassung
FlackernSchwache zeitliche Konsistenz oder unpassende Context-/Motion-WerteSeed fixieren, Test verkürzen, Context oder Motion anpassen
VerformungKomplexes Startbild, zu große Bewegung oder ModellgrenzeBild vereinfachen, Bewegung senken, passenderes Modell wählen
Wenig BewegungPrompt ohne konkrete Aktion oder Motion zu schwachKonkrete Aktion ergänzen und unterstützte Motion-Werte vorsichtig erhöhen
QualitätsverlustCheckpoint, Motion Module oder VAE passen nichtKombination prüfen und zum offiziellen Beispiel-Workflow zurückkehren

Die Prompt-Struktur erklärt der Stable-Diffusion-Prompt-Leitfaden.

8.5 Hängendes VAE Decode beheben

VAE Decode hängt, ist extrem langsam oder läuft in OOM.

Maßnahmen:

  • Frames und Auflösung reduzieren
  • VAEDecodeTiled mit räumlichen Tiles oder Temporal Chunks testen
  • Prüfen, ob die VAE zum Workflow gehört
  • Beschädigte Modelldatei aus vertrauenswürdiger Quelle neu laden und verifizieren

8.6 I2V-Drift nach dem ersten Frame beheben

Dieses Muster tritt bei I2V häufig auf.

UrsacheAnpassung
Prompt passt nicht zum StartbildEine zum Bild passende Bewegung beschreiben
Startbild zu detailliertHintergrund vereinfachen oder klareres Bild erzeugen
Bewegung zu großMit subtle motion oder slow camera push-in beginnen
I2V-Modell passt nicht zum StilAndere Modellvariante, Workflow oder Seed testen

9. Mit Kontrolle, Nachbearbeitung und Automatisierung fortfahren

Wenn der erste Workflow vollständig läuft, wähle den nächsten Schritt anhand der tatsächlichen Grenze.

9.1 Verwandte Artikel der Serie

Dies ist der Videoabschnitt der ComfyUI- und Stable-Diffusion-Praxisserie. Bei Bedarf helfen diese Grundlagen:

Weitere Serienartikel behandeln Low-VRAM-Optimierung, Frame-Reparatur, API-Automatisierung und komplexe Versionskonflikte. Stabilisiere zuerst einen kurzen Video-Workflow.

9.2 Offizielle Dokumentation und Projekte

Nutze zuerst offizielle Dokumentation und Projekt-Repositories:

9.3 Lizenzen und kommerzielle Nutzung

Prüfe die aktuellen Lizenzbedingungen jedes Videomodells:

Vor kommerzieller Nutzung prüfen:

  • Erlaubt die Modelllizenz kommerzielle Nutzung?
  • Besitzt du die Rechte am Ausgangsmaterial, besonders am I2V-Startbild?
  • Wie werden Rechte an generierten Inhalten im Projekt und auf der Plattform behandelt?

Dies ist keine Rechtsberatung. Maßgeblich ist die aktuelle Lizenz im jeweiligen Repository.

Fazit

Wan und AnimateDiff bedienen unterschiedliche ComfyUI-Video-Workflows. Wan erzeugt Video aus Text oder Startbild; AnimateDiff verwendet kompatible Stil-Checkpoints für kurze Animationen. Modellordner, Node-Version und Vorlage müssen zum konkreten Workflow passen. Die Matrix ist ein vorsichtiger Startpunkt, keine GPU-Garantie. Bei knappen Ressourcen reduzierst du nacheinander Frames, Auflösung, Zweige, Präzision und VAE-Last.

Missing Nodes, Modellpfade, OOM, Flackern, Verformung, hängendes VAE Decode und Exportfehler werden schichtweise geprüft. Beginne mit wenigen Frames, kleiner Auflösung und Batch 1, bestätige die vollständige Kette und erhöhe danach pro Test nur eine Variable.

Den ersten kurzen Video-Workflow in ComfyUI ausführen

Von der Auswahl des Verfahrens und der Modellvorbereitung bis zum Minimaltest und Videoexport wird die gesamte Kette geprüft.

  1. 1

    Step 1: Basis-Workflow prüfen

    Stelle sicher, dass ComfyUI zuverlässig Standbilder erzeugt und du Workflows importieren, fehlende Nodes erkennen und Modellpfade prüfen kannst.
  2. 2

    Step 2: Videoverfahren wählen

    Nutze Wan T2V für Text-zu-Video, Wan I2V für ein Startbild oder AnimateDiff, wenn du einen SD-Checkpoint wiederverwenden möchtest.
  3. 3

    Step 3: Modelldateien vorbereiten

    Beschaffe gemäß Workflow und offizieller Anleitung Diffusion Model, VAE, Text Encoder, CLIP Vision oder Motion Module.
  4. 4

    Step 4: Erforderliche Nodes installieren

    Installiere die Custom Nodes des Workflows über ComfyUI Manager und richte eine Exporterweiterung wie VideoHelperSuite ein.
  5. 5

    Step 5: Minimaltest starten

    Beginne mit wenigen Frames, kleiner Auflösung und Batch 1, ohne ControlNet, Upscaling oder komplexe Nachbearbeitung.
  6. 6

    Step 6: Video zusammenführen und speichern

    Wenn Frames erzeugt werden, stelle Framerate und Format ein und exportiere über Video Combine, Save Video oder einen gleichwertigen Node.
  7. 7

    Step 7: Variablen einzeln erhöhen

    Fixiere den Seed und ändere pro Test nur einen Wert; bei OOM, Flackern oder Drift gehe bei Frames, Auflösung, Präzision und VAE zurück.

FAQ

Sollte ich für ComfyUI-Videos mit Wan oder AnimateDiff beginnen?
Wan passt, wenn du aus Text oder Bild ein neues Video erzeugen willst. AnimateDiff passt, wenn bereits SD-Checkpoints, LoRAs und Stilressourcen vorhanden sind und du kurze Animationen erstellen möchtest.
Was ist der Unterschied zwischen Frames und FPS in ComfyUI?
Frames ist die Gesamtzahl der erzeugten Bilder. FPS gibt an, wie viele davon pro Sekunde abgespielt werden. Die Dauer ergibt sich aus Frames geteilt durch FPS.
Warum liefert ComfyUI Einzelbilder statt einer mp4-Datei?
Viele Workflows erzeugen zuerst Frames und kombinieren sie anschließend mit VideoHelperSuite, Video Combine oder einem ähnlichen Speicher-Node zu mp4, gif oder webp.
Lässt sich ComfyUI-Video mit 8 GB VRAM ausführen?
Kurze AnimateDiff-Workflows mit kleiner Auflösung oder Community-Low-VRAM-Workflows lassen sich testen. Modellpräzision, VAE, Custom Nodes, GPU-Backend und Workflow entscheiden über das Ergebnis; hochauflösende lange Wan-Videos sind keine verlässliche Erwartung.
Warum driftet Image-to-Video vom Ausgangsbild weg?
Ein Startbild fixiert nicht den gesamten Clip. Große Bewegungen, komplexe Eingaben und längere Bildfolgen erhöhen das Risiko, dass Gesichter, Hände, Kleidung und Hintergründe abweichen.
Was tun, wenn die Generierung bei VAE Decode hängen bleibt?
Reduziere zuerst Frames und Auflösung. Teste danach räumliche Tiles oder Temporal Chunks in VAEDecodeTiled, prüfe die VAE-Zuordnung und nutze bei Bedarf Low-VRAM-Einstellungen.

13 Min. Lesezeit · Veröffentlicht am: 23. Juli 2026 · Aktualisiert am: 24. Juli 2026

Kommentare

Melde dich mit GitHub an, um einen Kommentar zu hinterlassen

Easton BlogEaston Blog