Rang #1 Lokale Videogenerierung — Deine GPU, dein Regiestuhl
Alibaba Cloud (Tongyi Lab)

Wan 2.7

Das offene Videomodell, das gelernt hat, vor dem Drehen zu denken. Wan 2.7 ist Alibabas größter Sprung bisher — ein 27B Mixture-of-Experts-Modell, das die Szene plant, Audio nativ synchronisiert und Erstes- und Letztes-Frame-Kontrolle bietet. Alles unter Apache 2.0. Kein Kleingedrucktes.

Aktualisiert April 2026 Open WeightApache 2.0Text-to-Video
Am besten für

Das offene Videomodell, das gelernt hat, vor dem Drehen zu denken. Wan 2.7 ist Alibabas größter Sprung bisher — ein 27B Mixture-of-Experts-Modell, das die Szene plant, Audio nativ synchronisiert und Erstes- und Letztes-Frame-Kontrolle bietet. Alles unter Apache 2.0. Kein Kleingedrucktes.

Warum es gewinnt

Thinking Mode plant die Szenenstruktur vor der Generierung und reduziert Motion Drift dramatisch. Native Audio-Synchronisation in einem Durchlauf. Erstes-und-Letztes-Frame-Kontrolle für präzise Übergänge. Bis zu 9 multimodale Referenz-Inputs für Charakterkonsistenz. Instruktionsbasierte Videobearbeitung. 27B MoE-Architektur. Apache 2.0.

Zu beachten

Der Thinking Mode, der es besonders macht, macht es auch langsamer. Kein offizielles Sign-up-and-go Cloud-API. Der 27B-Maßstab erfordert seriöse Hardware für lokale Bereitstellung. Dokumentation bleibt primär Chinesisch-first.

01

Was es wirklich ist

Wan 2.7 ist das, was passiert, wenn Alibaba fragt: Was wäre, wenn die KI über dein Video nachdenken würde, bevor sie es macht?

Jede frühere Version der Wan-Serie — und die meisten KI-Videogeneratoren generell — funktioniert gleich: Prompt empfangen, Video generieren, das Beste hoffen. Wan 2.7 bricht dieses Muster. Sein Thinking Mode interpretiert deinen Prompt, plant Szenenstruktur und Erzählbogen, berücksichtigt Komposition und Bewegungsdynamik — und beginnt dann erst mit dem Rendering. Das Ergebnis ist weniger generisch, weniger driftig, intentionstreuer. Der Unterschied zwischen einem Kameramann und einem Regisseur.

Das technische Fundament ist eine 27B Mixture-of-Experts-Architektur mit einem Diffusion Transformer und Full Attention — speziell dafür konzipiert, räumliche und zeitliche Beziehungen gleichzeitig zu verarbeiten.

Die praktischen Upgrades sind ebenso bedeutend: Erstes-und-Letztes-Frame-Kontrolle für präzise Übergänge, bis zu 9 multimodale Referenz-Inputs für Charakter-Konsistenz, natives Audio in einem Durchlauf, instruktionsbasierte Bearbeitung ohne Neu-Generierung.

Die Apache-2.0-Lizenz bleibt Wans definierendes Versprechen. Null Einschränkungen. Die Community, die Wan 2.1 zum ComfyUI-Standard gemacht hat, wechselt bereits zu 2.7. Das Ökosystem folgt — wie immer.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Thinking Mode — plant, bevor es generiert: Wan 2.7s definierende Innovation. Bevor ein einziges Frame gerendert wird, interpretiert das Modell den Prompt, plant die Szenenkomposition und strukturiert den Erzählbogen. Das Ergebnis: dramatisch weniger generische Kompositionen, weniger Motion Drift, höhere Intentionstreue.
  • Erstes und Letztes Frame Kontrolle: Exakte Start- und Endframes eines Videos definieren. Präzise Kontrolle über Übergänge, Charakterpositionen und Szenen- Kontinuität.
  • Native Audio-Synchronisation: Audio wird gemeinsam mit Video in einem Durchlauf generiert — nicht nachträglich hinzugefügt. Dialog-Timing, Umgebungsgeräusche und Musik entstehen als einheitliche Komposition mit den Visuals.
  • Referenz-Konsistenz bis zu 9 Inputs: Bis zu 9 multimodale Referenzbilder oder -clips, um Charakter-Identität, Stil und Requisiten über Szenen hinweg zu verankern.
  • Instruktionsbasierte Videobearbeitung: Gewünschte Änderung in natürlicher Sprache beschreiben; Wan 2.7 modifiziert das bestehende Video entsprechend. Bearbeiten ohne Neu-Generierung von Grund auf.
  • Apache 2.0 — wirklich keine Einschränkungen: Kommerzielle Nutzung, Gewichts- Modifikation, Produktentwicklung, Verkauf von Output — alles erlaubt ohne Umsatzgrenzen und ohne Namensnennung über die Lizenzdatei hinaus.

Ehrliche Einschränkungen

  • Thinking Mode erhöht Generierungszeit: Der Planungs-Durchlauf, der die Outputs besser macht, macht sie auch langsamer. Wer Geschwindigkeit priorisiert, ist mit LTX Video besser bedient.
  • Kein offizielles Sign-up-and-go API: Lokale Ausführung oder Community-gehostete Endpunkte (fal.ai, WaveSpeedAI). Für nicht-technische Nutzer eine echte Hürde.
  • 27B-Maßstab erfordert seriöse Hardware: Lokale Bereitstellung in voller Qualität erfordert GPU-Speicher weit über Consumer-Karten. Cloud-GPU-Miete oder Plattform- API ist der praktische Weg für die meisten Nutzer.
  • Chinesisch-dominante Dokumentation: Offizielle Docs und viele Community-Ressourcen primär auf Chinesisch. Englische Guides hinken Updates hinterher.
  • Kleinere Community als Wan 2.1: Das Wan 2.1 ComfyUI-Ökosystem ist riesig. Wan 2.7 Workflows wachsen, aber noch nicht auf demselben Niveau.
03

Benchmark-Übersicht

Architektur — 27B MoE (40B aktive Parameter)

Mixture-of-Experts-Design mit ~753B Gesamtparametern, ~40B aktiven pro Token. DiT mit Full Attention für räumliche und zeitliche Verarbeitung.

Auflösung — bis zu 4K

Bis zu 1080p und 4K Output je nach Plattform und Compute-Stufe. Clip-Längen von 5 bis 15 Sekunden.

Referenz-Kapazität — bis zu 9 multimodale Inputs

Kombinationen aus Bildern, Video-Clips, Audio und Stil-Referenzen für Charakter-, Requisiten- und Ästhetik-Konsistenz über mehrere Szenen.

04

Das Fazit

Wan 2.7 ist der Moment, in dem offene Videomodelle erwachsen wurden. Thinking Mode ist kein Gimmick — es ist der Unterschied zwischen einer KI, die auf deinen Prompt reagiert, und einer, die ihn interpretiert. Erstes-und-Letztes- Frame-Kontrolle, natives Audio, bis zu 9 Referenz-Inputs, instruktionsbasierte Bearbeitung: Fähigkeiten, die in offenen Modellen bisher fehlten. Und alles unter Apache 2.0 — du besitzt, was du damit baust, vollständig. Der Kompromiss ist Komplexität und Rechenleistung. Aber für Kreative, die kinematische Kontrolle ohne Abo-Gebühren wollen, ist Wan 2.7 das leistungsfähigste offene Videomodell der Welt.

05

Häufig gestellte Fragen