Happy Horse 1.1, entwickelt von Alibaba, stellt einen bedeutenden strukturellen Sprung im Bereich generativer Videos dar: Es hört auf, Audio als nachträglichen Gedanken zu behandeln. Basierend auf einer vereinheitlichten Transformer-Architektur generiert es sowohl die visuellen Frames als auch den begleitenden Ton — Dialoge, Foley und Umgebungsgeräusche — gleichzeitig in einem einzigen Durchlauf.
Das Ergebnis sind bis zu 15 Sekunden lange 1080p-Videos mit nativ synchronisiertem Ton. Es beherrscht sogar die mehrsprachige Lippensynchronisation in 7 Sprachen direkt aus dem Prompt. Für Kreative, die es gewohnt sind, stumme Videoclips zu generieren und stundenlang nach Soundeffekten zu suchen oder separate Tools zur Lippensynchronisation zu verwenden, verdichtet Happy Horse 1.1 einen mehrstufigen Workflow auf einen einzigen Klick.
Während Version 1.0 ein Machbarkeitsnachweis war, bringt Version 1.1 die Charakterkonsistenz und zeitliche Stabilität, die für die tatsächliche Produktion erforderlich sind. Dieser vereinheitlichte Ansatz hat jedoch einen Kompromiss: Audio und Video sind untrennbar miteinander verbunden. Wenn das Video perfekt ist, aber ein Soundeffekt nicht passt, kann man die Audiospur nicht einfach isoliert innerhalb des Modells neu generieren. Dennoch macht es seine Fähigkeit, synchronisierte, hochauflösende audiovisuelle Inhalte nativ zu liefern, zu einem der aufregendsten Tools auf der heutigen Video-Rangliste.