Happy Horse 1.1, développé par Alibaba, représente un saut structurel important dans le domaine de la vidéo générative : il cesse de traiter l’audio comme une réflexion après coup. Reposant sur une architecture de transformateur unifiée, il génère simultanément les images visuelles et l’audio qui les accompagne — dialogues, bruitages et effets sonores ambiants — en une seule passe.
Le résultat est une vidéo 1080p d’une durée allant jusqu’à 15 secondes avec un son nativement synchronisé. Il gère même la synchronisation labiale multilingue dans 7 langues directement à partir du prompt. Pour les créateurs habitués à générer des clips vidéo muets et à passer des heures à chercher des effets sonores ou à utiliser des outils de synchronisation labiale distincts, Happy Horse 1.1 condense un flux de travail en plusieurs étapes en un seul clic.
Alors que la version 1.0 était une preuve de concept, la version 1.1 apporte la cohérence des personnages et la stabilité temporelle requises pour la production réelle. Cette approche unifiée comporte cependant un compromis : l’audio et la vidéo sont indissociables. Si la vidéo est parfaite mais qu’un effet sonore est raté, vous ne pouvez pas facilement regénérer uniquement la piste audio au sein du modèle. Malgré cela, sa capacité à fournir un contenu audiovisuel haute définition synchronisé nativement en fait l’un des outils les plus passionnants du classement vidéo aujourd’hui.