Happy Horse 1.1, desarrollado por Alibaba, representa un salto estructural significativo en el video generativo: deja de tratar el audio como una ocurrencia tardía. Basado en una arquitectura de transformador unificada, genera simultáneamente los fotogramas visuales y el audio que los acompaña —diálogos, efectos de sala y efectos de sonido ambientales— en una sola pasada.
El resultado son hasta 15 segundos de video a 1080p con audio sincronizado de forma nativa. Incluso maneja la sincronización labial multilingüe en 7 idiomas directamente desde el prompt. Para los creadores acostumbrados a generar clips de video mudos y pasar horas buscando efectos de sonido o usando herramientas de sincronización labial separadas, Happy Horse 1.1 condensa un flujo de trabajo de múltiples pasos en un solo clic.
Mientras que la versión 1.0 fue una prueba de concepto, la versión 1.1 aporta la consistencia de personajes y la estabilidad temporal requeridas para la producción real. Sin embargo, este enfoque unificado tiene una contrapartida: el audio y el video están indisolublemente unidos. Si el video es perfecto pero un efecto de sonido falla, no se puede regenerar fácilmente solo la pista de audio dentro del modelo. A pesar de esto, su capacidad para ofrecer contenido audiovisual de alta definición y sincronizado de forma nativa la convierte en una de las herramientas más emocionantes en la tabla de clasificación de videos de hoy.