La plupart des outils de vidéo par IA commencent par un levier : saisissez un prompt, tirez et espérez. Si une main fond, tirez de nouveau et payez de nouveau. Seedance 2.5 cherche à remplacer ce casino par un plateau de tournage. Il donne au créateur davantage de temps, davantage de références, un son synchronisé et des moyens de réparer une section sans jeter tout ce qui l’entoure.
Le grand argument est une fenêtre de trente secondes en une seule passe. La durée ne devient pas automatiquement une histoire — une caméra de surveillance peut filmer pendant des heures sans faire du cinéma —, mais trente secondes liées offrent assez d’espace pour une entrée, une action, une réaction et une conclusion. Les modèles courts peuvent imiter cette structure par assemblage. Seedance peut la tenter au sein d’une seule prise générée, où le personnage, l’éclairage, le rythme et le son partent du même contexte.
Son système de références est la fonctionnalité de production la plus importante. Une tâche peut recevoir jusqu’à trente images, dix vidéos et dix extraits audio. Imaginez ces fichiers comme une petite équipe de tournage. Une image sert au casting, une autre aux costumes, un extrait montre la chorégraphie, et un échantillon sonore fixe la voix ou le tempo. Un rendu 3D grossier peut jouer le rôle des marques au sol sur un plateau : il indique le trajet du sujet et de la caméra avant que le modèle n’ajoute matière, lumière et atmosphère.
Davantage d’indices peuvent aussi créer davantage de confusion. Si deux images de référence se contredisent sur l’apparence d’une pièce, ou si la légende d’un storyboard ressemble à une enseigne censée figurer dans la scène, le modèle doit décider quel indice fait autorité. Seedance peut être assez littéral pour conserver la contradiction. Une bonne direction attribue donc un rôle précis à chaque référence, au lieu de déposer devant le modèle une valise pleine de ressources en espérant qu’il lise dans les pensées du réalisateur.
L’audio et la vidéo sont générés ensemble. Cette horloge commune aide une réplique à coïncider avec un visage, un bruit de pas à tomber près d’un pas réel et la musique à changer avec le plan. Elle ne garantit ni une synchronisation labiale parfaite ni une physique irréprochable, mais elle élimine le problème d’assemblage séparé où un système fabrique les images et un autre le son.
Les preuves se sont améliorées depuis notre précédente évaluation. Arena place désormais l’endpoint Seedance 2.5 en 720p à 1476±14, autour de la cinquième place dans l’instantané texte-vers-vidéo du 29 août, avec une incertitude suffisante pour le situer approximativement entre la troisième et la septième. C’est un signal indépendant de préférence qui compte. Artificial Analysis répertorie toujours Seedance 2.0 plutôt que 2.5 : les deux systèmes Elo et les deux versions du modèle doivent donc rester séparés.
Gemini Omni complique l’attribution de la couronne. La famille Omni au sens large obtient d’excellents résultats dans les comparaisons indépendantes en aveugle, et Omni 1.1 ajoute les retouches conversationnelles, les images clés, les brouillons bon marché et une tarification transparente selon la résolution. À la question « Quel modèle la plupart des gens devraient-ils ouvrir en premier ? », Omni a de solides arguments. Nous maintenons Seedance au n°1 parce que ce classement privilégie le contrôle de production : une passe unique plus longue, un ensemble de références bien plus vaste et des flux conçus autour de scènes dirigées plutôt que de variantes conversationnelles rapides.
Ses limites sont des problèmes ordinaires de cinéma vêtus d’habits étrangement nouveaux. Plus une séquence est longue, plus l’identité, les doigts ou les objets ont le temps de dériver, de se traverser, ou plus un geste entre plusieurs personnes risque de devenir ambigu. Les filtres peuvent refuser un contenu qu’un fournisseur plus ancien ou différent accepte. Le coût et le comportement de la file d’attente changent selon l’interface. La 4K native n’est pas une affirmation universelle sûre : un fournisseur peut proposer un upscale ou une résolution que les documents centraux du modèle ByteDance ne promettent pas partout.
Choisissez Seedance pour les publicités, les interprétations émotionnelles, la prévisualisation, les scènes dialoguées et les projets guidés par des références, où le contrôle peut compenser une itération plus lente ou plus chère. Choisissez Omni si vous recherchez un vaste environnement Google, des coûts API clairs et des révisions conversationnelles. Un classement utile doit rendre cette bifurcation visible. Il ne doit pas prétendre qu’un seul chiffre peut réaliser tous les films.