Classé #2 Génération vidéo — Hollywood dans une zone de texte
Google DeepMind

Gemini Omni 1.1 Flash

Un modèle vidéo de Google qui se souvient de la conversation : générez une courte scène, discutez de la modification, prolongez-la, définissez les première et dernière images, créez un brouillon bon marché, puis upscalez la prise approuvée.

Mis à jour 29 août 2026 Video GenerationNative AudioConversational Editing
9.2sur 10
Site officiel
Idéal pour

Un modèle vidéo de Google qui se souvient de la conversation : générez une courte scène, discutez de la modification, prolongez-la, définissez les première et dernière images, créez un brouillon bon marché, puis upscalez la prise approuvée.

Pourquoi ça Gagne

L'endpoint Gemini Omni Flash au sens large domine ou frôle la tête de plusieurs classements indépendants de préférence vidéo. La version 1.1 ajoute jusqu'à 10 secondes de mémoire de scène pour les extensions en chaîne, l'interpolation entre première et dernière images, des brouillons en 360p et l'upscaling en 1080p/4K dans l'écosystème Google.

À surveiller

Chaque génération ne dure encore que 3 à 10 secondes ; 40 secondes signifie une chaîne d'extensions, et 4K signifie upscale. L'API est en Preview, les fonctionnalités diffèrent selon l'interface, et les classements indépendants n'ont pas encore isolé la version 1.1 de l'endpoint Omni Flash au sens large.

01

Ce que c'est réellement

La génération vidéo traite généralement la révision comme une amnésie. Demandez un autre mouvement de caméra, et le modèle reconstruit toute la scène à partir de zéro, quitte à changer le visage, la pièce et la météo en chemin. Gemini Omni 1.1 Flash aborde la révision comme une conversation avec un monteur. Le clip précédent reste dans la discussion.

Le plan de base demeure court : trois à dix secondes. La version 1.1 peut examiner jusqu’à dix secondes de vidéo précédente avant d’ajouter un nouveau segment de dix secondes, et les extensions peuvent atteindre environ quarante secondes au total. C’est une meilleure mémoire, pas une prise native unique de quarante secondes. La distinction importe, car chaque raccord offre à la continuité une nouvelle occasion de dériver.

Le contrôle de la première et de la dernière image apporte une deuxième forme de direction. Donnez le point de départ et la destination, et Omni génère le mouvement entre les deux. Cela peut servir à réaliser une orbite de caméra, une transition à l’intérieur d’un écran ou une boucle dont l’image finale revient au début. Les références vidéo ajoutent des indications de mouvement et de style, même si leur prise en charge et leur fiabilité varient actuellement entre les interfaces Google.

Le flux de brouillons peut faire économiser davantage d’argent que n’importe quelle prouesse visuelle. Un créateur peut générer plusieurs variantes en 360p pour environ trois centimes par seconde, comparer une modification contrôlée à la fois et ne promouvoir que la version réussie. Selon Google, les brouillons 360p peuvent être jusqu’à 60 % plus rapides et coûter trois fois moins cher que le 720p standard. La livraison peut ensuite être upscalée en 1080p ou 4K.

Ce dernier verbe est important. L’upscaling produit un fichier de résolution supérieure ; il ne remonte pas le temps pour rendre la scène d’origine nativement générée en 4K. Les textures fines, le texte, les mains et les mouvements complexes peuvent conserver des erreurs de la synthèse sous-jacente. Le marketing imprime souvent « 4K » en grandes lettres et « upscale » en petits caractères. Une évaluation utile donne aux deux mots la même taille.

Les preuves indépendantes à l’échelle de la famille sont excellentes. Gemini Omni Flash se classe en tête ou tout près sur plusieurs tableaux de préférence texte-vers-vidéo et image-vers-vidéo d’Artificial Analysis, avec ou sans audio. La première ligne d’Arena consacrée à Omni 1.1 est elle aussi solide. Il s’agit de systèmes Elo distincts sur des échelles différentes ; leurs chiffres ne peuvent donc pas être moyennés. Artificial Analysis n’a pas encore isolé la version 1.1 : son vaste échantillon décrit l’endpoint Omni Flash au sens large.

La distribution constitue un véritable avantage. Omni est présent dans les produits Gemini et Flow de Google, apparaît dans AI Studio et les API pour développeurs, s’étend aux outils d’entreprise et s’intègre chez des partenaires créatifs. La tarification API est d’une lisibilité rare : environ dix centimes par seconde en 720p, avec des brouillons moins chers et des livraisons upscalées plus coûteuses. L’API n’a pas d’offre gratuite, tandis que les formules grand public et les interfaces YouTube possèdent leurs propres crédits et conditions.

Le statut Preview rend le produit moins uniforme que sa marque ne le laisse penser. Les exemples de Gemini API utilisent gemini-omni-1.1-flash, Enterprise Agent Platform documente un identifiant suffixé Preview, et l’ancien aperçu public reste visible dans certaines parties du catalogue de modèles. Les références audio, les justificatifs C2PA et le comportement des références vidéo diffèrent selon l’interface. Le filigrane SynthID est l’affirmation générale la plus sûre ; garantir C2PA sur chaque sortie ne l’est pas.

Pourquoi conserver Omni en deuxième position ? Seedance 2.5 peut tenter trente secondes en une seule passe et accepter un ensemble de références beaucoup plus vaste. Pour une scène publicitaire préparée à l’avance, ces contrôles comptent. Omni est le meilleur studio conversationnel : essayez une idée, discutez de la retouche, prolongez le résultat et upscalez le gagnant. Tous deux obtiennent 9,2, car leurs forces indiquent des directions différentes. Le bon choix dépend de ceci : arrivez-vous avec un storyboard, ou le découvrez-vous au fil de la conversation ?

02

Forces et limites honnêtes

Points Forts

  • La conversation remplace les nouveaux tirages : Omni peut affiner ou modifier une vidéo générée en langage naturel. L’unité utile est une séance de création, pas un prompt unique suivi d’un coup de levier de machine à sous.
  • L’extension se souvient désormais d’une plus grande partie de la scène : La version 1.1 examine jusqu’à 10 secondes de vidéo précédente et peut ajouter des segments de 10 secondes jusqu’à une durée cumulée d’environ 40 secondes.
  • Créez un brouillon, comparez, puis upscalez : Les aperçus en 360p coûtent environ 0,03 $ par seconde et peuvent être produits jusqu’à 60 % plus vite que le 720p standard. Le travail approuvé peut être livré après upscale en 1080p ou 4K.
  • Google le place presque partout : Omni apparaît dans Gemini, Flow, Google AI Studio, l’API Gemini, Enterprise Agent Platform, les outils créatifs de partenaires et certaines expériences de création YouTube.

Limites Honnêtes

  • Dix secondes restent la durée native d’un plan : Un résultat de quarante secondes est composé de plusieurs extensions générées qui partagent du contexte, et non d’une passe unique et continue de quarante secondes. Seedance 2.5 reste plus fort pour les longues scènes natives.
  • Les preuves indépendantes concernent la famille, pas encore précisément la 1.1 : Artificial Analysis évalue Gemini Omni Flash. Arena répertorie la 1.1, mais l’échantillon initial et l’Elo en direct peuvent évoluer ; il ne faut pas présenter chaque score familial comme un résultat propre à cette version.
  • Le vocabulaire de la résolution se prête facilement à l’exagération : La génération standard est en 720p, tandis que les sorties 1080p et 4K sont upscalées. Un fichier de livraison net ne prouve pas que la scène a été synthétisée nativement en 4K.
  • Les interfaces Preview n’exposent pas toutes le même produit : Les identifiants de modèle, les références audio, la fiabilité des références vidéo, la prise en charge de C2PA et la disponibilité des fonctionnalités diffèrent entre Gemini API, Flow et Enterprise Agent Platform.
03

Aperçu des Benchmarks

Arena texte-vers-vidéo — Omni 1.1 autour de 1515

L'instantané en direct du 29 août place Omni 1.1 en tête, avec l'endpoint Omni au sens large juste derrière. Cet Elo initial en direct est prometteur, pas permanent.

Artificial Analysis texte-vers-vidéo avec audio — Omni Flash autour de 1237

La famille au sens large se classe environ 2e avec un vaste échantillon. Il s'agit d'une preuve indépendante à l'échelle de la famille, pas d'une mesure distincte de la version 1.1.

Artificial Analysis texte-vers-vidéo sans audio — Omni Flash autour de 1324

L'endpoint au sens large domine le classement consulté, ce qui confirme la qualité de préférence visuelle, tout en laissant subsister l'ambiguïté sur la version.

Sortie par plan — 3 à 10 secondes en 720p / 24 i/s

C'est l'enveloppe documentée de l'API Omni de base. La version 1.1 peut enchaîner des extensions de 10 secondes jusqu'à environ 40 secondes au total.

Tarifs API — environ 0,03 $/s en brouillon ; 0,10 $/s en 720p

Les niveaux de livraison supérieurs coûtent environ 0,15 $/s pour le 1080p et 0,30 $/s pour l'upscale 4K. L'API ne propose pas d'offre gratuite.

04

Le Verdict

Gemini Omni 1.1 Flash entre en Vidéo au n°2 avec 9,2, à égalité avec Seedance 2.5. Omni présente le meilleur dossier pour la plupart des gens : accès plus large, tarifs plus clairs, itération conversationnelle et meilleures preuves de préférence sur plusieurs classements. Seedance reste n°1, car ce guide privilégie éditorialement sa fenêtre de 30 secondes en une seule passe et son ensemble de références bien plus profond pour les productions dirigées. Choisissez Omni lorsque le flux consiste à explorer, discuter, réviser et upscaler. Choisissez Seedance lorsque la scène doit être plus longue et précisément définie avant que la caméra ne tourne.

05

Foire aux questions