Chaque lancement de vaisseau amiral arrive avec la même affiche : le modèle le plus intelligent jamais construit. Celle de GPT-6 Astra est différente, et plus utile. Elle dit : cette fois, la machine prend directement les commandes du clavier. Astra est le nouveau fer de lance d’OpenAI pour le travail qui se passe hors du chat — piloter un navigateur, cliquer dans des applications de bureau, porter un flux professionnel en plusieurs étapes jusqu’au bout — et il vérifie bien mieux ses propres faits en le faisant.
L’histoire mesurée tient le discours. Sur OSWorld 2.0, le test d’opérations de bureau, Astra marque 72,6% et finit en environ 40 minutes là où GPT-5.6 Sol en prenait environ 75 ; Opus 5 est à 70,2%. Sur Agents’ Last Exam, une évaluation de flux professionnels de long terme sur 55 domaines, il atteint 59,3%. Et le suivi de factualité d’Artificial Analysis montre un taux d’hallucinations environ réduit de moitié par rapport à Sol, à précision supérieure. Moins d’erreurs assurées, du travail fini plus vite : c’est la mise à niveau qu’on sent dès la première semaine.
Voilà l’astérisque honnête. Sur l’Intelligence Index d’Artificial Analysis, Astra marque 61,2 — une égalité statistique avec les 60,9 de Sol — tandis que Claude Fable 5.1 mène à 65,7. Sur le travail de connaissance GDPval-AA v2, les ~1629 d’Astra sont derrière Opus 5 (1824) et Fable 5.1 (1853) — et derrière Sol. Si votre journée, c’est due diligence, synthèses et jugement, le nouvel amiral n’est pas automatiquement le meilleur outil ; c’est un outil différent. Et le tarif API — 10/50 $ par million de tokens, 2,5 fois Sol, avec des lectures de cache à 1 $ — affiche cette différence sans détour.
Aiguiller le travail
| Tâche | Aiguiller vers | Pourquoi |
|---|---|---|
| « Fais-le sur ma machine » : navigateur, fichiers, applications, jusqu’au bout | Astra | Meilleur usage d’ordinateur mesuré, environ deux fois plus vite par tâche |
| Travail de connaissance à fort jugement, due diligence, longs documents | Opus 5 | GDPval supérieur pour un quart du prix API |
| Le raisonnement pur le plus dur et le contexte long et embrouillé | Fable 5 / Fable 5.1 | En tête des composites indépendants d’intelligence |
| Volume, brouillons de routine, le tapis roulant quotidien | Sol / Terra / Luna | Toujours là, toujours les places les moins chères |
Le hic honnête
Astra est laconique de tempérament. Ce style vitesse gagne les évaluations de code et perd les grilles de droit, de finance et de fiscalité qui récompensent l’énumération de chaque étape ; sa qualité de présentation a reculé par rapport à Sol quand sa qualité d’analyse bondissait. Le lancement du premier jour a été chaotique — les abonnés payants ont joué à la loterie de l’accès, et les comptes Enterprise sont arrivés avec Astra désactivé par défaut. Pas de génération d’images native, pas de sortie audio ou vidéo. Et ses capacités cyber bien plus fortes (100% sur ExploitBench, avec des 0-days inconnus découverts pendant l’évaluation) viennent avec des garde-fous plus stricts qui peuvent ralentir le travail légitime voisin de la sécurité.
Donc l’habitude gagnante : Astra au volant, Opus pour le jugement, Fable pour la pensée dure, Sol pour le tapis roulant. OpenAI n’a pas construit un cerveau plus gros ; il a construit de meilleures mains. Pour beaucoup de vrai travail, c’est la mise à niveau qui compte.