Imaginez un chantier avec deux grutiers.
L’un est le vétéran qu’on appelle pour le levage que personne d’autre n’ose faire : glisser une poutre en acier entre deux tours sous un fort vent latéral. L’autre grutier est presque aussi bon et ne demande qu’une fraction du tarif journalier. Pour tous les levages ordinaires, comme les palettes de briques, les charpentes ou le travail quotidien, il serait absurde de réserver le vétéran.
GPT-6.1 Sol est ce deuxième opérateur, et ce mois-ci, l’écart de compétence entre les deux s’est considérablement réduit.
Un lancement né d’une annulation
OpenAI a lancé GPT-6.1 Sol lors de son événement DevDay le 29 septembre 2026, seulement une semaine après GPT-6 Sol. Le choix de ce moment avait une histoire. La veille, OpenAI avait annulé le lancement prévu de GPT-6.1 Astra après que des tests internes ont révélé que le modèle ne respectait pas de manière fiable la portée et les autorisations de ses tâches. Sol 6.1 est un modèle distinct, plus compact, et son propre rapport de sécurité semble plus solide : dans un test d’OpenAI pour savoir si un agent admet que son outil de recherche est défaillant plutôt que de deviner, GPT-6.1 Sol a omis de le signaler dans 2,1 % des cas, contre 4,9 % pour GPT-6 Sol et 1,5 % pour GPT-6 Astra.
L’argument de vente d’OpenAI est direct : une intelligence proche de celle d’Astra pour un cinquième de son prix.
Est-il vraiment proche d’Astra ?
C’est la partie qui compte, et pour une fois, nous n’avons pas besoin de croire le fournisseur sur parole.
Artificial Analysis, une firme de test indépendante, a exécuté ses propres évaluations le jour du lancement. Sur son Indice d’Intelligence, qui combine dix évaluations exigeantes, GPT-6.1 Sol, à effort maximal, a obtenu un score de 52, soit un point derrière les 53 de GPT-6 Astra et quatre points devant GPT-6 Sol. Sur son Indice des Agents de Programmation, le résultat est encore plus serré : à effort maximal, Sol se trouve 2 points derrière Astra, et au deuxième paramètre le plus élevé, ‘xhigh’, il a dépassé Astra d’un point pour moins de 15 % du coût par tâche.
Cognition, l’entreprise derrière l’agent de programmation Devin, l’a testé sur FrontierCode 1.1, un benchmark qui pose une question stricte : un ingénieur senior intégrerait-il (merge) véritablement cette modification ? Le meilleur score de GPT-6.1 Sol est de 60,4 %, soit quasiment la même performance que GPT-6 Sol (60,7 %). La différence réside dans l’argent. À un niveau d’effort moyen, il dépense 0,31 $ par tâche, soit 81 % de moins que ce qu’a dépensé GPT-6 Sol (à son maximum) pour obtenir son meilleur résultat. À un effort faible, il atteint 58,1 % pour seulement 0,21 $, en nette progression par rapport aux 50,5 % de GPT-6 Sol sur ce même réglage.
Les propres chiffres d’OpenAI vont dans le même sens. Sur DeepSWE v1.1, impliquant des tâches d’ingénierie complexes dans des bases de code réelles, leur tableau affiche 75,2 % à un effort élevé (High Effort) pour 0,65 $ par tâche. C’est 6,4 points de plus que le meilleur score de GPT-6 Sol et légèrement supérieur au meilleur score d’Astra (74,1 %), qui coûte 4,43 $ par tâche. Une curiosité mérite d’être signalée : aux réglages ‘xhigh’ et ‘max’, GPT-6.1 Sol obtient paradoxalement un score plus faible, à 71,9 %. Penser plus longtemps n’est pas toujours penser mieux.
Le bilan honnête est donc le suivant : une programmation à peu près au niveau d’Astra, et la même qualité d’intégration que le modèle Sol de la semaine dernière, pour un prix par tâche terminée nettement inférieur.
Pourquoi le prix du cache fait toute la différence
Un agent de programmation ne lit jamais votre projet qu’une seule fois. À chaque fois qu’il exécute un test, lit l’erreur et fait une nouvelle tentative, il relit les mêmes fichiers, les mêmes instructions et le même historique. Au cours d’une longue session, cela peut signifier que les mêmes centaines de milliers de jetons sont réinjectés dans le modèle des dizaines de fois.
C’est précisément ce que couvre l’entrée mise en cache (Cached Input) : du texte que le modèle a vu récemment au cours de cette session. GPT-6.1 Sol facture 0,10 $ par million de jetons mis en cache, soit 95 % de réduction sur le prix normal de 2 $ et la moitié du prix du cache de GPT-6 Sol. Les prix d’entrée et de sortie normaux restent à 2 $ et 10 $ par million, soit un cinquième des 10 $/50 $ de GPT-6 Astra.
Faites l’addition et vous obtenez le chiffre qui compte le plus : Artificial Analysis a calculé qu’il en coûtait environ 0,72 $ par tâche pour exécuter son indice avec GPT-6.1 Sol, contre 3,26 $ pour GPT-6 Astra, 5,98 $ pour Claude Opus 5.5, et 7,60 $ pour Claude Sonnet 5.5. Une mise en garde cependant : les prompts de plus de 272 000 jetons coûtent le double en entrée et 1,5 fois en sortie, rendant les requêtes individuelles véritablement massives plus chères.
Ne poussez pas la jauge à fond
GPT-6.1 Sol possède cinq réglages d’effort : faible (low), moyen (medium - par défaut), élevé (high), très élevé (xhigh) et maximal (max). Il est tentant de penser que le réglage maximal (‘max’) est toujours le meilleur. Sur l’Indice des Agents de Programmation d’Artificial Analysis, ce n’est pas le cas : ‘xhigh’ a obtenu un meilleur score que ‘max’, et coûte moins cher. Pour les correctifs de routine, un effort faible (’low’) ou moyen (‘medium’) est souvent suffisant, comme le démontre le résultat de 58,1 % de Cognition pour 0,21 $. Réservez ‘xhigh’ pour les problèmes nécessitant réellement une réflexion approfondie.
Ses limites honnêtes
- Un meilleur rapport qualité-prix, pas un meilleur code. Sur FrontierCode 1.1, la qualité d’intégration stagne par rapport à GPT-6 Sol et GPT-5.6 Sol. Si votre problème était que les correctifs de Sol n’étaient pas assez bons, la version 6.1 ne résout pas cela. Elle rend ces mêmes correctifs beaucoup moins chers.
- La science reste le domaine d’Astra. Sur le Terminal-Bench Science 0.1 d’OpenAI (analyse de données, simulations et preuve de théorèmes dans un terminal), GPT-6.1 Sol obtient un score de 57,0 % à l’effort maximal. C’est plus du double par rapport aux 27,6 % de GPT-6 Sol, mais bien en retrait face à GPT-6 Astra (68,1 %) et Claude Opus 5.5 (63,3 %). La tâche coûte alors 5,47 $, contre environ 23 $ pour chacun de ses rivaux.
- Claude obtient de meilleurs scores sur l’indice général. Claude Opus 5.5 (58) et Claude Sonnet 5.5 (56) restent devant GPT-6.1 Sol (52) sur l’Indice d’Intelligence d’Artificial Analysis. Et même si Artificial Analysis a mesuré un gain de 12 points sur Terminal-Bench 4.0 pour GPT-6.1 Sol face à GPT-6 Sol, les 64 % de Sonnet lors de ce test demeurent supérieurs. Sonnet y parvient cependant en brûlant beaucoup plus de jetons, ce qui fait que Sol gagne sur la question du coût par tâche.
- Pas dans le Chat standard. Dans ChatGPT, GPT-6.1 Sol est accessible dans ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les développeurs l’utilisent dans l’API sous le nom de
gpt-6.1-sol. OpenAI indique qu’un mode “Ultrafast” plus rapide pour Codex est à venir, mais il n’est pas encore en ligne.
Qui devrait l’utiliser
| Si votre travail ressemble à… | Choisissez | Pourquoi |
|---|---|---|
| Des bugs, des tests, des refontes, des agents tournant dans la CI toute la journée | GPT-6.1 Sol | Une programmation quasi-phare pour une fraction du coût par tâche |
| Calcul scientifique, les tâches d’utilisation d’un ordinateur les plus difficiles | GPT-6 Astra | Clairement en tête sur les terminaux scientifiques |
| Jugements complexes et architectures ouvertes | Claude Opus 5.5 | Score le plus élevé sur l’indice indépendant général |
| Longues sessions en terminal où les jetons ne comptent pas | Claude Sonnet 5.5 | Un score terminal indépendant plus solide, mais une forte consommation de jetons |
Le verdict pour la programmation
GPT-6.1 Sol ne relève pas le plafond. Ce qu’il fait, c’est mettre ce plafond à la portée d’un budget ordinaire. Des tests indépendants le placent à un ou deux points du modèle phare d’OpenAI pour moins d’un quart du coût par tâche, et son tarif de mise en cache est parfaitement adapté à la façon dont travaillent réellement les agents de programmation. Confiez-lui vos tâches en attente (backlog), réglez-le sur ‘xhigh’ pour les tickets les plus compliqués, et ne faites appel à Astra ou Opus que lorsqu’il reste bloqué.