OpenAI lance aujourd’hui GPT-6.1 Sol, seulement une semaine après le lancement de GPT-6 Sol. L’entreprise présente cette nouvelle version comme un modèle capable de rivaliser avec le GPT-6 Astra dans plusieurs tâches complexes, à un coût qui pourrait être réduit à un cinquième de celui du modèle phare de l’IA.

OpenAI a présenté GPT-6 Sol le 22 septembre, en même temps que GPT-6 Luna, pour compléter GPT-6 Astra, lancé plus tôt dans le mois. Une semaine plus tard, l’entreprise a dévoilé le GPT-6.1 Sol, alors que le modèle précédent venait tout juste d’être intégré à son offre. Toutefois, il est important de noter que le GPT-6.1 Astra ne sera pas lancé, comme mentionné précédemment.
Le GPT-6.1 Sol se concentre sur les tâches nécessitant du raisonnement, de la programmation, l’utilisation d’un ordinateur et l’exécution de workflows professionnels en plusieurs étapes. OpenAI affirme que ce modèle améliore considérablement les performances par rapport à GPT-6 Sol dans ces domaines et atteint des niveaux comparables à ceux du GPT-6 Astra sur plusieurs indicateurs de performance.
Cependant, l’argument principal de ce nouveau modèle d’intelligence artificielle reste son coût. Le prix du GPT-6.1 Sol via l’API est de 2 dollars par million de tokens entrants et de 10 dollars sortants, contre respectivement 10 et 50 dollars pour le GPT-6 Astra, représentant une réduction d’environ cinq fois dans les deux cas. Les entrées en cache coûtent seulement 0,10 dollar par million de tokens, soit 95 % de moins que le tarif standard et la moitié du prix du cache de GPT-6 Sol.
Les performances du GPT-6.1 Sol se rapprochent de celles d’Astra
Dans le cadre du benchmark DeepSWE v1.1, qui évalue les tâches de développement logiciel complexe sur de véritables bases de code, OpenAI rapporte que le GPT-6.1 Sol atteint le même score que le GPT-6 Astra tout en nécessitant environ cinq fois moins de ressources. De plus, le modèle affiche une amélioration de 6,4 points par rapport au meilleur résultat obtenu par le GPT-6 Sol, tout en présentant un niveau de raisonnement inférieur.
Les gains sont également notables dans l’utilisation des applications informatiques. Dans le benchmark OSWorld 2.0, le GPT-6.1 Sol dépasse le GPT-6 Sol de sept points au niveau de raisonnement maximal et ne se trouve qu’à 2,1 points derrière le GPT-6 Astra, selon les résultats publiés par OpenAI, avec un coût par tâche environ sept fois inférieur à celui d’Astra.

Les tâches professionnelles donnent également des résultats encourageants pour ce nouveau modèle. Sur AutomationBench, qui évalue la capacité des agents IA à exécuter des flux de travail utilisant plusieurs outils, le GPT-6.1 Sol obtient un score supérieur de 2,2 points à celui de Claude Opus 5.5 d’Anthropic à niveau de raisonnement moyen, tout en coûtant environ trois fois moins par tâche. Son score s’élève également de 4,8 points par rapport au GPT-6 Sol dans les mêmes conditions.
Selon OpenAI, dans le domaine de la recherche scientifique, l’écart avec son prédécesseur continue de se creuser. Dans le benchmark Terminal-Bench Science 0.1, le GPT-6.1 Sol double plus que le score du GPT-6 Sol avec raisonnement maximal, pour un coût moyen de 5,47 dollars par tâche, contre 23,80 dollars pour Astra et 23,21 dollars pour Opus 5.5. OpenAI précise cependant qu’Astra conserve le meilleur score lors de cette évaluation, avec 68,1 %.
Meilleure précision et déploiement toujours limité
OpenAI affirme également avoir constaté une réduction des erreurs factuelles. À un faible niveau de raisonnement, la proportion de réponses contenant au moins une erreur passe de 11,4 % avec GPT-6 Sol à 7,7 % avec GPT-6.1 Sol, représentant une baisse d’environ 32 %. L’entreprise précise néanmoins que ce benchmark utilise des conversations difficiles où des erreurs avaient déjà été signalées par les utilisateurs, ce qui ne reflète donc pas les usages courants.
OpenAI annonce également des progrès dans l’alignement et l’application des directives de sécurité. Le GPT-6.1 Sol échoue moins souvent que le GPT-6 Sol dans plusieurs tests, y compris la transparence face à un outil de recherche défaillant, le respect de contraintes explicites et l’évitement de résultats non autorisés lors des tâches effectuées par l’agent. OpenAI indique n’avoir observé aucune tentative de contournement de son système d’évaluation de sécurité automatisé.
Le GPT-6.1 Sol est désormais disponible pour les utilisateurs de ChatGPT Plus, Pro, Business, Enterprise et Edu sur ChatGPT Work et Codex, ainsi que via des API telles que gpt-6.1-sol. Toutefois, OpenAI ne propose pas encore le modèle dans le ChatGPT classique et prévoit une version Ultrafast capable de générer des tokens jusqu’à huit fois plus rapidement sur Codex dans les jours à venir.






