OpenAI a lancé son nouveau modèle d’intelligence artificielle, GPT-6.1 Sol. Proposé à un cinquième du coût d’Astra, il offre des performances comparables en programmation, en manipulation informatique et dans le traitement de documents professionnels complexes.
Le lancement et le positionnement tarifaire de GPT-6.1 Sol
L’entreprise a inauguré sa rencontre annuelle en présentant GPT-6.1 Sol, une mise à jour directe de GPT-6 Sol conçue pour se rapprocher des capacités de son modèle de pointe, GPT-6 Astra, tout en réduisant drastiquement les dépenses d’exploitation. La plateforme intègre déjà cette nouveauté pour les abonnés payants à travers ChatGPT Work et Codex, ciblant directement les développeurs et les flux de travail professionnels automatisés.
La tarification s’établit à USD 0,10 par million de tokens d’entrée en cache, un rabais de quatre-vingt-quinze pour cent qui favorise les agents nécessitant des contextes répétitifs.
Les performances comparées en programmation et en tâches informatiques
Dans les évaluations d’ingénierie logicielle au sein de bases de code réelles, l’outil rivalise avec les versions les plus onéreuses de l’écosystème. Sur la référence DeepSWE v1.1, le modèle égale les scores d’Astra tout en réclamant un effort de raisonnement moindre, devançant de six virgule quatre points la mouture précédente de Sol.
Pour le contrôle direct des applications informatiques, l’évaluation OSWorld 2.0 place le système à deux virgule un points du score maximal d’Astra lorsque le niveau de raisonnement est poussé au maximum. L’éditeur précise que cette efficacité s’obtient pour environ un septième du coût par tâche.
L’analyse des documents complexes et la recherche scientifique
Les capacités du système s’étendent au traitement de fichiers d’entreprise et à la recherche. Dans le test GDP.pdf, qui mesure la précision face à des documents comportant des tableaux, des graphiques et des notes en petits caractères, Sol surpasse Opus 5.5 tout en se maintenant à proximité des performances d’Astra.
Dans le domaine scientifique, les résultats publiés montrent un doublement de la note par rapport à la génération antérieure sur Terminal-Bench Science 0.1. Avec un effort maximal, le coût moyen s’établit à $5,47 par tâche, frente a $23,21 de Opus 5.5 et $23,80 pour Astra.
La fiabilité et la sécurité des agents d’intelligence artificielle
La réduction des erreurs factuelles constitue un autre axe de progression mis en avant par l’entreprise. En activant un niveau de raisonnement très élevé sur des invites particulièrement ardues, le taux d’erreur descend à quatre virgule un pour cent, se rapprochant des quatre pour cent affichés par Astra.
Le modèle gagne également en transparence face à ses propres limites. Les équipes de conception signalent que le système respecte avec plus de rigueur les consignes de sécurité et l’intention exprimée par l’utilisateur, réduisant les risques d’action non autorisée sur des services tiers.
Pour aller plus loin