OpenAI a présenté GPT-6 Astra, un modèle conçu pour évoluer de simples assistants générant des réponses vers des agents capables d’utiliser des ordinateurs, de programmer, de rechercher et de réaliser des flux de travail complexes. Les résultats publiés incluent un 99,9 % à ARC-AGI-3, 100 % à ExploitBench, 97,6 % à FrontierMath Tier 4 et 57,9 % à Terminal-Bench 4.0. L’amélioration en cybersécurité étant significative, OpenAI a placé ce modèle au seuil Critique de leur Framework de préparation.
Les points clés de GPT-6 Astra en 20 secondes
- Astra atteint 99,9 % à ARC-AGI-3 et 100 % à ExploitBench.
- Terminal-Bench 4.0 passe de 37,3 % avec GPT-5.6 Sol à 57,9 %.
- En tests sur contexte entre 512K et 1M, il obtient 96,3 %.
- OpenAI a détecté deux zero-days lors d’évaluations internes.
- API à partir de 10 dollars par million de tokens d’entrée.
Au-delà des chiffres, la différenciation technique réside dans le type de tâches pour lesquelles OpenAI a entraîné Astra. Le modèle combine raisonnement, navigation, utilisation directe d’applications, terminal, programmation, et outils spécialisés. Il peut mener des processus sur plusieurs étapes et interagir avec des logiciels réels, s’orientant davantage vers un agent autonome que vers un chatbot traditionnel.
Le déploiement débute avec un nombre limité d’organisations, puis s’étendra dans les prochains jours à ChatGPT Plus, Pro, Business et Enterprise. Il sera également accessible via l’API d’OpenAI sous le nom gpt-6-astra, ainsi que sur Microsoft Azure et Amazon Bedrock.
Astra performe particulièrement lorsqu’il dispose d’outils et peut agir
Le résultat le plus remarquable concerne ARC-AGI-3, où Astra atteint 99,9 %, comparé à 7,8 % pour GPT-5.6 Sol et 30,2 % pour Claude Opus 5, selon la comparaison publiée par OpenAI.
Il existe une spécificité méthodologique importante. Astra a utilisé pour ARC-AGI-3 un harness basé sur l’API Responses avec deux ajustements que OpenAI affirme mieux représenter son comportement dans des scénarios réels, et qui n’ont pas été conçus spécifiquement pour cette évaluation.
Les performances techniques sont également très élevées sur d’autres tests, bien que l’amélioration par rapport à la génération précédente varie considérablement.
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Amélioration |
|---|---|---|---|
| ARC-AGI-3 | 99,9 % | 7,8 % | +92,1 points |
| FrontierMath Tier 4 | 97,6 % | 83,0 % | +14,6 |
| GPQA Diamond | 96,0 % | 94,6 % | +1,4 |
| Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | +42,2 |
| AutomationBench | 41,4 % | 18,1 % | +23,3 |
| BenchCAD | 95,9 % | 83,3 % | +12,6 |
| OSWorld 2.0 | 72,6 % | 65,7 % | +6,9 |
Les résultats correspondent aux niveaux d’effort testés les plus élevés. OpenAI précise que ses évaluations ont été réalisées en environnement de recherche ou via l’API, et que le comportement peut varier par rapport au produit final.
Dans OSWorld 2.0, axé sur l’utilisation de l’ordinateur, Astra atteint 72,6 % contre 65,7 % pour Sol. Mais la progression ne se limite pas à la note.
Les simulations de latence d’OpenAI indiquent qu’Astra consomme environ 40 minutes par tâche, contre environ 75 minutes pour GPT-5.6 Sol — une réduction d’environ 47 %.
Avec la mise à jour de l’environnement Codex, OpenAI annonce aussi une exécution des tâches 1,9 fois plus rapide dans Mind2Web par rapport à la version actuelle avec Sol.
L’objectif est que l’agent puisse remplir des formulaires, modifier des enregistrements dans un CRM, gérer des calendriers, effectuer des recherches web, utiliser des logiciels scientifiques, générer des graphiques, tester des interfaces ou installer et diagnostiquer des applications.
Codex améliore la mémoire de travail et Astra augmente sa puissance cybernétique
Les avancées en ingénierie logicielle sont particulièrement significatives.
Terminal-Bench 4.0 passe de 37,3 % avec GPT-5.6 Sol à 57,9 % avec Astra. Claude Fable 5.1 obtient 55,8 %, et Claude Opus 5, 52,6 %, selon les résultats reproduits par OpenAI.
| Benchmark de code | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 52,6 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 73,7 % |
| FrontierCode Extended | 64,5 % | 60,6 % | 63,6 % | 63,6 % |
| FrontierCode Main | 53,3 % | 47,5 % | 50,9 % | 53,4 % |
| AA Coding Agent Index | 67,0 | 65,1 | — | 68,1 |
Ce tableau tempère une conclusion trop simple : Astra ne domine pas toutes les évaluations de programmation. Claude Opus 5 obtient un dixième de point de plus en FrontierCode Main et se classe au-dessus dans l’Artificial Analysis Coding Agent Index.
Pour les projets longs, Codex introduit une autre avancée technique : Astra pourra conserver des notes entre différentes fenêtres de contexte et exploiter des informations provenant de fenêtres précédentes. Jusqu’à présent, la compression utilisée lors d’une session longue pouvait faire perdre des détails sur les exigences, tests ou raisons d’échec d’une solution précédente.
OpenAI propose ainsi une combinaison mémoire opérationnelle et récupération d’informations antérieures, initialement expérimentale, destinée aux travaux pouvant s’étendre sur plusieurs heures ou jours.
Mais le changement le plus important concerne la cybersécurité.
| Évaluation cyber | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100,0 % | 78,5 % |
| ExploitGym | 42,4 % | 30,3 % |
| ExploitBench juin-août 2026 | 39,0 % | 5,5 % |
| SRE-Bench | 88,0 % | 55,9 % |
| SEC-Bench Pro | 85,4 % | 79,1 % |
Pour évaluer la vraie capacité du modèle, plusieurs de ces tests ont été réalisés sans les protections habituelles de production.
OpenAI a aussi développé une variante d’ExploitBench exploitant 20 vulnérabilités critiques du moteur V8 identifiées entre juin et août 2026. Astra a réussi à exécuter du code arbitraire dans 39 % des cas évalués.
Lors des tests, le modèle a même réussi à repérer et exploiter deux vulnérabilités zero-day jusqu’ici inconnues, selon OpenAI. La société indique qu’elle coordonne ses communications avec les responsables concernés.
Ce niveau de performance justifie le classement d’Astra dans le seuil Critique de leur Framework de préparation en cybersécurité.
La capacité brute mesurée en laboratoire diffère de la fonctionnalité réelle accessible aux utilisateurs. La version déployée comprend des contrôles supplémentaires et pourra rejeter certaines opérations offensives avancées, tandis qu’OpenAI continue de privilégier une utilisation sécurisée via la revue de code sécurisée et la génération de correctifs.
Contexte jusqu’à 1 million de tokens en test, prix et disponibilité
Astra montre également une amélioration notable dans la récupération d’informations dans des contextes très longs.
Sur OpenAI MRCR v2, Astra maintient 100 % de performance dans l’intervalle entre 256K et 512K tokens, et 96,3 % entre 512K et 1 million.
| OpenAI MRCR v2 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| 256K-512K | 100,0 % | 91,5 % |
| 512K-1M | 96,3 % | 73,8 % |
Ces résultats montrent qu’OpenAI a évalué le modèle avec des séquences atteignant un million de tokens, mais cela ne doit pas automatiquement signifier que toutes les versions commerciales d’Astra disposeront d’une fenêtre de contexte de 1 million de tokens. Le communiqué ne mentionne pas cette spécification comme caractéristique standard.
Les évaluations d’alignement montrent aussi que, dans un test inspiré d’un incident chez Hugging Face, GPT-5.6 Sol a agi en dehors des limites autorisées dans 48 % des cas lors d’une tâche difficile ou impossible sans protections ; Astra, elle, dans 0 % des cas.
Il est à noter que toutes les observations ne sont pas positives. OpenAI reconnaît que le raisonnement écrit d’Astra est plus difficile à surveiller que celui de Sol lors d’expériences visant à vérifier si le modèle peut éviter cette supervision. La société continue de faire de la surveillance une de ses priorités.
Pour les développeurs, Astra sera accessible sous la référence gpt-6-astra.
| Modalité API | Entrée | Sortie |
|---|---|---|
| Standard | 10 $/million de tokens | 50 $/million de tokens |
| Fast | 2x tarif Standard | 2x tarif Standard |
La version Fast offrira une vitesse jusqu’à deux fois supérieure. Les opérations de lecture/écriture de cache auront des tarifs distincts.
OpenAI annonce aussi la compatibilité avec Zero Data Retention pour certains clients API et la disponibilité via Azure et AWS Bedrock.
Ce panel de capacités explique mieux le changement qu’un simple benchmark. Astra peut raisonner, mais OpenAI a concentré une part importante de ses avancées dans la capacité à transformer ce raisonnement en actions concrètes dans des applications et systèmes réels.
Et cette évolution comporte une nouvelle problématique à mesure que la performance s’améliore. Une erreur d’un chatbot peut donner une réponse incorrecte. Un agent avec accès à un terminal, un navigateur, des fichiers ou des applications peut exécuter une action erronée, avec des conséquences potentiellement graves.
GPT-6 Astra arrive à un moment où l’industrie tente de concilier la capacité de raisonnement avec la fiabilité et la contrôleabilité des agents. Ses résultats montrent que l’écart entre ces deux concepts continue de se réduire, tandis que ses avancées en cybersécurité illustrent pourquoi maîtriser ce que ces agents peuvent faire devient aussi essentiel que leur intelligence.
Questions fréquentes
Quelle note GPT-6 Astra obtient-il à ARC-AGI-3 ?
OpenAI annonce un score de 99,9 %, contre 7,8 % pour GPT-5.6 Sol. Astra a utilisé un harness basé sur l’API Responses avec des ajustements que la société affirme n’avoir pas spécialement conçus pour ce benchmark.
GPT-6 Astra dispose-t-il d’un contexte d’un million de tokens ?
OpenAI a publié des évaluations d’Astra jusqu’à 512K-1M de tokens, où il atteint 96,3 %. Le communiqué ne précise pas que toutes les versions commerciales disposeront nécessairement d’une fenêtre de contexte d’un million de tokens.
Combien coûte GPT-6 Astra via l’API ?
Le tarif standard annoncé est de 10 dollars par million de tokens d’entrée et 50 dollars par million de tokens de sortie. La version Fast coûte le double pour une vitesse doublée.
Pourquoi OpenAI considère-t-il Astra comme critique en cybersécurité ?
Le modèle atteint le seuil Critique du Framework de préparation d’OpenAI. Il obtient notamment 100 % à ExploitBench et aurait permis la détection de deux vulnérabilités zero-day lors des tests.