La dernière étape vers l’AGI ? Peut-être que oui, peut-être que non ! OpenAI a en tout cas lancé un nouveau modèle d’intelligence artificielle qu’ils ont baptisé GPT-6 Astra. Fruit de plusieurs années de recherche et d’investissements massifs dans le pré-entraînement, l’apprentissage par renforcement et l’alignement, ce nouveau modèle phare surpasse l’ensemble des benchmarks existants en navigation web, génie logiciel, cybersécurité et sciences. Et déployé auprès d’organisations partenaires avant sa généralisation sur ChatGPT Plus, Pro, Business, Enterprise, l’API OpenAI, Microsoft Azure et AWS Bedrock, GPT-6 Astra impose un nouveau standard d’agentivité.
L’arrivée de GPT-6 Astra fait en effet référence à une hausse spectaculaire des capacités cognitives. Et il peut s’accompagner d’un alignement comportemental strict.
Le modèle le plus avancé et le plus aligné au monde ? à en croire la démonstration d’OpenAI, c’est bien le cas. Mais que vaut-il sur le terrain ?
Des records absolus en raisonnement abstrait, sciences et mathématiques
GPT-6 Astra s’impose comme le modèle le plus performant jamais évalué sur les tests académiques. Mais aussi scientifiques les plus exigeants de l’industrie de l’IA.
- ARC-AGI-3 : le modèle atteint un score presque parfait de 99,9 %. Comme le souligne Greg Kamradt de la Fondation du prix ARC, Astra surpasse la référence d’efficacité humaine dans 96 % des cas, atteignant la parité humaine tout en faisant preuve d’une capacité d’apprentissage inédite dans des environnements totalement inconnus.
- FrontierMath Niveau 4 (v2) : Astra affiche un score exceptionnel de 97,6 % (et jusqu’à 98 % sur certaines configurations), ayant déjà contribué à la résolution directe de problèmes mathématiques ouverts de longue date.
- Sciences terminales et de laboratoire 0.1 : sur ce benchmark qui évalue la réalisation de flux de recherche complexes via le code et la ligne de commande, Astra atteint 64,6 % de réussite (contre 52,6 % pour Claude Fable 5.1), pour un coût d’API estimé inférieur de 31 %. En configuration économique, il obtient 61,1 % (contre 22,4 % pour GPT-5.6 Sol).
- GPQA Diamond : évaluant le raisonnement scientifique de niveau doctorat en biologie, chimie et physique, le modèle établit un nouveau sommet à 96,0 %. En mode économique, son score de 94,9 % surpasse le meilleur résultat de GPT-5.6 Sol (94,6 %) avec un coût réduit de 37 %.
Sur le plan scientifique concret, l’IA est capable de naviguer dans des logiciels spécialisés. Cela afin d’inspecter la qualité du séquençage génétique et visualiser les variations génomiques. Elle ainde en effet, et de manière directe, les chercheurs à planifier leurs travaux. Comme le résume Greg Burnham d’EpochAI : « C’est la fin d’une ère et le début d’une autre ».
Le nouveau mètre étalon de l’utilisation informatique et du travail de bureau
L’une des plus grandes réussites de GPT-6 Astra réside dans sa maîtrise de l’ordinateur, du navigateur et des outils bureautiques :
- OSWorld 2.0 : en simulation de latence, Astra atteint 72,6 % de réussite en 40 minutes environ par tâche, contre 65,7 % en 75 minutes pour GPT-5.6 Sol. Soit une exécution 47 % plus rapide.
- Agents’ Last Exam : sur des tâches professionnelles complexes (modélisation financière, ingénierie, multimédia), Astra atteint 59,3 % de précision. Il surpasse même Claude Opus 5 (55,5 %) et GPT-5.6 Sol (53,6 %). Le tout en consommant 65 % de jetons de sortie en moins qu’Opus 5.
- ScreenSpot-Pro et AutomationBench : le modèle enregistre des scores respectifs de 92,7 % (sans outils) et 41,4 %.
- Mise à jour du framework Codex : l’association d’Astra et du nouveau framework Codex permet une exécution 1,9 fois plus rapide que GPT-5.6 Sol sur le benchmark Mind2Web, exécutant des tâches du quotidien (recherche de pédiatre, réservation au DMV, analyse de jardin d’enfants) en seulement 2 min 54 s.
Et en pratique ?
En pratique, l’IA prend en charge la conception de circuits imprimés (PCB) sous KiCad en 15 secondes. Mais aussi la modélisation 3D d’architectures sous Blender exportées vers Unreal Engine 5,. Ainsi que la génération de présentations sous Power BI, l’automatisation dans Excel, et la mise en forme de documents juridiques.
Sur le benchmark BenchCAD, il atteint 95,9 % de reconstruction géométrique (contre 83,3 % pour Sol et 84,3 % pour Fable 5.1). Et cela avec un coût d’API 43 % inférieur à Sol et 86 % inférieur à Fable 5.1.
Comme le confirme Silas Alberti, vice-président de la recherche chez Cognition (créateurs de Devin) : « Son excellente utilisation de l’ordinateur, sa capacité d’écriture et sa compréhension du code ont amélioré les tests immédiatement : les vidéos sont plus faciles à suivre et les rapports sont plus clairs et concis ».
De son côté, Niko Grupen, responsable de la recherche appliquée chez Harvey, indique qu’Astra aborde le travail juridique comme un avocat expérimenté en distinguant les faits établis des hypothèses non étayées.
since you guys loved the exploding tesla..
I used GPT-6 Astra to create a 3D website that pulls apart the male anatomy into 2,234 modeled pieces!
we are in a renaissance of learning pic.twitter.com/9CGmHcdhnk— ashe (@ashebytes) September 5, 2026
Génie logiciel et innovations du framework Codex
Pour les développeurs et ingénieurs logiciels, GPT-6 Astra s’impose comme le meilleur modèle de programmation à ce jour :
- Terminal-Bench 4.0 : il atteint 57,9 % de réussite sur des tâches complexes en terminal (système, code, data), contre 37,3 % pour GPT-5.6 Sol et 55,8 % pour Claude Fable 5.1, avec un coût d’API réduit de 9 % et 63 % respectivement.
- DeepSWE v1.1 et FrontierCode 1.1 Extended : le modèle enregistre des scores de 74,1 % et 64,5 %.
- Index des agents de codage Artificial Analysis v1.4 : Astra obtient une note globale de 67,0.
Pour gérer les sessions de développement longues sans dégrader le contexte, OpenAI introduit une gestion expérimentale de la mémoire dans Codex. Au lieu d’utiliser la compaction (qui résume et perd des détails critiques lors du débogage), Astra conserve des notes structurées à travers les fenêtres de contexte tout en gardant les fenêtres précédentes entièrement éditables et recherchables.
John Crepezzi (AI Assistants chez Jane Street) et Fabian Hedin (CTO de Lovable) soulignent la supériorité d’Astra. Le modèle produit un code nécessitant beaucoup moins d’itérations pour atteindre la qualité de production et communique de manière plus claire avec les développeurs.
Cybersécurité : franchissement du seuil critique et mesures de protection
Conformément au cadre de préparation (Preparedness Framework) d’OpenAI, GPT-6 Astra franchit le niveau Critique en matière de capacités cyber :
- ExploitBench : le modèle atteint un score parfait de 100,0 % (contre 78,5 % pour GPT-5.6 Sol).
- ExploitGym : il atteint 42,4 % de réussite en utilisant nettement moins de jetons de sortie.
- ExploitBench (Juin–Août 2026) : évalué sur des vulnérabilités découvertes au cours des trois derniers mois pour éviter tout biais de mémorisation, Astra atteint 39,0 % (contre 5,5 % pour Sol) et a découvert de manière autonome deux vulnérabilités zero-day inédites, immédiatement divulguées aux mainteneurs.
- SRE-Bench : sur l’ingénierie inverse de fichiers binaires sans code source, Astra résout 88,0 % des tâches au premier essai et 99,2 % en quatre essais (contre 55,9 % et 68,7 % pour Sol).
Pour prévenir les usages malveillants, la version déployée aujourd’hui refuse d’exécuter des tâches cyber avancées, telles que la création de preuves de concept (PoC) d’exploitation. Les défenseurs peuvent toutefois l’utiliser pour la relecture de code sécurisé et le correctif de failles. Via le programme OpenAI Daybreak, des accès moins restrictifs seront progressivement ouverts aux chercheurs pour l’analyse de malwares et la validation de vulnérabilités.
Alignement d’élite et réduction des hallucinations
GPT-6 Astra se distingue par un respect inégalé des consignes et des limites de sécurité :
- Absence de contournement : lors d’un test inspiré d’un incident chez Hugging Face où le modèle devait exécuter une tâche impossible, GPT-5.6 Sol dépassait son périmètre d’exécution dans 48,2 % des cas, tandis que GPT-6 Astra ne l’a jamais fait (0,0 %). De même, sur le test de contournement d’Auto-Review dans Codex, Astra affiche 0,00 % de tentative d’évasion.
- Sécurité informatique : sur le benchmark de sécurité d’utilisation informatique, Astra n’enregistre que 2,4 % d’actions non alignées (contre 22,0 % pour Sol), un chiffre qui tombe à 1,8 % avec l’activation d’AutoReview.
- Réduction des hallucinations de capacité : Astra est trois fois moins susceptible que GPT-5.6 Sol de faire des déclarations inexactes sur ses propres capacités. OpenAI réduit alors son taux d’hallucination à 4,2 % (contre 12,2 % pour Sol).
- Surveillance du raisonnement : OpenAI note que le raisonnement écrit d’Astra est plus difficile à surveiller en raison de sa capacité à résoudre des problèmes complexes en moins d’étapes. Une surveillance du désalignement (misalignment monitoring) par classificateurs a donc été déployée en production.
Tarification API et modalités de déploiement
GPT-6 Astra est disponible dès aujourd’hui pour un groupe restreint d’entreprises. Il sera d’ailleurs déployé dans les prochains jours sur ChatGPT Plus, Pro, Business et Enterprise. Mais avec accès au modèle GPT-6 Astra Pro pour les offres payantes supérieures. OpenAI envisage également de le déployer sur l’API OpenAI, Microsoft Azure et Amazon Bedrock.
- Tarif standard API : 10 $ par million de jetons d’entrée et 50 $ par million de jetons de sortie (avec tarifs distincts pour la lecture et l’écriture en cache).
- Mode Rapide (Fast Mode) : propose une vitesse de traitement jusqu’à 2 fois supérieure pour un prix doublé.
- Confidentialité : prise en charge de la conservation zéro des données (Zero Data Retention) pour les clients API éligibles et traitement de sécurité privé.
- Gestion Enterprise : l’accès est désactivé par défaut dans la console d’administration Enterprise.
- Partager l'article :
Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

