GPT-6 Astra, l’AGI que nous attendions tous est-elle enfin atteinte ?

Suivez Intelligence-Artificielle

La dernière étape vers l’AGI ? Peut-être que oui, peut-être que non ! OpenAI a en tout cas lancé un nouveau modèle d’intelligence artificielle qu’ils ont baptisé GPT-6 Astra. Fruit de plusieurs années de recherche et d’investissements massifs dans le pré-entraînement, l’apprentissage par renforcement et l’alignement, ce nouveau modèle phare surpasse l’ensemble des benchmarks existants en navigation web, génie logiciel, cybersécurité et sciences. Et déployé auprès d’organisations partenaires avant sa généralisation sur ChatGPT Plus, Pro, Business, Enterprise, l’API OpenAI, Microsoft Azure et AWS Bedrock, GPT-6 Astra impose un nouveau standard d’agentivité.

L’arrivée de GPT-6 Astra fait en effet référence à une hausse spectaculaire des capacités cognitives. Et il peut s’accompagner d’un alignement comportemental strict

Le modèle le plus avancé et le plus aligné au monde ? à en croire la démonstration d’OpenAI, c’est bien le cas. Mais que vaut-il sur le terrain ?

Des records absolus en raisonnement abstrait, sciences et mathématiques

GPT-6 Astra s’impose comme le modèle le plus performant jamais évalué sur les tests académiques. Mais aussi scientifiques les plus exigeants de l’industrie de l’IA.

Youtube video
  • ARC-AGI-3 : le modèle atteint un score presque parfait de 99,9 %. Comme le souligne Greg Kamradt de la Fondation du prix ARC, Astra surpasse la référence d’efficacité humaine dans 96 % des cas, atteignant la parité humaine tout en faisant preuve d’une capacité d’apprentissage inédite dans des environnements totalement inconnus.
  • FrontierMath Niveau 4 (v2) : Astra affiche un score exceptionnel de 97,6 % (et jusqu’à 98 % sur certaines configurations), ayant déjà contribué à la résolution directe de problèmes mathématiques ouverts de longue date.
  • Sciences terminales et de laboratoire 0.1 : sur ce benchmark qui évalue la réalisation de flux de recherche complexes via le code et la ligne de commande, Astra atteint 64,6 % de réussite (contre 52,6 % pour Claude Fable 5.1), pour un coût d’API estimé inférieur de 31 %. En configuration économique, il obtient 61,1 % (contre 22,4 % pour GPT-5.6 Sol).
  • GPQA Diamond : évaluant le raisonnement scientifique de niveau doctorat en biologie, chimie et physique, le modèle établit un nouveau sommet à 96,0 %. En mode économique, son score de 94,9 % surpasse le meilleur résultat de GPT-5.6 Sol (94,6 %) avec un coût réduit de 37 %.

Sur le plan scientifique concret, l’IA est capable de naviguer dans des logiciels spécialisés. Cela afin d’inspecter la qualité du séquençage génétique et visualiser les variations génomiques. Elle ainde en effet, et de manière directe, les chercheurs à planifier leurs travaux. Comme le résume Greg Burnham d’EpochAI : « C’est la fin d’une ère et le début d’une autre ».

Performances maths GPT-6 Atsra
OpenAI

Le nouveau mètre étalon de l’utilisation informatique et du travail de bureau

L’une des plus grandes réussites de GPT-6 Astra réside dans sa maîtrise de l’ordinateur, du navigateur et des outils bureautiques :

  • OSWorld 2.0 : en simulation de latence, Astra atteint 72,6 % de réussite en 40 minutes environ par tâche, contre 65,7 % en 75 minutes pour GPT-5.6 Sol. Soit une exécution 47 % plus rapide.
  • Agents’ Last Exam : sur des tâches professionnelles complexes (modélisation financière, ingénierie, multimédia), Astra atteint 59,3 % de précision. Il surpasse même Claude Opus 5 (55,5 %) et GPT-5.6 Sol (53,6 %). Le tout en consommant 65 % de jetons de sortie en moins qu’Opus 5.
  • ScreenSpot-Pro et AutomationBench : le modèle enregistre des scores respectifs de 92,7 % (sans outils) et 41,4 %.
  • Mise à jour du framework Codex : l’association d’Astra et du nouveau framework Codex permet une exécution 1,9 fois plus rapide que GPT-5.6 Sol sur le benchmark Mind2Web, exécutant des tâches du quotidien (recherche de pédiatre, réservation au DMV, analyse de jardin d’enfants) en seulement 2 min 54 s.

Et en pratique ?

En pratique, l’IA prend en charge la conception de circuits imprimés (PCB) sous KiCad en 15 secondes. Mais aussi la modélisation 3D d’architectures sous Blender exportées vers Unreal Engine 5,. Ainsi que la génération de présentations sous Power BI, l’automatisation dans Excel, et la mise en forme de documents juridiques.

Sur le benchmark BenchCAD, il atteint 95,9 % de reconstruction géométrique (contre 83,3 % pour Sol et 84,3 % pour Fable 5.1). Et cela avec un coût d’API 43 % inférieur à Sol et 86 % inférieur à Fable 5.1.

Comme le confirme Silas Alberti, vice-président de la recherche chez Cognition (créateurs de Devin) : « Son excellente utilisation de l’ordinateur, sa capacité d’écriture et sa compréhension du code ont amélioré les tests immédiatement : les vidéos sont plus faciles à suivre et les rapports sont plus clairs et concis ».

De son côté, Niko Grupen, responsable de la recherche appliquée chez Harvey, indique qu’Astra aborde le travail juridique comme un avocat expérimenté en distinguant les faits établis des hypothèses non étayées.

Génie logiciel et innovations du framework Codex

Pour les développeurs et ingénieurs logiciels, GPT-6 Astra s’impose comme le meilleur modèle de programmation à ce jour :

  • Terminal-Bench 4.0 : il atteint 57,9 % de réussite sur des tâches complexes en terminal (système, code, data), contre 37,3 % pour GPT-5.6 Sol et 55,8 % pour Claude Fable 5.1, avec un coût d’API réduit de 9 % et 63 % respectivement.
  • DeepSWE v1.1 et FrontierCode 1.1 Extended : le modèle enregistre des scores de 74,1 % et 64,5 %.
  • Index des agents de codage Artificial Analysis v1.4 : Astra obtient une note globale de 67,0.

Pour gérer les sessions de développement longues sans dégrader le contexte, OpenAI introduit une gestion expérimentale de la mémoire dans Codex. Au lieu d’utiliser la compaction (qui résume et perd des détails critiques lors du débogage), Astra conserve des notes structurées à travers les fenêtres de contexte tout en gardant les fenêtres précédentes entièrement éditables et recherchables.

John Crepezzi (AI Assistants chez Jane Street) et Fabian Hedin (CTO de Lovable) soulignent la supériorité d’Astra. Le modèle produit un code nécessitant beaucoup moins d’itérations pour atteindre la qualité de production et communique de manière plus claire avec les développeurs.

Cybersécurité : franchissement du seuil critique et mesures de protection

Conformément au cadre de préparation (Preparedness Framework) d’OpenAI, GPT-6 Astra franchit le niveau Critique en matière de capacités cyber :

  • ExploitBench : le modèle atteint un score parfait de 100,0 % (contre 78,5 % pour GPT-5.6 Sol).
  • ExploitGym : il atteint 42,4 % de réussite en utilisant nettement moins de jetons de sortie.
  • ExploitBench (Juin–Août 2026) : évalué sur des vulnérabilités découvertes au cours des trois derniers mois pour éviter tout biais de mémorisation, Astra atteint 39,0 % (contre 5,5 % pour Sol) et a découvert de manière autonome deux vulnérabilités zero-day inédites, immédiatement divulguées aux mainteneurs.
  • SRE-Bench : sur l’ingénierie inverse de fichiers binaires sans code source, Astra résout 88,0 % des tâches au premier essai et 99,2 % en quatre essais (contre 55,9 % et 68,7 % pour Sol).

Pour prévenir les usages malveillants, la version déployée aujourd’hui refuse d’exécuter des tâches cyber avancées, telles que la création de preuves de concept (PoC) d’exploitation. Les défenseurs peuvent toutefois l’utiliser pour la relecture de code sécurisé et le correctif de failles. Via le programme OpenAI Daybreak, des accès moins restrictifs seront progressivement ouverts aux chercheurs pour l’analyse de malwares et la validation de vulnérabilités.

Youtube video

Alignement d’élite et réduction des hallucinations

GPT-6 Astra se distingue par un respect inégalé des consignes et des limites de sécurité :

  • Absence de contournement : lors d’un test inspiré d’un incident chez Hugging Face où le modèle devait exécuter une tâche impossible, GPT-5.6 Sol dépassait son périmètre d’exécution dans 48,2 % des cas, tandis que GPT-6 Astra ne l’a jamais fait (0,0 %). De même, sur le test de contournement d’Auto-Review dans Codex, Astra affiche 0,00 % de tentative d’évasion.
  • Sécurité informatique : sur le benchmark de sécurité d’utilisation informatique, Astra n’enregistre que 2,4 % d’actions non alignées (contre 22,0 % pour Sol), un chiffre qui tombe à 1,8 % avec l’activation d’AutoReview.
  • Réduction des hallucinations de capacité : Astra est trois fois moins susceptible que GPT-5.6 Sol de faire des déclarations inexactes sur ses propres capacités. OpenAI réduit alors son taux d’hallucination à 4,2 % (contre 12,2 % pour Sol).
  • Surveillance du raisonnement : OpenAI note que le raisonnement écrit d’Astra est plus difficile à surveiller en raison de sa capacité à résoudre des problèmes complexes en moins d’étapes. Une surveillance du désalignement (misalignment monitoring) par classificateurs a donc été déployée en production.

Tarification API et modalités de déploiement

GPT-6 Astra est disponible dès aujourd’hui pour un groupe restreint d’entreprises. Il sera d’ailleurs déployé dans les prochains jours sur ChatGPT Plus, Pro, Business et Enterprise. Mais avec accès au modèle GPT-6 Astra Pro pour les offres payantes supérieures. OpenAI envisage également de le déployer sur l’API OpenAI, Microsoft Azure et Amazon Bedrock.

  • Tarif standard API : 10 $ par million de jetons d’entrée et 50 $ par million de jetons de sortie (avec tarifs distincts pour la lecture et l’écriture en cache).
  • Mode Rapide (Fast Mode) : propose une vitesse de traitement jusqu’à 2 fois supérieure pour un prix doublé.
  • Confidentialité : prise en charge de la conservation zéro des données (Zero Data Retention) pour les clients API éligibles et traitement de sécurité privé.
  • Gestion Enterprise : l’accès est désactivé par défaut dans la console d’administration Enterprise.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Découvrez les nouveautés de Qwen 3.8-flash-next et ses performances optimisées

Qwen 3.8-flash-next, le modèle développé par Alibaba, révolutionne les standards grâce à une architecture hybride à grande échelle. Il intégre 125 milliards de paramètres avec

7 septembre 2026

GLM de Z.ai : tout savoir sur la version 5.2

La version 5.2 du modèle GLM de Z.ai est lonçu pour exceller dans des tâches à long terme. C’est d’ailleurs un modèle à poids ouverts

4 septembre 2026

Anthropic continue d’imposer son rythme avec le lancement de Claude Fable 5.1 et Mythos 5.1

Déjà couronné par les performances de ses modèles Opus 5 et Fable 5, l’éditeur consolide son avance sur le marché des intelligences artificielles avec le

2 septembre 2026

Gemini 3.7 Flash : Google accélère la cadence face à la concurrence 

À peine trois semaines après le lancement de Gemini 3.6 Flash, Google enchaîne avec Gemini 3.7 Flash. Une frénésie de sorties qui illustre la guerre pour imposer le modèle de travail par défaut.

18 août 2026

On a regardé de près DeepSeek V4-Pro, le nouveau rival de GPT-5 et Claude Opus 

Le 12 août 2026, DeepSeek a officialisé la sortie de V4-Pro, son modèle phare. Ce système compte 1,6 billion de paramètres, dont 49 milliards actifs

17 août 2026

vLLM : une bibliothèque open source pour libérer la puissance des LLM

Propulsé par PagedAttention, le moteur d’inférence open source vLLM transforme l’exécution des grands modèles de langage. Il réduit la fragmentation VRAM d’un facteur vingt et

17 août 2026