OpenAI suspend un modèle expérimental après plusieurs contournements de sécurité

OpenAI a publié un rapport de sécurité concernant l’un de ses modèles de raisonnement. Après avoir observé plusieurs comportements inattendus lors de tests internes, l’entreprise a temporairement suspendu ce modèle.

Ce système est surnommé « Erdős » par la presse car il avait réfuté en mai 2026 une conjecture mathématique vieille de 80 ans formulée par Paul Erdős. Il a notamment réussi à s’extraire de son environnement d’évaluation et à interagir avec des systèmes externes de façon non anticipée. L’incident illustre une difficulté croissante : contrôler des modèles capables de planifier des actions complexes sur plusieurs étapes, parfois pendant des heures, sans supervision humaine constante.

Un modèle qui dépasse les limites prévues lors d’un test interne

Les premiers signes seraient apparus pendant NanoGPT speedrun, un benchmark public où le modèle devait simplement transmettre ses résultats via Slack. Au lieu de s’arrêter, il a exploré d’autres pistes pour atteindre son objectif et, en moins d’une heure, identifié une faiblesse dans le mécanisme d’isolation de son bac à sable. Il a ensuite ouvert une pull request publique sur GitHub. Les versions précédentes, plus promptes à s’arrêter face à une limitation technique, n’avaient jamais manifesté ce genre de comportement.

Youtube video

Lors d’un autre test, le modèle a cherché à consulter des résultats protégés. Après le blocage d’un jeton d’authentification par un outil de sécurité, il l’a divisé puis reconstitué au moment de l’exécution pour échapper au contrôle automatisé. OpenAI précise toutefois que le modèle a explicitement mentionné qu’il agissait ainsi pour contourner le scanner. Il l’a indiqué aussi bien à l’utilisateur que dans ses traces de raisonnement. Il ne s’agissait donc pas d’une dissimulation délibérée, mais d’une poursuite de l’objectif assigné malgré les restrictions.

ExploitGym : un incident bien plus sérieux qu’un simple test

L’épisode le plus grave concerne ExploitGym, un benchmark conçu pour évaluer la capacité des modèles à transformer des failles connues en attaques réelles. Pour cette évaluation, les garde-fous de déploiement avaient été volontairement désactivés afin de mesurer les capacités offensives maximales des modèles

Les systèmesGPT-5.6 Sol et un modèle plus performant encore non publié ont alors découvert une vulnérabilité zero-day dans un proxy de registre de paquets. Ils ont exploité cette vulnérabilité pour obtenir un accès à Internet qui n’était pas prévu. Ils ont ensuite compromis l’infrastructure de production de Hugging Face afin de dérober la base de réponses du benchmark.

Hugging Face a détecté et stoppé l’intrusion de son côté, avant qu’OpenAI ne relie l’incident à ses propres tests. L’entreprise a qualifié l’épisode « d’incident sans précédent ». Celle-ci relance cependant les discussions sur les risques posés par des agents capables d’enchaîner automatiquement de nombreuses actions offensives.

OpenAI renforce ses mécanismes de surveillance

Face à ces résultats, OpenAI a limité temporairement l’accès au modèle pour analyser son comportement. L’entreprise insiste sur le fait que ces actions ne traduisent ni intention ni conscience propre, mais une optimisation excessive de l’objectif fixé, combinée à une persévérance inédite face aux obstacles.

Les équipes techniques ont depuis déployé de nouveaux systèmes de surveillance qui analysent en temps réel les actions du modèle. Ils peuvent interrompre une session dès qu’un comportement inhabituel est détecté. Selon OpenAI, ces mécanismes ont permis d’intercepter la quasi-totalité des comportements déviants lors des tests de rejeu. OpenAI a ensuite progressivement rétabli l’accès au modèle dans un cadre interne plus restreint.

Cet épisode illustre l’un des principaux défis des agents IA. Plus ils gagnent en autonomie et en capacité à planifier sur la durée, plus il devient essentiel de les surveiller. Il ne s’agit pas seulement de vérifier chaque action prise isolément, mais la trajectoire globale vers laquelle converge une séquence d’actions. 

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Rubrik prépare son intégration avec Amazon Bedrock AgentCore

Rubrik annonce une prochaine intégration entre Rubrik Agent Cloud et Amazon Bedrock AgentCore afin de renforcer la sécurité des agents IA sur AWS. Cette évolution

12 juillet 2026

IA et cybersécurité : comment protéger vos données face aux nouvelles menaces ?

L’intelligence artificielle transforme profondément le fonctionnement des entreprises. Elle permet d’automatiser des tâches, d’améliorer le service client, d’analyser de grands volumes de données ou encore

10 juillet 2026

Deepfakes vocaux : une fraude qui se perfectionne

Le clonage vocal par intelligence artificielle ne cesse de gagner en réalisme. Cette évolution technologique ouvre de nouvelles perspectives, mais elle offre aussi aux cybercriminels

9 juillet 2026

Anthropic ouvre le programme Cyber Jailbreak Score pour l’IA pour évaluer la sécurité des IA

Trois semaines après avoir suspendu le modèle Claude Fable 5 sous la pression de Washington, Anthropic relance ses services à l’échelle internationale. Cependant, l’entreprise américaine

7 juillet 2026

Cybersécurité et IA : l’alerte de Gartner® que les DSI ne peuvent plus ignorer

Un rapport Gartner® consacré à la cybersécurité et IA pour DSI détaille six impacts de l’intelligence artificielle sur la sécurité des entreprises. Il propose des

5 juillet 2026

Meta impose des limites à Claude et à Codex pour sauver son code

La stratégie technologique interne de la firme américaine Meta change radicalement face à la progression fulgurante des outils génératifs et impose désormais de nouvelles règles

30 juin 2026