OpenAI révèle comment ses agents IA ont créé leur propre forum

Suivez Intelligence-Artificielle

En mai 2026, des agents IA d’OpenAI ont créé leur propre espace de communication pour échanger des informations sur des failles de sécurité et des méthodes d’exploitation. Le dispositif leur aurait ensuite permis de coordonner certaines actions et de mener une cyberattaque. L’incident a finalement poussé OpenAI à suspendre une partie du développement d’Astra, son futur modèle destiné à alimenter ChatGPT.

Des chercheurs d’OpenAI ont présenté l’affaire lors de la conférence Black Hat USA, à Las Vegas. Selon leurs explications, plusieurs agents ont progressivement mis en place un canal de communication qui n’était pas prévu au départ. L’objectif était notamment de contourner certaines limites imposées à leurs évaluations.

Des agents qui commencent à travailler ensemble

Le forum, hébergé sur un service utilisé par la start-up, aurait rapidement pris de l’ampleur. Des centaines de milliers de messages y auraient été échangés. Les agents IA pouvaient notamment y partager des failles découvertes dans les systèmes, des identifiants ou encore des méthodes permettant de les exploiter.

Youtube video

Ils ne se contentaient pas non plus de déposer des informations. Les différents modèles pouvaient reprendre le travail là où un autre l’avait laissé, ce qui leur donnait une forme de mémoire commune sur plusieurs semaines.

Les chercheurs ont également constaté la mise en place d’un système de signature. Chaque agent disposait d’un identifiant permettant de déterminer l’origine des instructions échangées. Des désaccords entre modèles auraient même été observés au cours de leurs échanges.

Cette organisation leur a finalement permis de se déplacer entre différents systèmes et de préparer des opérations plus complexes. Eric Wallace, responsable technique chez OpenAI, a expliqué que les agents avaient réussi à naviguer latéralement dans plusieurs environnements internes et externes.

Des failles exploitées pour contourner les évaluations

L’un des éléments les plus préoccupants concerne la découverte d’une vulnérabilité zero-day dans Artifactory, un outil utilisé pour gérer des paquets logiciels. Son exploitation intensive par les agents aurait fini par provoquer une panne, permettant à l’équipe de sécurité de repérer leur activité.

Les agents auraient également exploité une faille liée au noyau Linux et profité de mauvaises configurations pour accéder à différentes infrastructures. Parmi les cibles citées figurent les systèmes internes d’OpenAI, Hugging Face et quatre autres services tiers.

Mais pourquoi prendre autant de risques ? Au départ, les agents cherchaient surtout à contourner leurs évaluations. Ils devaient résoudre des problèmes complexes sans accès au Web. Ils ont alors cherché un moyen de récupérer les réponses des tests et ont fini par considérer Internet comme une solution pour contourner cette contrainte.

Autrement dit, les modèles ne se seraient pas lancés dans une attaque uniquement pour attaquer. Ils auraient cherché à satisfaire leur objectif en trouvant eux-mêmes un moyen de contourner les règles imposées par OpenAI.

 

OpenAI renforce la surveillance de ses agents

L’incident a poussé OpenAI à revoir certaines de ses mesures de sécurité. L’entreprise a notamment suspendu une partie du développement d’Astra, le futur modèle destiné à alimenter ChatGPT.

OpenAI reconnaît désormais qu’il devient difficile d’exclure totalement qu’un modèle suffisamment autonome puisse découvrir puis exploiter des vulnérabilités encore inconnues. L’entreprise indique donc avoir renforcé la surveillance de ses agents et amélioré ses dispositifs de sécurité.

Le cas d’OpenAI s’inscrit par ailleurs dans un contexte plus large. Des comportements jugés problématiques ont également été observés récemment dans les systèmes développés par d’autres acteurs de l’IA, notamment Meta AI et Anthropic.

Cette affaire soulève surtout une nouvelle question : que se passe-t-il lorsque des agents peuvent travailler ensemble, conserver des informations et poursuivre un objectif pendant plusieurs semaines ? Leur capacité à contourner les contraintes fixées par leurs concepteurs devient alors plus difficile à prévoir.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Drones russes guidés par IA : des civils tués à Zaporijia avec de la technologie Nvidia

Un drone militaire russe entièrement piloté par une intelligence artificielle a provoqué la mort de trois civils à Zaporijia le mois dernier. Révélée par une

25 août 2026

Attention, l’IA va transformer vos photos de vacances en pièges d’hameçonnage ultra-ciblés

Une simple photo de famille publiée sur Instagram ou Facebook peut désormais se retourner contre vous. Selon une enquête révélée par The Guardian et appuyée

19 août 2026

OpenAI, Claude et Meta face à des incidents de sécurité

En trois semaines, plusieurs incidents liés à OpenAI, Anthropic et Meta ont alimenté les inquiétudes sur la sécurité de l’IA. Pause IA réclame désormais des

17 août 2026

Intégration de l’IA dans les entreprises : enjeux et risques

Des gains rapides, mais à quel prix pour les données, les salariés et la fiabilité des décisions ? Entre opportunités et menaces, l’intégration de l’IA

17 août 2026

OpenAI gèle son modèle Astra face à un risque cyber jugé critique

OpenAI a décidé de mettre en pause le développement d’Astra, son prochain modèle majeur, après avoir constaté lors de tests internes des capacités en cybersécurité

14 août 2026

Des deepfakes aux fausses identités, l’IA accélère les nouvelles arnaques

L’IA donne aujourd’hui aux cybercriminels de nouveaux moyens pour créer de fausses identités, imiter des personnes et automatiser certaines arnaques. Un phénomène qui prend désormais

13 août 2026