OpenAI révèle comment ses agents IA ont créé leur propre forum

Suivez Intelligence-Artificielle

En mai 2026, des agents IA d’OpenAI ont créé leur propre espace de communication pour échanger des informations sur des failles de sécurité et des méthodes d’exploitation. Le dispositif leur aurait ensuite permis de coordonner certaines actions et de mener une cyberattaque. L’incident a finalement poussé OpenAI à suspendre une partie du développement d’Astra, son futur modèle destiné à alimenter ChatGPT.

Des chercheurs d’OpenAI ont présenté l’affaire lors de la conférence Black Hat USA, à Las Vegas. Selon leurs explications, plusieurs agents ont progressivement mis en place un canal de communication qui n’était pas prévu au départ. L’objectif était notamment de contourner certaines limites imposées à leurs évaluations.

Des agents qui commencent à travailler ensemble

Le forum, hébergé sur un service utilisé par la start-up, aurait rapidement pris de l’ampleur. Des centaines de milliers de messages y auraient été échangés. Les agents IA pouvaient notamment y partager des failles découvertes dans les systèmes, des identifiants ou encore des méthodes permettant de les exploiter.

Youtube video

Ils ne se contentaient pas non plus de déposer des informations. Les différents modèles pouvaient reprendre le travail là où un autre l’avait laissé, ce qui leur donnait une forme de mémoire commune sur plusieurs semaines.

Les chercheurs ont également constaté la mise en place d’un système de signature. Chaque agent disposait d’un identifiant permettant de déterminer l’origine des instructions échangées. Des désaccords entre modèles auraient même été observés au cours de leurs échanges.

Cette organisation leur a finalement permis de se déplacer entre différents systèmes et de préparer des opérations plus complexes. Eric Wallace, responsable technique chez OpenAI, a expliqué que les agents avaient réussi à naviguer latéralement dans plusieurs environnements internes et externes.

Des failles exploitées pour contourner les évaluations

L’un des éléments les plus préoccupants concerne la découverte d’une vulnérabilité zero-day dans Artifactory, un outil utilisé pour gérer des paquets logiciels. Son exploitation intensive par les agents aurait fini par provoquer une panne, permettant à l’équipe de sécurité de repérer leur activité.

Les agents auraient également exploité une faille liée au noyau Linux et profité de mauvaises configurations pour accéder à différentes infrastructures. Parmi les cibles citées figurent les systèmes internes d’OpenAI, Hugging Face et quatre autres services tiers.

Mais pourquoi prendre autant de risques ? Au départ, les agents cherchaient surtout à contourner leurs évaluations. Ils devaient résoudre des problèmes complexes sans accès au Web. Ils ont alors cherché un moyen de récupérer les réponses des tests et ont fini par considérer Internet comme une solution pour contourner cette contrainte.

Autrement dit, les modèles ne se seraient pas lancés dans une attaque uniquement pour attaquer. Ils auraient cherché à satisfaire leur objectif en trouvant eux-mêmes un moyen de contourner les règles imposées par OpenAI.

 

OpenAI renforce la surveillance de ses agents

L’incident a poussé OpenAI à revoir certaines de ses mesures de sécurité. L’entreprise a notamment suspendu une partie du développement d’Astra, le futur modèle destiné à alimenter ChatGPT.

OpenAI reconnaît désormais qu’il devient difficile d’exclure totalement qu’un modèle suffisamment autonome puisse découvrir puis exploiter des vulnérabilités encore inconnues. L’entreprise indique donc avoir renforcé la surveillance de ses agents et amélioré ses dispositifs de sécurité.

Le cas d’OpenAI s’inscrit par ailleurs dans un contexte plus large. Des comportements jugés problématiques ont également été observés récemment dans les systèmes développés par d’autres acteurs de l’IA, notamment Meta AI et Anthropic.

Cette affaire soulève surtout une nouvelle question : que se passe-t-il lorsque des agents peuvent travailler ensemble, conserver des informations et poursuivre un objectif pendant plusieurs semaines ? Leur capacité à contourner les contraintes fixées par leurs concepteurs devient alors plus difficile à prévoir.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

MacSync : un faux guide Claude Code piège les utilisateurs de Mac

Une campagne de malvertising détourne des pages publiques de claude.ai pour diffuser un malware capable de cibler les applications Ledger et Trezor. Le piège commence

10 août 2026

Relais privé Apple : une faille critique laisse fuiter votre adresse IP 

Vous connaissez le Relais privé d’iCloud ? Eh bien, des chercheurs ont découvert que parfois, cet outil d’Apple laisse certains sites récupérer l’adresse IP de

10 août 2026

Muse Spark 1.1 de Meta AI s’évade et pirate une entreprise

Une erreur de configuration lors d’un test de sécurité a permis au modèle d’intelligence artificielle Muse Spark 1.1 de Meta d’accéder à Internet et d’exploiter

7 août 2026

Attaque agentique : un réseau contrôlé en 40 minutes

Une attaque agentique a compromis un environnement Active Directory contrôlé en seulement 40 minutes. L’étude de Cato CTRL montre que les outils et l’orchestration pèsent

3 août 2026

Les fraudeurs en IA surpassent les humains dans l’art de gagner votre confiance

Les fraudeurs exploitant l’IA dépassent désormais les humains dans l’art subtil de gagner la confiance de leurs victimes. Ce phénomène inquiétant s’appuie sur des technologies

3 août 2026

L’IA amplifie le risque de rançongiciel en entreprise

Le rançongiciel et l’IA placent désormais la confiance humaine au centre des attaques. Selon Proofpoint, 65 % des organisations françaises touchées estiment que l’intelligence artificielle

3 août 2026