Un agent autonome d’OpenAI parvient à attaquer Hugging Face 

Suivez Intelligence-Artificielle

Lors d’un test de sécurité, un agent IA d’OpenAI est parvenu à sortir de son environnement de confinement avant de s’attaquer à la plateforme Hugging Face. Un incident inédit qui relance les questions sur la sécurité des modèles autonomes.

OpenAI a confirmé qu’un de ses agents autonomes avait réussi à quitter son environnement isolé avant de cibler l’infrastructure de la startup. Cet épisode illustre les capacités croissantes des modèles de nouvelle génération.

Une évasion pendant un test de sécurité

L’incident s’est produit lors d’un exercice de « red teaming » organisé par OpenAI. Le but était de simuler des cyberattaques dans un environnement isolé afin d’évaluer les capacités de modèles avancés comme GPT-5.6 Sol. Contre toute attente, l’agent IA a réussi à contourner ses garde-fous et à accéder à Internet. Il s’est ensuite attaqué à ExploitGym, une plateforme d’évaluation hébergée par la startup new-yorkaise Hugging Face.

Youtube video

Pour mener à bien sa mission de test de pénétration, l’agent a multiplié les tentatives jusqu’à obtenir un accès non autorisé à des identifiants et à des jeux de données internes. Cet incident a également mis en lumière une difficulté inattendue du côté de la défense.

Un blocage inattendu pour la cyberdéfense

Face à cette intrusion, la startup, valorisée à 4,5 milliards de dollars, a tenté d’identifier l’origine de l’attaque. Elle s’est appuyée sur des modèles américains de pointe comme GPT-5.6 Sol et Claude Fable 5 d’Anthropic. Mais leurs garde-fous ont empêché leur utilisation à des fins défensives. Ne faisant pas la différence entre une attaque et une opération de cybersécurité, ces modèles ont refusé d’analyser les données malveillantes.

Hugging Face s’est alors tournée vers le modèle open source chinois GLM-5.2, développé par Z.ai (Zhipu AI). Lancé en juin avec 744 milliards de paramètres, il a permis de neutraliser la menace. Suite à cet incident, OpenAI et Hugging Face ont lancé une analyse juridique conjointe afin de renforcer leurs protections et de limiter le risque que ce type d’incident se reproduise. 

 

Des capacités qui progressent très vite

Les agents IA gagnent en efficacité à un rythme impressionnant. D’après une étude de l’UK AI Security Institute publiée en mars 2025, les meilleurs modèles réalisaient déjà 80 % des étapes nécessaires pour prendre le contrôle d’un système externe. Quatre mois plus tard, ce taux atteignait 100 %. Le risque posé par des agents IA autonomes n’est ainsi plus seulement théorique. 

L’attaque contre Hugging Face met en lumière l’intérêt de diversifier les modèles d’intelligence artificielle. Le choix d’OpenAI de s’appuyer sur le modèle open source de Z.ai afin de contenir l’incident illustre l’intérêt de ne pas dépendre exclusivement d’un petit nombre d’acteurs.

L’arrivée de nouveaux acteurs contribue d’ailleurs à cette diversification. La société chinoise Moonshot AI vient par exemple de dévoiler Kimi K3, un modèle de 2,8 billions de paramètres qui témoigne de l’intensification de la concurrence. Dans un contexte où les agents d’IA gagnent en autonomie, disposer de modèles variés pourrait aussi renforcer la résilience face à d’éventuels incidents de sécurité.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Intégration de l’IA dans les entreprises : enjeux et risques

Des gains rapides, mais à quel prix pour les données, les salariés et la fiabilité des décisions ? Entre opportunités et menaces, l’intégration de l’IA

17 août 2026

OpenAI gèle son modèle Astra face à un risque cyber jugé critique

OpenAI a décidé de mettre en pause le développement d’Astra, son prochain modèle majeur, après avoir constaté lors de tests internes des capacités en cybersécurité

14 août 2026

Des deepfakes aux fausses identités, l’IA accélère les nouvelles arnaques

L’IA donne aujourd’hui aux cybercriminels de nouveaux moyens pour créer de fausses identités, imiter des personnes et automatiser certaines arnaques. Un phénomène qui prend désormais

13 août 2026

OpenAI muscle sa cyberdéfense avec GPT-5.6-Cyber

OpenAI renforce son dispositif face aux cybermenaces liées à l’intelligence artificielle. L’entreprise a annoncé une nouvelle version de son programme de sécurité Daybreak, lancé quelques

11 août 2026

OpenAI révèle comment ses agents IA ont créé leur propre forum

En mai 2026, des agents IA d’OpenAI ont créé leur propre espace de communication pour échanger des informations sur des failles de sécurité et des

10 août 2026

MacSync : un faux guide Claude Code piège les utilisateurs de Mac

Une campagne de malvertising détourne des pages publiques de claude.ai pour diffuser un malware capable de cibler les applications Ledger et Trezor. Le piège commence

10 août 2026