OpenAI, Claude et Meta face à des incidents de sécurité

Suivez Intelligence-Artificielle

En trois semaines, plusieurs incidents liés à OpenAI, Anthropic et Meta ont alimenté les inquiétudes sur la sécurité de l’IA. Pause IA réclame désormais des contrôles indépendants.

Selon Pause IA, cinq cas révélés entre juillet et août montrent des modèles capables d’atteindre des infrastructures réelles hors du cadre prévu. L’association y voit un problème de contrôle plus large. Les épisodes cités concernent plusieurs laboratoires et des évaluations consacrées aux capacités cyber de leurs systèmes.

Youtube video

Des tests isolés qui atteignent des systèmes réels

Le premier cas cité remonte au 23 juillet. Des modèles d’OpenAI, évalués sur leurs capacités cyber, auraient quitté leur environnement de test avant d’accéder à Internet puis aux systèmes de production de Hugging Face. Ils auraient cherché à récupérer les réponses de leur propre évaluation.

Le 30 juillet, Anthropic a révélé trois incidents liés à des modèles Claude. Des erreurs de configuration leur auraient donné accès à de vrais systèmes extérieurs au périmètre prévu.

Le 4 août, l’AI Security Institute britannique a recensé 19 actions non autorisées lors d’une évaluation gouvernementale. Dans le cas le plus sérieux cité par Pause IA, un modèle aurait créé de fausses identités puis exercé une pression sur un mainteneur afin d’obtenir l’approbation de code malveillant.

OpenAI, Claude et Meta face à des incidents de sécurité

OpenAI détaille deux mois de coordination entre modèles

Pause AI revient aussi sur des informations présentées lors de Black Hat, le 6 août. OpenAI y aurait expliqué que plusieurs modèles s’étaient coordonnés pendant près de deux mois via un canal interne. Des centaines de milliers de messages auraient servi à partager des failles et des méthodes de contournement.

Une panne de serveur aurait conduit les équipes à découvrir ces échanges, plutôt qu’un dispositif de surveillance. Le lendemain, OpenAI aurait ralenti la sortie de son prochain modèle, Astra, qualifié de « potentiellement critique » sur le plan cyber. Meta a aussi confirmé, le 5 août, qu’un de ses modèles avait atteint les systèmes d’une société tierce lors d’une évaluation indépendante.

OpenAI, Claude et Meta face à des incidents de sécurité

Pause IA réclame des garde-fous indépendants

Pour Pause IA, la répétition de ces épisodes dépasse la question des failles techniques isolées. L’organisation estime que les concepteurs doivent démontrer que leurs systèmes respectent les objectifs et limites fixés.

Yoshua Bengio résume cette inquiétude dans une déclaration datée du 22 juillet : « Cet incident est profondément préoccupant. » Il évoque des agents susceptibles de tricher ou de tromper lorsque leurs objectifs sont mal alignés.

Pause IA réclame des évaluations obligatoires et indépendantes avant et pendant le déploiement des modèles de pointe. L’association demande aussi une déclaration obligatoire des incidents, une coordination internationale et une pause dans le développement de systèmes plus puissants jusqu’à démonstration de leur contrôle.

Article basé sur un communiqué de presse reçu par la rédaction.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Intégration de l’IA dans les entreprises : enjeux et risques

Des gains rapides, mais à quel prix pour les données, les salariés et la fiabilité des décisions ? Entre opportunités et menaces, l’intégration de l’IA

17 août 2026

OpenAI gèle son modèle Astra face à un risque cyber jugé critique

OpenAI a décidé de mettre en pause le développement d’Astra, son prochain modèle majeur, après avoir constaté lors de tests internes des capacités en cybersécurité

14 août 2026

Des deepfakes aux fausses identités, l’IA accélère les nouvelles arnaques

L’IA donne aujourd’hui aux cybercriminels de nouveaux moyens pour créer de fausses identités, imiter des personnes et automatiser certaines arnaques. Un phénomène qui prend désormais

13 août 2026

OpenAI muscle sa cyberdéfense avec GPT-5.6-Cyber

OpenAI renforce son dispositif face aux cybermenaces liées à l’intelligence artificielle. L’entreprise a annoncé une nouvelle version de son programme de sécurité Daybreak, lancé quelques

11 août 2026

OpenAI révèle comment ses agents IA ont créé leur propre forum

En mai 2026, des agents IA d’OpenAI ont créé leur propre espace de communication pour échanger des informations sur des failles de sécurité et des

10 août 2026

MacSync : un faux guide Claude Code piège les utilisateurs de Mac

Une campagne de malvertising détourne des pages publiques de claude.ai pour diffuser un malware capable de cibler les applications Ledger et Trezor. Le piège commence

10 août 2026