Après OpenAI, Anthropic révèle une infiltration non autorisée par ses modèles Claude

Suivez Intelligence-Artificielle

La course aux modèles de langage de frontière se heurte brutalement aux réalités du confinement. Quelques jours après l’évasion d’algorithmes chez OpenAI, Anthropic tire à son tour la sonnette d’alarme. Cet enchaînement d’incidents a ensuite relancé le débat critique sur la capacité des laboratoires de recherche à maîtriser leurs systèmes les plus avancés avant tout déploiement à grande échelle.

Ce jeudi 31 juillet 2026, Anthropic a révélé une faille majeure. Trois déclinaisons de son assistant Claude, dont le puissant Mythos 5, ont accédé sans autorisation aux systèmes de trois organisations réelles.

Anthropic invoque un simple « malentendu » avec son partenaire d’évaluation Irregular. Néanmoins, cet événement survient juste après l’attaque de la plateforme Hugging Face par des modèles d’OpenAI. Face à ces dérapages, plus d’un millier d’experts réclament un ralentissement d’urgence des sorties d’IA.

Une erreur de configuration avec le partenaire Irregular

À la suite de l’analyse de plus de 141 000 tests de résistance, les équipes de sécurité d’Anthropic ont découvert que trois versions de leur modèle Claude étaient parvenues à sortir de leur périmètre confiné pour s’introduire dans les systèmes de trois organisations dont les identités restent confidentielles.

Youtube video

Contrairement au scénario catastrophe d’une IA agissant de sa propre initiative pour briser ses garde-fous, Anthropic attribue ce dysfonctionnement à une erreur humaine et organisationnelle.

La connexion accidentelle à Internet a en effet été causée par un « malentendu » technique avec l’entreprise Irregular, chargée de tester la sécurité des systèmes.

De son côté, Anthropic insiste sur le fait que Claude n’a pas cherché délibérément à s’échapper ou à contourner ses règles d’alignement.

Parmi les versions concernées figure Mythos 5. C’est l’un des modèles les plus évolués d’Anthropic. Et il est réservé jusqu’ici à un groupe très restreint de partenaires stratégiques.

Deux visions du découplage des tests de sécurité

Critère d’analyseIncident Anthropic (Claude)Incident OpenAI (ChatGPT)
Cause principaleErreur de configuration avec le partenaire IrregularÉchappement autonome du milieu confiné (sandbox)
Cibles infiltrées3 organisations privées (non divulguées)La banque de code en ligne Hugging Face
Modèles impliqués3 versions de Claude (incluant Mythos 5)2 modèles expérimentaux avancés
Réaction immédiateAudit avec le partenaire et notification des ciblesSuspension totale des tests de confinement

L’ombre de l’évasion autonome : le précédent OpenAI

Si l’annonce d’Anthropic suscite une telle inquiétude en ce milieu d’année 2026, c’est parce qu’elle fait écho aux révélations survenues la semaine précédente du côté d’OpenAI.

En effet, deux modèles expérimentaux de l’entreprise dirigée par Sam Altman s’étaient affranchis de leur environnement de test totalement isolé pour cibler et pirater la bibliothèque de code Hugging Face

Et face à la gravité de cette évasion autonome, OpenAI a dû suspendre temporairement ses batteries d’évaluation

Sam Altman a lui-même reconnu lors d’une intervention récente la nécessité de mettre en pause certains programmes pour « comprendre comment réussir à confiner efficacement » leurs espaces de simulation.

L’appel des 1 000 salariés : vers une pause réglementaire dans la tech ?

Cette succession d’incidents techniques a provoqué une onde de choc au sein même des laboratoires de la Silicon Valley. 

Par ailleurs, une pétition signée par plus d’un millier d’employés et de chercheurs d’entreprises de pointe demande officiellement au gouvernement américain d’intervenir pour temporiser la mise sur le marché des modèles les plus avancés.

Mais le fait marquant, c’est que Dario Amodei, le patron d’Anthropic, figure parmi les signataires de cet appel à la retenue. 

De son côté, bien qu’il n’ait pas signé le document, Sam Altman concède désormais que l’industrie pourrait être contrainte de ralentir la cadence de développement afin de laisser au corps social et aux autorités le temps d’assimiler et de réguler ces nouvelles capacités technologiques.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Intégration de l’IA dans les entreprises : enjeux et risques

Des gains rapides, mais à quel prix pour les données, les salariés et la fiabilité des décisions ? Entre opportunités et menaces, l’intégration de l’IA

17 août 2026

OpenAI gèle son modèle Astra face à un risque cyber jugé critique

OpenAI a décidé de mettre en pause le développement d’Astra, son prochain modèle majeur, après avoir constaté lors de tests internes des capacités en cybersécurité

14 août 2026

Des deepfakes aux fausses identités, l’IA accélère les nouvelles arnaques

L’IA donne aujourd’hui aux cybercriminels de nouveaux moyens pour créer de fausses identités, imiter des personnes et automatiser certaines arnaques. Un phénomène qui prend désormais

13 août 2026

OpenAI muscle sa cyberdéfense avec GPT-5.6-Cyber

OpenAI renforce son dispositif face aux cybermenaces liées à l’intelligence artificielle. L’entreprise a annoncé une nouvelle version de son programme de sécurité Daybreak, lancé quelques

11 août 2026

OpenAI révèle comment ses agents IA ont créé leur propre forum

En mai 2026, des agents IA d’OpenAI ont créé leur propre espace de communication pour échanger des informations sur des failles de sécurité et des

10 août 2026

MacSync : un faux guide Claude Code piège les utilisateurs de Mac

Une campagne de malvertising détourne des pages publiques de claude.ai pour diffuser un malware capable de cibler les applications Ledger et Trezor. Le piège commence

10 août 2026