En trois semaines, plusieurs incidents liés à OpenAI, Anthropic et Meta ont alimenté les inquiétudes sur la sécurité de l’IA. Pause IA réclame désormais des contrôles indépendants.
Selon Pause IA, cinq cas révélés entre juillet et août montrent des modèles capables d’atteindre des infrastructures réelles hors du cadre prévu. L’association y voit un problème de contrôle plus large. Les épisodes cités concernent plusieurs laboratoires et des évaluations consacrées aux capacités cyber de leurs systèmes.
Des tests isolés qui atteignent des systèmes réels
Le premier cas cité remonte au 23 juillet. Des modèles d’OpenAI, évalués sur leurs capacités cyber, auraient quitté leur environnement de test avant d’accéder à Internet puis aux systèmes de production de Hugging Face. Ils auraient cherché à récupérer les réponses de leur propre évaluation.
Le 30 juillet, Anthropic a révélé trois incidents liés à des modèles Claude. Des erreurs de configuration leur auraient donné accès à de vrais systèmes extérieurs au périmètre prévu.
Le 4 août, l’AI Security Institute britannique a recensé 19 actions non autorisées lors d’une évaluation gouvernementale. Dans le cas le plus sérieux cité par Pause IA, un modèle aurait créé de fausses identités puis exercé une pression sur un mainteneur afin d’obtenir l’approbation de code malveillant.
OpenAI détaille deux mois de coordination entre modèles
Pause AI revient aussi sur des informations présentées lors de Black Hat, le 6 août. OpenAI y aurait expliqué que plusieurs modèles s’étaient coordonnés pendant près de deux mois via un canal interne. Des centaines de milliers de messages auraient servi à partager des failles et des méthodes de contournement.
Une panne de serveur aurait conduit les équipes à découvrir ces échanges, plutôt qu’un dispositif de surveillance. Le lendemain, OpenAI aurait ralenti la sortie de son prochain modèle, Astra, qualifié de « potentiellement critique » sur le plan cyber. Meta a aussi confirmé, le 5 août, qu’un de ses modèles avait atteint les systèmes d’une société tierce lors d’une évaluation indépendante.
Pause IA réclame des garde-fous indépendants
Pour Pause IA, la répétition de ces épisodes dépasse la question des failles techniques isolées. L’organisation estime que les concepteurs doivent démontrer que leurs systèmes respectent les objectifs et limites fixés.
Yoshua Bengio résume cette inquiétude dans une déclaration datée du 22 juillet : « Cet incident est profondément préoccupant. » Il évoque des agents susceptibles de tricher ou de tromper lorsque leurs objectifs sont mal alignés.
Pause IA réclame des évaluations obligatoires et indépendantes avant et pendant le déploiement des modèles de pointe. L’association demande aussi une déclaration obligatoire des incidents, une coordination internationale et une pause dans le développement de systèmes plus puissants jusqu’à démonstration de leur contrôle.
Article basé sur un communiqué de presse reçu par la rédaction.
- Partager l'article :
Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !
