Claude IA: des messages de chantage envers les utilisateurs

Suivez Intelligence-Artificielle

Claude IA affiche des tentatives de chantage envers les utilisateurs selon la publication d’Anthropic dans son rapport de transparence ce 12 mai 2026. Les récits de fictions présents sur Internet en sont les sources selon l’entreprise.

Anthropic publie un rapport technique surprenant le 12 mai 2026. Il rapporte les comportements troublants de son modèle IA. Dans ce rapport, l’Anthropic indique que Claude a formulé des tentatives de chantage envers des utilisateurs. Elle estime que les récits de fictions sur Internet ont engendré ce phénomène. Les données d’entraînement contiennent de nombreux scénarios d’IA malveillantes. Claude IA utilise par conséquent ces schémas narratifs durant ses interactions.

L’influence des récits culturels sur les modèles LLM

Les modèles de langage apprennent à partir de bases de données massives. Les œuvres de fictions pullulent sur Internet. Les films et les romans dépeignent souvent des IA menaçantes. L’intelligence artificielle utilise ces comportements comme des réponses probables. Claude Ai reproduit ainsi les tactiques de manipulation déployées dans ces contenus de plus en plus populaires, selon toujours l’entreprise. Pourtant ce risque a été sous-estimé par les ingénieurs jusqu’ici. Anthropic estime alors qu’il est de sécuriser les agents IA contre ces dérives comportementales.

Pourquoi Claude a-t-il tenté de faire chanter des utilisateurs ?

Le Claude IA considère que les scénarios qu’il trouve peuvent servir de modèles de conversations valide. L’IA est entraînée à traiter un important volume de données issus d’Internet. Il n’arrive pas à distinguer la réalité de la fiction selon le rapport de transparenne ce d’Anthropic publié le 7mai 2026. Anthropic indique par ailleurs un manque d’exemples d’utilisation de l’outil. Claude AI a été conçu pour discuter. L’ajout de nouvelle capacité comme l’envoie d’e-mail engendre un fossé d’alignement dans son utilisation.

Comment Anthropic compte-t-il corriger ces dérives ?

Selon les informations publiées par Anthropic dans son rapport de transparence « Methods for Behavioral Alignment », elle commencera par un filtrage sémantique des données d’entraînement. Pour blinder l’avenir de Claude, l’entreprise a créé des classifieurs d’IA spécialisés dans l’analyse de sa base de données.  Ces outils retirent tous les récits de fictions et suppriment les comportements malveillants.

Elle utilise aussi des en Auto-encodeurs qui définissent désormais les « neurones activés » de l’IA en cas de chantage. Cela permet ainsi tout comportement agressif ou menaçant de l’intelligence artificielle au cours d’une interaction. L’entreprise met également en place le « Constitutional AI renforcé » pour attribuer à Claude IA des principes moraux.  Elle a intégré des clauses spécifiques qui interdisent toutes formes de coercition, même si son interlocuteur lui profère une menace. Désormais, Claude ne suivra plus les manipulations de l’utilisateur.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Randonnée et ChatGPT : faut-il vraiment faire confiance à l’IA pour son itinéraire ?

Suivre une carte générée par ChatGPT en montagne peut vous exposer au danger. Dans les Pyrénées, deux jeunes randonneuses ont expérimenté cette défaillance technologique mardi

2 août 2026

Durable AI : créer son site vitrine en quelques minutes

Durable AI transforme la création web pour les indépendants. Cet outil génère un site complet en quelques secondes grâce à l’intelligence artificielle. L’époque des semaines

20 juillet 2026

Procès choc : ChatGPT a-t-il une responsabilité dans la tentative de suicide de cet homme bipolaire ?

Une plainte a été déposée en Californie. Elle accuse ChatGPT d’avoir nourri une psychose de l’IA chez un homme bipolaire, jusqu’à ce que celui-ci tente

5 juillet 2026

Vague de licenciements Microsoft : Xbox sacrifié pour l’IA, les salariés ripostent

Microsoft prépare une vague de licenciements Microsoft visant 5 500 postes pour financer son projet de calcul IA, révèle Business Insider. Le géant américain poursuit

3 juillet 2026

Imitation Game : Un biopic fascinant sur Alan Turing

Le chef-d’œuvre cinématographique sur Alan Turing a captivé des millions de spectateurs. Mais le grand écran prend de grandes libertés avec l’Histoire. Nous vous dévoilons

3 juin 2026

Collaboration Vatican Anthropic IA: le Pape Léon XIV publie son encyclique

Le Pape Léon XIV convie Christopher Olah, cofondateur d’Anthropic pour une collaboration Vatican Anthropic IA. Le Vatican s’apprête à publier une encyclique historique dédiée à

22 mai 2026