Des chèvres dans Age of Empires II pour démontrer l’absurdité des LLM ?

Suivez Intelligence-Artificielle

Un chercheur de Microsoft illustre l’absurdité des LLM. Il a transformé des chèvres virtuelles d’Age of Empires II en composants d’un modèle de langage artificiel.

Adrian de Wynter, chercheur chez Microsoft, a publié un article intitulé « Si les LLM ont des attributs humains, alors Age of Empires II aussi ». Son objectif consiste à démontrer que les méthodes actuelles pour évaluer la conscience des grands modèles de langage sont biaisées. Pour y parvenir, il a utilisé les chèvres du jeu de stratégie comme support de démonstration.

Des chèvres numériques transformées en portes logiques

Dans Age of Empires II, les chèvres sont normalement de simples ressources alimentaires. Pourtant, selon l’article de De Wynter, il est possible de les transformer en composants de calcul. Le chercheur les a configurées pour simuler des opérations logiques élémentaires avec l’éditeur de scénarios du jeu : NON-ET (NAND), NON-OU exclusif (XNOR) et ET (AND).

Youtube video

Ces opérations constituent les briques de base de tout système informatique. À partir de là, indique l’article, De Wynter a construit un perceptron (l’une des formes les plus simples d’intelligence artificielle ) fondé sur ces « chèvres-bits ». Ce dispositif constitue, en théorie, une preuve de concept pour un LLM complet basé sur ces animaux virtuels.

Comment un jeu vidéo de 1999 peut-il démontrer les limites des LLM ?

L’argument central de De Wynter repose sur un principe précis. Si les LLM possèdent des attributs humains, alors Age of Empires II en possède aussi. Pour cause,  n’importe quel système suffisamment puissant peut implémenter un LLM. Cela peut être un réseau de neurones hébergé chez OpenAI ou d’un groupe de chèvres virtuelles dans un jeu vidéo.

Or, selon l’article, la nature du substrat affecte la façon dont le LLM est perçu. En d’autres termes, si la même réponse de ChatGPT vous parvenait via des chèvres numériques dans AoE II, vous l’interpréterez probablement de manière différente même si le modèle sous-jacent était identique. Ce phénomène rejoint les questions soulevées par le benchmark Age of LLM, qui teste les capacités des IA dans des environnements de jeux vidéo.

Peut-on vraiment évaluer la conscience d’un LLM ?

Non, affirme De Wynter, en tout cas pas avec les méthodes actuelles. Selon l’article, il n’existe à ce jour aucun protocole expérimental fiable pour mesurer la conscience des LLM. Toute expérience part d’une hypothèse indique le chercheur. Il précise cependant que supposer l’existence ou la non-existence d’attributs anthropomorphes afin de tester une hypothèse prouvant ou réfutant leur existence est biaisé. Autrement dit, les chercheurs qui cherchent à prouver que les LLM sont conscients partent tous d’un biais de départ. Les deux positions sont donc aussi fragiles sur le plan méthodologique.

Ce que révèle cette expérience sur nos attentes vis-à-vis de l’IA

Cette démonstration soulève une question plus large pour le secteur. Selon l’article,  une grande partie des attributs anthropomorphes attribués aux LLM dépendent des attentes de l’observateur. Le substrat compte autant que le modèle lui-même dans la perception de l’IA. 

Ce constat s’applique à l’ensemble des acteurs du domaine, y compris ceux qui développent l’IA générative de Microsoft. Il rejoint par ailleurs les travaux sur l’optimisation des LLM, qui montrent que le contexte de déploiement influence fortement les performances perçues d’un modèle. L’expérience de De Wynter est moins une attaque contre les LLM qu’un avertissement méthodologique. Avant d’attribuer des qualités humaines à une IA, encore faut-il disposer d’outils d’évaluation rigoureux. Pour l’instant, ces outils n’existent pas, indique l’article.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

« L’AGI est arrivée », la déclaration du patron de Nvidia qui fait débat et dont la communauté scientifique n’est pas d’accord

À la suite du lancement très remarqué du modèle GPT-6 Astra par OpenAI, le PDG de Nvidia, Jensen Huang, a officiellement proclamé que l’intelligence artificielle

8 septembre 2026

Open Spoken AI revendique une écriture intelligente libérée des filtres de discours

Open Spoken AI se présente comme un générateur de texte non censuré destiné aux marketeurs et aux auteurs. La plateforme revendique une liberté éditoriale que

7 septembre 2026

ElevenLabs : La référence du text-to-speech et du clonage vocal IA

Découvrez ElevenLabs, la référence mondiale du Text-to-Speech et du clonage vocal. Notre analyse décortique ses fonctionnalités, ses tarifs 2026 et ses performances concrètes. Le marché

4 septembre 2026

Avis Rytr.me : l’assistant IA de rédaction est-t-il pertinent en 2026 ?

Avis Rytr.me : l’assistant IA de rédaction est-t-il pertinent en 2026 ?

La plateforme Rytr.me aide plus de 8 millions de créateurs à accélérer leur rédaction web au quotidien. Cet assistant IA puissant génère vos contenus courts,

29 août 2026

Test de Descript : avis complet de l’outil IA hybride de sous-titrage et montage

Connaître les limites et les atouts d’une solution avant de s’engager est essentiel pour optimiser sa production vidéo. Si Submagic est le maître incontesté pour

28 août 2026

La nouvelle IA de Google supprime vos ‘euh’ et ‘hum’ dans les transcriptions

Google révolutionne la transcription audio avec une intelligence artificielle capable d’éliminer les hésitations vocales courantes. Cette avancée transforme l’expérience utilisateur en produisant des textes plus

27 août 2026