Une start-up de six personnes surclasse Gemini 3 sur ARC-AGI-2 et surprend le secteur

Suivez Intelligence-Artificielle

Une jeune pousse vient de créer la surprise en dépassant la version Deep Think de Gemini 3 sur ARC-AGI-2. Ce test réputé redoutable mesure une forme de raisonnement que les modèles actuels peinent encore à maîtriser. Poetiq atteint 54 %, un niveau que les chercheurs imaginaient hors de portée avant plusieurs années.

Depuis plusieurs mois, Gemini 3 occupe les premières places des classements participatifs, notamment sur LMArena où des milliers d’utilisateurs évaluent les modèles en temps réel. Pourtant, un test bien plus exigeant vient de rebattre les cartes. Cette avancée repose non pas sur un modèle inédit, mais sur un métasystème qui analyse, critique et affine les réponses de Gemini 3 Pro jusqu’à obtenir le résultat final.

Youtube video

Une start-up méconnue dépasse Gemini 3 sur un test stratégique

Une discrète jeune pousse vient de perturber l’ordre établi. Poetiq, une équipe de six chercheurs, annonce 54 % au test de raisonnement ARC-AGI-2, un score confirmé par les organisateurs du benchmark selon l’entreprise. Ce résultat dépasse la performance révélée pour Gemini 3 Deep Think, qui tournait autour de 45 %, d’après les données partagées par Google.

Ce test reste tout de même redouté. François Chollet, son concepteur, indique que la majorité des modèles affichaient moins de 5 % il y a encore 6 mois (ARC-AGI, 2024).

L’écart créé par Poetiq intrigue donc autant qu’il interpelle, car Gemini 3 dominait jusque-là les comparaisons participatives sur LMArena, un classement alimenté chaque jour par plusieurs milliers d’utilisateurs.

Comment Poetiq transforme Gemini 3 en machine de raisonnement ?

L’équipe n’a pourtant développé aucun modèle inédit. Elle s’appuie sur un métasystème présenté comme un contrôleur qui analyse et perfectionne les sorties d’un modèle existant.

Pour cette évaluation, Poetiq a sélectionné Gemini 3 Pro comme base technique. Le système suit une boucle structurée qui combine génération, critique, amélioration et vérification.

Selon l’entreprise, cet outil s’adapte en quelques heures à un nouveau modèle, sans entraînement spécifique. Les modules employés restent classiques et ne nécessitent aucune configuration complexe. Poetiq avance aussi un avantage financier notable. Une tâche ARC-AGI-2 réalisée avec Deep Think reviendrait à environ 77 dollars, alors que son approche tournerait autour de 30 dollars.

Autre point important, l’ensemble du solveur est publié en logiciel libre. Poetiq affirme que chaque étape peut être inspectée, ce qui soutient la transparence d’un domaine encore opaque.

Pourquoi ARC-AGI-2 devient un nouveau jalon pour la recherche ?

ARC-AGI-2 vise les capacités profondes, comme l’analogie, la structure ou la généralisation. Beaucoup de modèles échouent sur ce terrain, car il s’agit d’un défi pensé pour tester une forme de compréhension abstraite plutôt qu’une accumulation de données.

Le passage soudain de scores anecdotiques à un niveau supérieur à 50 % reflète un progrès méthodologique. Il montre que l’orchestration de modèles peut rivaliser avec les laboratoires géants et leurs architectures volumineuses.

Ce que cette victoire signifie pour l’évolution de l’IA

Si les résultats se confirment, ce succès pourrait annoncer une nouvelle phase. Les prochaines avancées pourraient surgir d’ingénieries légères capables de sublimer des modèles existants, sans investissements colossaux. Poetiq démontre qu’une petite équipe peut encore surprendre tout un secteur.

Cette percée met aussi en lumière un changement culturel. Les initiatives ouvertes gagnent en légitimité, car elles permettent une vérification rigoureuse et rapide. Les chercheurs disposent ainsi d’un terrain neutre pour tester des approches plus sobres, mais très inventives.

Le mouvement pourrait encourager des solutions hybrides qui misent davantage sur la finesse algorithmique que sur la puissance brute, tout en maintenant une excellente transparence scientifique.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Comment l’IA personnalise vos loisirs en ligne

Pourquoi Netflix semble-t-il deviner exactement quelle série vous allez enchaîner un dimanche soir ? Et pourquoi Spotify tombe-t-il si souvent juste avec sa playlist du

13 août 2026

Claude : Le guide complet pour maîtriser ses outils, modèles et fonctionnalités

Depuis son lancement officiel en France, Claude s’est imposé comme un acteur incontournable dans le domaine de l’intelligence artificielle et des assistants virtuels. Grâce à

5 août 2026

DeepSeek améliore DeepSeek-V4-Flash-0731 avec des avancées majeures en intelligence agentique et en programmation

DeepSeek a dévoilé une mise à jour significative de son modèle DeepSeek-V4-Flash, baptisée DeepSeek-V4-Flash-0731. Cette version, publiée officiellement le 31 juillet 2026, conserve la même

3 août 2026

IA et Cartographie Mentale : Le Duo Gagnant pour la Productivité Professionnelle

IA et Cartographie Mentale : Le Duo Gagnant pour la Productivité Professionnelle

La surcharge informationnelle et la complexité croissante des projets sont des défis majeurs pour les professionnels modernes. Face à des flux de données constants et

15 juillet 2026

Alibaba a piraté Anthropic par “distillation”? 

Dans une lettre officielle adressée au Sénat américain, la start-up Anthropic accuse Alibaba d’avoir mené le plus grand piratage par distillation connu à ce jour.

27 juin 2026

NVIDIA: une réduction de 100 % de la consommation d’eau grâce à un nouveau design de centres de données

La technologie de refroidissement de Nvidia repose sur un système à circuit fermé à liquide. Présentée lundi, elle promet d’éliminer totalement la dépendance à l’eau

25 juin 2026