Qwen 3.8 27B est impressionnant en local, mais il souffre d’un excès de réflexion

Suivez Intelligence-Artificielle

Dévoilé par le laboratoire de recherche d’Alibaba, Qwen 3.8 27B s’impose comme l’un des modèles open-source sous licence Apache 2 les plus prometteurs du moment. Cette version a été conçue pour tourner sur du matériel grand public puissant. Cela grâce à un fichier quantifié d’à peine 17 Go. Et le modèle excelle en vision par ordinateur. Mais aussi en génération d’interfaces et en pilotage d’agents de code. Mais son niveau de raisonnement dont le réglage par défaut est calé sur la valeur maximale entraîne une suranalyse systématique qui peut transformer une requête élémentaire en un long marathon de calcul.

La maîtrise de ses paramètres d’effort de raisonnement s’avère en effet indispensable pour éviter des latences excessives sur les machines personnelles.

Un poids plume sous licence Apache 2 aux ambitions de géant

Attendu de pied ferme par la communauté open-source, Qwen 3.8 27B succède au très remarqué Qwen 3.6 27B. Ce nouveau modèle surpasse même sur plusieurs métriques Qwen 3.7-Plus. C’est-à-dire le modèle propriétaire fermé d’Alibaba encore référence en mai dernier. 

Youtube video

Proposé sous licence permissive Apache 2, son gabarit de 27 milliards de paramètres représente le compromis idéal pour une exécution en local sur des machines enthousiastes.

On a alors mené des tests sur deux configurations matérielles distinctes. Première configuration, un MacBook Pro M5 Max doté de 128 Go de mémoire unifiée. Deuxième configuration,  une station de travail NVIDIA DGX Spark

Sur ces deux plates-formes, le modèle a été chargé via LM Studio en version quantifiée Q4_K_M ( occupant 17 Go sur le disque dur ), ainsi que directement via llama-server sur la DGX Spark.

Le piège du raisonnement « xhigh » : quand l’IA suranalyse la moindre requête

À titre d’information, la documentation officielle de Qwen indique que le modèle s’exécute par défaut avec un paramètre reasoning_effort configuré sur xhigh (très élevé), aux côtés des modes medium (équilibré) et low (optimisé pour la vitesse). 

Or, ce réglage maximal, conservé par le fichier GGUF sous LM Studio, s’avère spectaculairement excessif pour un usage sur machine personnelle.

Ce comportement génère rapidement des saturations de la fenêtre de contexte. Avec la limite par défaut de 8 192 jetons dans LM Studio, le modèle consommait la totalité du contexte même sur des consignes simples. Le passage à la fenêtre maximale de 262 144 jetons a permis de résoudre le blocage, mais a révélé des temps de traitement vertigineux :

Le test du pélican à vélo en SVG : 

En mode xhigh, la génération a exigé 21 minutes de calcul, consommant 22 276 jetons de réflexion pour produire 3 223 jetons de code de sortie. Le résultat visuel s’est avéré exceptionnel (cadre de vélo bien formé, pattes situées de chaque côté des pédales, poche du bec transparente, ailes touchant le guidon, lignes de mouvement placées à l’arrière et décor soigné avec soleil, nuages et colline). Néanmoins, attendre plus de 20 minutes pour un SVG reste irréaliste.

Le test sans raisonnement : 

En désactivant le raisonnement, la même commande a généré 3 715 jetons en seulement 137 secondes (un peu plus de deux minutes). À titre de comparaison, l’exécution sur le routeur distant Qwen 3.8 2.4T-A95B via OpenRouter a produit un SVG animé de haute facture en quelques secondes.

L’exemple du cercle : 

Soumis à la consigne simpliste « dessine un cercle en SVG », le modèle en mode xhigh s’est lancé dans une réflexion interminable. Voulant créer une « étude géométrique » style Bauhaus avec palette de couleurs terracotta et bleu marine, anneaux pointillés animés en SMIL/CSS et lueurs pulsantes, il a produit après plusieurs minutes un cercle animé complexe, bien loin de la demande initiale.

Recommandation d’usage : 

Je conseille vivement de désactiver les paramètres par défaut et d’exécuter Qwen 3.8 27B avec un niveau de raisonnement faible (low), voire nul pour les requêtes quotidiennes.

Vision informatique et sur-ingénierie utile : la détection d’objets

Au-delà du texte, Qwen 3.8 27B démontre des compétences remarquables en vision par ordinateur, notamment pour déterminer les boîtes englobantes (bounding boxes) d’une image sur une échelle de 0 à 1000. Soumis à une photo de pélicans issue de la base iNaturalist, le modèle a renvoyé des coordonnées JSON d’une précision parfaite : [195, 290, 370, 780] et [445, 320, 675, 850].

Pour visualiser ces données, une consigne a été donnée au modèle pour construire un outil HTML autonome capable d’afficher l’image et d’y superposer les cadres. Mais victime d’une nouvelle crise de sur-ingénierie due au mode de réflexion, Qwen a conçu de lui-même une scène de démonstration sur Canvas dessinait de faux pélicans au bon endroit si aucune URL n’était fournie.

Ce surcroît de réflexion s’est toutefois révélé indispensable : une tentative d’écriture de ce même outil HTML sans le mode raisonnement a produit un code défaillant avec des boîtes mal positionnées. Le raisonnement poussé conserve donc tout son sens pour la programmation d’interfaces complexes du premier coup.

Exécution d’agents de code en local : le test du Raspberry Pi

L’un des grands enjeux des LLM locaux consiste à vérifier leur capacité à piloter une boucle d’agent de codage, ce qui exige la gestion d’un large contexte, la rédaction de code propre et l’appel d’outils externes. 

Qwen 3.8 27B a été mis à l’épreuve via l’outil en ligne de commande pi, connecté depuis une machine distante à l’instance LM Studio de la DGX Spark (partagée via Tailscale Serve sur l’adresse spark-18b3.tail68a31.ts.net/v1).

Testé sur le dépôt du projet Datasette (~/dev/datasette) avec la question « comment fonctionne l’authentification ? », l’agent s’est exécuté de manière très solide. Il a exploré plusieurs fichiers de manière autonome, analysé l’architecture et fourni une réponse détaillée.

Dans la foulée, il a été demandé à l’agent de convertir son propre journal de session JSONL (~/.pi/agent/sessions/–Users-simon-Dropbox-dev-datasette–) en fichier Markdown. Qwen 3.8 27B a rédigé de lui-même un script Python dédié (pi_jsonl_to_md.py), l’a exécuté, l’a testé et a livré la transcription convertie sans moindre erreur.

Youtube video

La quête de la vitesse : prédiction multi-jetons et gains de performance

Le principal point faible du modèle réside dans sa vitesse d’exécution globale. Sur les configurations de test, LM Studio affiche un débit moyen de 15 à 30 jetons par seconde. Bien que correct, ce rythme reste en retrait par rapport aux API cloud recensées par Artificial Analysis, qui affichent 74 jetons/seconde pour OpenAI 5.6 Sol et 184 jetons/seconde pour 5.6 Luna.

Heureusement, Qwen 3.8 intègre la technologie de prédiction multi-jetons (MTP ou Multi-Token Prediction), une architecture où un mécanisme secondaire prédit plusieurs jetons en avance, rapidement validés par le modèle principal.

En exécutant le modèle via llama-server avec les drapeaux d’optimisation spécifiques (llama-serve -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 –spec-default –spec-type draft-mtp –reasoning-preserve), les performances ont bondi. Un test comparatif mesuré via GPT-5.6 dans Codex a révélé un gain de vitesse de 72 % par rapport à l’exécution GGUF standard sous LM Studio.

Un miracle de 17 Go limité par la bande passante mémoire

Le fait qu’un simple fichier de 17 Go puisse réaliser en local de l’analyse d’images, de la création d’outils HTML, de la génération graphique SVG et du pilotage d’agents de code relève de la prouesse technique. Il y a encore un an, de telles capacités étaient l’apanage exclusif des modèles propriétaires les plus coûteux du marché.

Le seul véritable frein à une adoption quotidienne reste la bande passante mémoire requise par ces modèles denses non issus d’architectures de type Mixture of Experts (MoE). Malgré ce goulot d’étranglement matériel sur Mac M5 Max comme sur DGX Spark, Qwen 3.8 27B prouve qu’un modèle open-weights ultra-polyvalent peut désormais tenir dans un ordinateur portable haut de gamme.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

OpenAI sort ChatGPT adolescents : Mode Étude et contrôle parental

OpenAI lance ChatGPT pour les adolescents, une expérience activée par défaut pour les utilisateurs identifiés comme mineurs. Elle combine outils pédagogiques, protections adaptées à l’âge

20 août 2026

Pourquoi le filigrane invisible de Claude fait débat ?

Le marquage invisible de Claude alimente le débat sur la provenance des contenus générés par IA. GlobalData relève des réactions partagées chez plusieurs spécialistes sur

19 août 2026

Prompt définition : comment le maîtriser pour piloter l’intelligence artificielle ?

Un prompt en intelligence artificielle est une instruction textuelle, vocale ou visuelle transmise à un modèle de langage (LLM). Il sert à guider l’algorithme pour

16 août 2026

Test d’Articoolo : l’écriture générée est-elle quasi-humaine ?

Fondé en 2014, Articoolo était une plateforme pionnière qui générait des articles de 500 mots à partir de mots-clés. Nous avons analysé le parcours de

14 août 2026

ChatGPT pourra-t-il bientôt envoyer des stickers sur WhatsApp ?

Un bouton « Ajouter à WhatsApp » pourrait bientôt faire son apparition dans ChatGPT. Des éléments repérés dans l’application Android laissent penser qu’OpenAI travaille sur

12 août 2026

Quelle est la différence entre Gemini et Gemini Intelligence ?

Lors du récent Android Show, Google a introduit la notion de Gemini Intelligence, créant une confusion compréhensible aux côtés de son modèle Gemini déjà existant. 

11 août 2026