La gamme Qwen 3.8 doit s’analyser à travers deux réalités distinctes. D’un côté, la ligne géante Qwen3.8-2.4T-A95B conçue pour l’inférence à grande échelle sur le cloud. De l’autre, Qwen3.8-27B, un modèle de 28 milliards de paramètres sous licence Apache 2.0 que les utilisateurs de LLM locaux peuvent réellement tester sur leur propre matériel. Si la version 2.4T incarne le sommet technologique de la famille, le modèle 27B constitue le point de départ le plus pragmatique pour les développeurs, les chercheurs et les petites structures.
Pour les ingénieurs et les équipes techniques, la possibilité d’exécuter un modèle multimodal performant en local sous licence permissive offre une alternative crédible aux API propriétaires fermées.
Cette flexibilité permet d’ailleurs de sécuriser la confidentialité des données métier tout en adaptant les architectures de déploiement aux contraintes budgétaires des infrastructures GPU.
Qu’est-ce que Qwen 3.8 ?
Qwen 3.8 représente la nouvelle étape clé de la famille de modèles ouverts d’Alibaba. Le modèle faisant en effet suit aux vagues Qwen 3.5 et Qwen 3.6. Sur la plateforme Hugging Face, les publications principales regroupent le modèle de base Qwen3.8-2.4T-A95B. C’est-à-dire sa variante quantifiée en FP8. Mais aussi le modèle Qwen3.8-27B accompagné de sa propre déclinaison FP8.
Le modèle Qwen3.8-2.4T-A95B constitue la base d’apprentissage de 2,4 trillions de paramètres (avec 95 milliards de paramètres actifs) sous-jacente à la gamme Max. Sa fiche technique décrit un modèle post-entraîné au format Hugging Face Transformers. Donc un modèle compatible avec les moteurs d’inférence modernes tels que vLLM, SGLang et TokenSpeed. La version commerciale officielle hébergée par Alibaba, baptisée Qwen3.8-Max, s’appuie sur cette ligne A95B et y ajoute la gestion de la vision, le support du mode non-thinking, une fenêtre de contexte par défaut de 1 million de tokens ainsi qu’une suite d’outils intégrés.
Le modèle Qwen3.8-27B répond à une toute autre logique. Sa fiche indique un modèle de 28 milliards de paramètres en BF16 distribué sous la licence très permissive Apache-2.0. Cette caractéristique en fait un candidat privilégié pour les tests locaux. En particulier pour les utilisateurs souhaitant comparer ses performances sur des GPU grand public de type NVIDIA RTX 4090, des stations de travail équipées de RTX 6000 Ada, des configurations Apple Silicon de classe Mac Studio ou des instances cloud sous location.
Modèles disponibles et liens de téléchargement
La gamme Qwen 3.8 se décline en plusieurs paquets adaptés à différents cas d’usage :
- Qwen3.8-2.4T-A95B : le modèle de fondation ultra-large de classe Max (format Safetensors / BF16, sous licence qwen3.8-max). Destiné à la recherche, à l’inférence cloud et aux tests de déploiement à très grande échelle.
- Qwen3.8-2.4T-A95B-FP8 : la version quantifiée en FP8 de la ligne 2.4T pour réduire l’empreinte mémoire (sous licence qwen3.8-max). Conçue pour les serveurs d’inférence distribuée utilisant vLLM, SGLang ou TokenSpeed.
- Qwen3.8-27B : le modèle local pratique de 28 milliards de paramètres (format Safetensors / BF16, sous licence Apache-2.0). Idéal pour les tests locaux, le RAG privé, l’assistance au codage et les flux de travail confidentiels.
- Qwen3.8-27B-FP8 : la déclinaison quantifiée en FP8 du modèle 27B (sous licence Apache-2.0). Pensée pour économiser la mémoire vidéo lors des phases de test et de mise en production.
- Distribution ModelScope : l’alternative officielle de distribution hébergée sur ModelScope, particulièrement adaptée aux utilisateurs et développeurs basés en Chine.
Pour la majorité des utilisateurs, la démarche la plus cohérente consiste à tester d’abord la version 27B. Le passage à la ligne 2.4T ne doit être envisagé que si vous disposez du budget d’infrastructure adéquat. La déclinaison 2.4T n’est pas un modèle pour ordinateur de bureau, mais un projet d’infrastructure lourd impliquant des coûts importants de stockage et de puissance de calcul.
We just shipped our official Qwen 3.8 27B Uncensored MLX build. Local. Uncensored. For🍎
— OrcaRouter 🐳 (@OrcaRouter) August 17, 2026
2-bit, 4-bit, 6-bit & 8-bit — pick your poison based on RAM and speed.
No CUDA. No cloud. Just your Mac and the weights. Have fun!https://t.co/b3gXsHeSdk
Benchmarks et retours de la communauté
Le positionnement officiel présente Qwen3.8-Max comme la génération la plus aboutie de la famille Qwen, affichant des progrès nets en raisonnement, programmation, gestion des longs contextes, workflows agentiques, utilisation d’outils et tâches multilingues.
L’attention de la communauté s’est rapidement focalisée sur le volume de téléchargements, la viabilité du modèle 27B pour un usage local, l’efficacité de la quantification FP8 et la prise en charge par les moteurs vLLM et SGLang. Si ces indicateurs sont encourageants, les performances réelles dépendent fortement de votre configuration technique : le choix entre BF16, FP8 ou une quantification communautaire en 4-bit, ainsi que la longueur du contexte et la taille des lots (batch size), modifient en profondeur l’expérience d’utilisation.
Avant d’adopter définitivement Qwen 3.8, il est recommandé de mener votre propre benchmark métier plutôt que de vous fier uniquement aux classements généraux. Évaluez le modèle sur un jeu de 20 à 30 prompts spécifiques couvrant vos besoins réels : correction de code, rédaction multilingue (notamment en japonais ou en chinois), résumé de documents longs, RAG sur vos données, questions-réponses sur des images et génération de structures JSON.
Comparatif avec les autres LLM locaux
Afin de situer Qwen 3.8 par rapport aux alternatives du marché local, voici comment il se positionne face aux principales familles concourantes :
- Facing Llama 4 : si l’écosystème Llama bénéficie d’une communauté très large en anglais, Qwen se montre particulièrement redoutable sur les langues asiatiques et les tâches de développement informatique intensives.
- Facing Gemma 3 : Gemma reste plus facile à exécuter sur du matériel modeste ou des ordinateurs portables. En revanche, Qwen 3.8 s’avère nettement plus orienté vers la performance brute et l’agentivité sur des configurations plus solides.
- Facing DeepSeek V4 : DeepSeek brille sur le raisonnement logique, le codage et les grands modèles MoE en cloud. Qwen propose quant à lui un chemin d’accès local très concret grâce à sa version 27B dense sous licence Apache 2.0.
- Facing Kimi et GLM : ces modèles rivalisent sur le traitement des très longs contextes et les usages en langue chinoise. Qwen conserve l’avantage d’une grande simplicité d’accès via Hugging Face et ModelScope.
Guide d’installation locale et exemples de code
Pour effectuer un premier essai en local, l’utilisation de la bibliothèque transformers est la méthode la plus directe. Veillez à mettre à jour vos paquets Python avec la commande suivante :
Bash
pip install -U transformers accelerate torch safetensors
Vous pouvez ensuite exécuter ce script minimaliste en Python pour charger le modèle Qwen3.8-27B et générer une première réponse :
Python
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Qwen/Qwen3.8-27B"
tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
trust_remote_code=True,
)
messages = [{"role": "user", "content": "Explain Qwen 3.8 in three practical points."}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok([text], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(tok.decode(out[0], skip_special_tokens=True))
Pour un déploiement en serveur de production compatible avec l’API OpenAI, le moteur vLLM constitue la solution la plus propre. Il est recommandé de démarrer avec une fenêtre de contexte prudente avant d’augmenter la taille maximale selon votre VRAM disponible :
Bash
pip install -U vllm
vllm serve Qwen/Qwen3.8-27B \
--trust-remote-code \
--dtype bfloat16 \
--max-model-len 32768
Prérequis matériels et estimations de mémoire VRAM
Les besoins en mémoire vidéo dépendent directement du niveau de précision, de la quantification, de la longueur du contexte et de l’activation des fonctionnalités visuelles :
- Qwen3.8-27B en BF16 (Pleine précision) : comptez environ 56 Go de VRAM plus le cache KV. Un GPU de 80 Go (type A100/H100) offre un confort idéal, tandis qu’une carte de 48 Go risque d’être à l’étroit sur les longs contextes.
- Qwen3.8-27B en 8-bit / FP8 : nécessite environ 28 à 36 Go de VRAM. Cette configuration est parfaitement adaptée aux GPU de 48 Go (RTX 6000, L40S) ou aux systèmes multi-GPU.
- Qwen3.8-27B quantifié en 4-bit (GGUF / AWQ) : exige entre 18 et 24 Go de VRAM. C’est le format idéal pour les cartes grand public de classe RTX 4090 (24 Go) sur des contextes courts à modérés.
- Qwen3.8-2.4T-A95B (BF16 et FP8) : mobilise plusieurs terabytes de mémoire globale. Il ne s’agit pas d’un modèle pour ordinateur individuel, mais d’une infrastructure d’inférence distribuée à l’échelle du cloud.
Utilisation en ligne lorsque votre GPU ne suffit pas
Si vos ressources matérielles locales sont insuffisantes pour exécuter le modèle 27B ou la version 2.4T, l’option la plus simple consiste à passer par les services officiels Qwen Chat ou la plateforme Qwen Cloud. Cela vous permet d’évaluer la qualité de rédaction, le comportement en programmation, la gestion du contexte et l’analyse d’images sans investir immédiatement dans du matériel coûteux.
Pour les entreprises et les équipes de développement, les API hébergées sur Alibaba Cloud ou Qwen Cloud permettent de déporter l’effort d’infrastructure. L’auto-hébergement local offre une confidentialité totale et un contrôle fin. Mais il vous rend responsable de la maintenance, de la surveillance, de la fiabilité et de l’optimisation des coûts GPU.
Politique de modération, contenu NSFW et débridage
Les services en ligne officiels d’Alibaba appliquent des règles de sécurité strictes et des conditions d’utilisation interdisant les contenus à caractère sexuel explicite, les instructions illégales et les activités dangereuses.
L’exécution locale de poids ouverts (open weights) vous donne un contrôle total sur l’environnement d’exécution, mais ne supprime pas l’alignement initial injecté lors de l’entraînement du modèle. L’intérêt principal d’exécuter Qwen en local réside dans la confidentialité des données, le RAG d’entreprise, la maîtrise des coûts d’API et la personnalisation des workflows, et non dans le simple contournement des filtres de modération.
La déclinaison non censurée : Qwen3.8-27B Abliterated
Les utilisateurs à la recherche d’une variante moins restreinte peuvent trouver sur Hugging Face le modèle communautaire Huihui-Qwen3.8-27B-abliterated. Il s’agit d’une version non officielle conçue par la communauté à partir du modèle Qwen3.8-27B d’origine.
En pratique, le terme abliterated signifie que les mécanismes de refus systématique (refusal behavior) ont été réduits ou neutralisés. Le modèle accepte ainsi de répondre à des requêtes que la version officielle ou le service web déclineraient. Cette déclinaison s’avère utile pour la recherche sur l’alignement de l’IA, le jeu de rôle créatif ou l’étude du comportement des modèles lorsque les brides de sécurité sont assouplies.
Toutefois, cette liberté implique une responsabilité accrue pour l’utilisateur : les réponses générées sont moins filtrées et peuvent plus facilement déraper vers des contenus pour adultes, risqués ou juridiquement sensibles. Avant tout déploiement, vérifiez attentivement la licence sur Hugging Face ainsi que les lois en vigueur. Pour la majorité des usages professionnels, le modèle officiel Qwen3.8-27B reste le choix le plus sûr.
Foire Aux Questions (FAQ)
Qwen 3.8 est-il gratuit ?
Les poids des modèles sont téléchargeables gratuitement sur Hugging Face et ModelScope. Le véritable coût réside dans le matériel GPU nécessaire. Le modèle 27B est réaliste en local, tandis que la version 2.4T relève du matériel cloud.
Qwen3.8-Max est-il identique à Qwen3.8-2.4T-A95B ?
Pas tout à fait. Qwen3.8-Max est la version officielle commerciale exploitée par Alibaba, basée sur le modèle 2.4T-A95B mais enrichie de fonctionnalités supplémentaires comme la vision, un contexte de 1M par défaut et des outils intégrés.
Qwen 3.8 gère-t-il le japonais ?
Oui, les modèles de la famille Qwen figurent parmi les plus performants pour le traitement multilingue combinant l’anglais, le japonais et le chinois.
Peut-on faire tourner Qwen 3.8 sur une RTX 4090 ?
Oui, la version Qwen3.8-27B quantifiée en 4-bit peut fonctionner sur une carte de 24 Go de VRAM de type RTX 4090 pour des contextes modérés. La version BF16 et la déclinaison 2.4T nécessitent un matériel bien plus imposant.
L’usage commercial est-il autorisé ?
Le modèle Qwen3.8-27B est publié sous licence Apache-2.0, très favorable à l’évaluation et l’usage commercial. En revanche, la ligne 2.4T-A95B utilise la licence spécifique qwen3.8-max qu’il convient de lire attentivement avant toute redistribution.
Faut-il choisir Qwen 3.8 en local ou Qwen Chat ?
Utilisez Qwen Chat pour évaluer rapidement la qualité du modèle sans contrainte. Optez pour Qwen 3.8 en local lorsque la confidentialité des données, le RAG privé, la maîtrise des volumes d’inférence ou la personnalisation justifient la gestion d’une infrastructure GPU.
Verdict final
La gamme Qwen 3.8 réussit son pari en couvrant les deux extrémités du marché de l’IA : un modèle géant de classe Max pour les infrastructures cloud et une version 27B accessible que les passionnés et professionnels peuvent réellement tester chez eux.
Pour la majorité des lecteurs, Qwen3.8-27B constitue le modèle de référence par lequel commencer. Il offre un aperçu fidèle des capacités de cette nouvelle génération sans exiger de cluster de serveurs, tout en se comparant très favorablement à Llama, Gemma, DeepSeek, Kimi et GLM sur des tâches concrètes. La ligne 2.4T-A95B reste impressionnante, mais doit être abordée avec des attentes réalistes quant aux coûts d’hébergement.
- Partager l'article :
Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

