Qwen3.8-Max pour le code : prix, benchmarks et configuration des outils
Évaluer Qwen3.8-Max pour le code : prix API, benchmarks, configuration de Qwen Code et Claude Code, et différence entre Model ID hébergé et poids ouverts.
La version stable de Qwen3.8-Max est sortie le 3 août 2026 avec le Model ID hébergé qwen3.8-max. Le 13 août, Qwen a également publié les poids Qwen3.8-2.4T-A95B. Ces noms correspondent à deux modes de déploiement : le premier va dans le champ de modèle d'un fournisseur API ; le second désigne un dépôt de poids pour une inférence auto-hébergée.
Vous voulez tester le modèle hébergé sans exploiter votre propre infrastructure GPU ? Le 13 août, le catalogue BetterToken indiquait qwen3.8-max à 5.52 par million de tokens de sortie. Créez votre propre API Key, lancez une requête courte, puis vérifiez le Model ID et l'usage dans Workspace. Il s'agit d'un relevé daté : consultez de nouveau le catalogue avant un usage en production.
Ce qui a changé après la preview
Le dépôt officiel de Qwen publie les poids et la configuration du modèle post-entraîné Qwen3.8-2.4T-A95B : 2,4 billions de paramètres au total, 95 milliards actifs, 262 144 tokens de contexte natif, extensibles jusqu'à 1 010 000. Le dépôt est compatible avec vLLM, SGLang et TokenSpeed.
Le modèle hébergé qwen3.8-max s'appuie sur ces ordres de grandeur, mais Qwen précise séparément ses entrées vision, son mode non-thinking, son ensemble d'outils officiel et un contexte par défaut d'un million de tokens. Ne remplacez donc pas qwen3.8-max par Qwen3.8-2.4T-A95B dans une configuration API et ne supposez pas que l'inférence locale est identique à l'API hébergée.
La preview apparaissait dans Token Plan et dans des configurations anciennes sous le nom qwen3.8-max-preview. Des restrictions de thinking y étaient documentées et ne font pas partie du contrat stable. La migration pratique consiste à remplacer le Model ID, vérifier le type de clé et l'endpoint, puis rejouer une requête minimale. Modifier seulement la chaîne du modèle sans vérifier la région peut conduire à 401, 404 ou à un modèle introuvable.
Peut-on exécuter les poids ouverts localement ?
Oui en théorie : le dépôt contient les poids et la configuration nécessaires à une inférence propre. En pratique, c'est un projet serveur, pas un modèle à charger sur le GPU d'un poste standard. Dans le MoE, 95 milliards de paramètres sont actifs à chaque étape, mais il faut stocker, distribuer et charger bien davantage de données ; s'ajoutent KV cache, précision, quantification et mémoire du moteur d'inférence.
Ne dimensionnez pas le matériel à partir du seul nombre de paramètres actifs. Choisissez d'abord le moteur, la précision, la longueur de contexte et la vitesse acceptable, consultez son guide matériel et établissez une estimation mémoire distincte. Pour un test de code ponctuel, l'API hébergée demande généralement moins de préparation. L'option locale convient lorsqu'une équipe peut réellement gérer sharding, mises à jour et monitoring.
Les poids relèvent d'une Qwen3.8-Max License distincte, et non d'Apache 2.0. Elle autorise l'utilisation et la modification, mais ajoute des conditions pour les grands produits commerciaux, Model as a Service et AI Work Assistant. Lisez la licence complète pour votre cas avant tout déploiement public ou commercial.
Combien coûte Qwen3.8-Max ?
Alibaba Model Studio publie ses tarifs par région. Calculez-les dans leur monnaie d'origine et ne présentez pas une conversion comme un tarif officiel.
- Beijing / Global : CNY 12 par million de tokens d'entrée et CNY 36 par million de tokens de sortie.
- Singapore : CNY 14.988 par million de tokens d'entrée et CNY 44.965 par million de tokens de sortie.
Pour 200 000 tokens d'entrée et 20 000 tokens de sortie, le calcul pour Beijing est :
0.2 × 12 + 0.02 × 36 = CNY 3.12.
Pour Singapore, le même volume représente CNY 3.8969. C'est un calcul pay-as-you-go de Model Studio. Token Plan, abonnement et passerelle tierce ont une unité de facturation différente et ne doivent pas figurer dans la même ligne de comparaison.
Avec la carte BetterToken, ce même profil coûtait, dans le relevé daté :
0.2 × $1.84 + 0.02 × $5.52 = $0.4784.
Les montants finaux ne sont pas directement comparables : une table est en CNY, l'autre en USD, et les règles de cache comme les conditions d'accès diffèrent. La méthode utile est de choisir d'abord un fournisseur et une région précis, puis de calculer le même profil de tokens pour chacun. Prix, disponibilité du modèle et groupes de clés sont des faits dynamiques à vérifier avant utilisation.
Lire correctement la table de benchmarks officielle
Le lancement de Qwen publie les résultats de code suivants :
- Terminal-Bench 2.1 : 86.6.
- SWE-bench Pro : 67.7.
- DeepSWE 1.1 : 56.6.
- FrontierSWE : 73.5.
- PaperBench : 93.0.
- QwenSWEBench : 80.7.
Ce sont des données rapportées par le fournisseur. Pour Terminal-Bench 2.1, Qwen indique Claude Code, avg@10, un timeout de cinq heures et max_tokens=131072. Pour SWE-bench Pro, la note indique Claude Code, temperature=1.0, top_p=0.95 et 256K de contexte ; elle ne donne pas de timeout distinct. Plusieurs lignes de concurrents utilisent leur meilleur résultat publié. Une partie des jeux appartient à Qwen et n'a pas de reproduction externe.
On ne peut pas en déduire un classement unique. Un 93.0 sur PaperBench ne signifie pas que le modèle résout automatiquement mieux un issue dans votre dépôt réel. Regardez d'abord la capacité mesurée par le test, puis le harness, l'effort, le nombre de tentatives et la méthode de notation.
Ce qu'a montré un test indépendant
Trilogy AI a comparé Qwen preview et Kimi K3 sur une même tâche d'analyse architecturale : dépôt figé de 269 fichiers, même limite de temps et même type de résultat. Le score StackPerf est de 80 contre 83 en faveur de Kimi. Qwen a effectué 44 tool calls sans erreur, Kimi 53 avec deux erreurs récupérées.
C'est une photographie de processus utile, mais un seul lancement d'une seule tâche. Elle montre qu'un écart de score faible peut s'accompagner d'un comportement d'outils différent. Elle ne prouve pas qu'un modèle est supérieur dans tous les scénarios de code.
Dans quels cas tester Qwen3.8-Max
Ajoutez le modèle à un essai lorsque la tâche demande :
- parcourir beaucoup de fichiers pour reconstituer une architecture ;
- exécuter un plan en plusieurs étapes avec des outils ;
- traiter texte, images ou documents dans un même contexte ;
- préparer un diff et vérifier plusieurs conditions de préparation ;
- conserver longtemps règles métier et code dans le contexte.
Pour de petites modifications, comparez un reasoning faible et plus élevé. Si le gain de qualité ne compense ni la latence ni les tokens de sortie, le mode lourd ne doit pas devenir la valeur par défaut.
Configurer Qwen Code
Dans la console Model Studio, choisissez d'abord une région, ouvrez la page API-KEY et créez une clé pay-as-you-go normale pour cette région. Une clé Token Plan se crée dans une section séparée et n'est pas interchangeable avec un endpoint pay-as-you-go. Copiez la nouvelle clé juste après sa création et placez-la dans une variable d'environnement :
Qwen Code prend en charge modelProviders et un provider OpenAI-compatible. Pour la configuration de tous les projets, ouvrez ~/.qwen/settings.json ; pour un seul dépôt, utilisez .qwen/settings.json à sa racine. Dans le JSON, indiquez le nom de la variable, jamais la clé elle-même :
L'endpoint ci-dessus est l'exemple officiel de la région US. Pour Beijing, Singapore, Tokyo ou Frankfurt, reprenez l'adresse de la table Model Studio et utilisez la clé de cette même région. Le fichier du projet recouvre le fichier utilisateur ; si le modèle choisi est inattendu, vérifiez les deux niveaux.
La documentation Qwen Code décrit la configuration de provider comme atomique : les generationConfig imbriqués et les autres champs sont remplacés entièrement, sans fusion clé par clé. Sauvegardez les entrées de provider existantes et vérifiez le diff avant toute modification afin de ne pas effacer la configuration fonctionnelle d'un autre modèle.
Enregistrez le fichier, redémarrez Qwen Code, sélectionnez qwen3.8-max, faites une requête de lecture sur un fichier et vérifiez le nom du modèle dans la réponse ou les métadonnées. N'autorisez les modifications qu'après cette vérification.
Configurer Claude Code
Model Studio fournit un endpoint Anthropic-compatible. Pour la région US, l'exemple minimal est :
Pour une autre région, remplacez la Base URL par l'adresse régionale officielle et utilisez la clé correspondante. Après redémarrage, donnez une tâche courte qui ne modifie pas de fichier et vérifiez le Model ID réellement utilisé. Ne mélangez pas une clé Token Plan et un endpoint pay-as-you-go.
Anthropic-compatible signifie compatibilité de protocole. Qwen ne devient pas pour autant un modèle Anthropic et son comportement n'est pas forcément identique dans Claude Code. Vérifiez tool call, écriture de fichier, récupération après erreur et usage dans le client concerné.
Bien classer les erreurs déjà documentées
L'issue Qwen Code #7332 concerne la preview : une requête interne envoyait enable_thinking=false à un modèle qui n'acceptait alors que thinking et recevait 400. C'est un signal utile pour la migration, mais il ne décrit pas l'API stable actuelle.
Dans l'issue Qwen3 #1883, un utilisateur de l'endpoint Anthropic-compatible signalait que l'agent essayait d'écrire un chemin relatif directement dans /tmp ; un chemin absolu servait de contournement. Dans l'issue Qwen Code #7489, VS Code Companion insérait un lien vers le nom d'une image sans transférer l'image. Les deux cas dépendent de la version du client et du harness.
Pour analyser ce type de problème, séparez quatre couches :
- L'API accepte le Model ID et la clé.
- Le client transmet correctement thinking et tools.
- Le harness résout correctement chemin et pièce jointe.
- Le modèle suit l'instruction.
Tout qualifier immédiatement d'« erreur de modèle » rend la correction de configuration plus difficile.
Tester le modèle sur votre propre tâche
Prenez trois dépôts ou trois issues de types différents. Figez le commit, les tools, la limite de temps et les critères PASS. Pour chaque lancement, gardez :
- le mode reasoning ;
- les tokens d'entrée et de sortie ;
- le temps jusqu'à la première modification utile ;
- le nombre de tool calls et d'erreurs ;
- le résultat des tests ;
- le nombre de corrections manuelles.
Ce test est plus utile qu'un leaderboard général. Il mesure non seulement la capacité à écrire du code, mais aussi le prix d'une tâche terminée : c'est ce que paie réellement l'équipe.
Sources
- Annonce officielle de Qwen3.8-Max
- Poids ouverts Qwen3.8-2.4T-A95B
- Qwen3.8-Max License
- Modèles et endpoints régionaux de Model Studio
- Prix officiels de Model Studio
- Model Studio : créer une API Key
- Qwen Code : emplacement de settings.json
- Qwen Code : model providers
- Issue #7332 : preview et enable_thinking
- Issue #1883 : chemins relatifs
- Issue #7489 : image dans VS Code Companion
- Lancement StackPerf indépendant