Qwen 3.8 27B fait tourner l’IA sur un portable
#qwen #chatgpt #llama 3 min · 24 août 2026

Qwen 3.8 27B fait tourner l’IA sur un portable

Par Arthur Dekeyser

En résumé

1

Qwen 3.8 27B fonctionne sur un ordinateur portable correctement équipé.

2

Son réglage xhigh consomme beaucoup de tokens sur des demandes simples.

3

Le mode MTP a amélioré la vitesse d’inférence d’environ 72 %.

💡

Le signal : Qwen 3.8 27B produit un SVG en 21 minutes avec 22 276 tokens de raisonnement.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Alibaba lance Qwen Le laboratoire de recherche Qwen a publié Qwen 3.8 27B le 14 août 2026. Ce modèle de langage multimodal compte 27 milliards de paramètres. Sa licence Apache 2 autorise son utilisation dans des projets compatibles. Simon Willison l’a testé sur un MacBook Pro M5 Max doté de 128 Go de mémoire et sur un NVIDIA DGX Spark. Il utilisait LM Studio avec une version quantifiée Q4_K_M de 17 Go. Selon ses essais, cette taille permet d’exécuter le modèle sur un ordinateur portable correctement équipé. Qwen présente aussi des résultats supérieurs à ceux de Qwen 3.6 27B et de Qwen 3.7-Plus dans ses propres évaluations. Lire le test complet de Simon Willison

Le réglage xhigh domine Qwen 3.8 27B active par défaut le niveau de raisonnement xhigh. Sa documentation propose aussi les niveaux medium et low. Ces réglages servent à ajuster la profondeur d’analyse, ainsi que le coût et la vitesse. Dans LM Studio, la limite initiale de contexte était fixée à 8 192 tokens. Le modèle utilisait cette capacité pour réfléchir à des demandes très simples. Willison a ensuite chargé le contexte maximal de 262 144 tokens. Cette modification a évité le blocage observé lors de ses premiers essais. Il recommande de commencer avec un raisonnement faible, voire désactivé, plutôt qu’avec le réglage xhigh.

Qwen consomme 22 276 tokens

Un SVG révèle l’écart Pour dessiner un pélican à bicyclette, Qwen 3.8 27B a généré 3 223 tokens de sortie. Le modèle a consommé 22 276 tokens de raisonnement. L’opération a duré 21 minutes sur la machine utilisée par Willison. Sans raisonnement, la même demande a produit 3 715 tokens en 137 secondes. Le premier résultat comportait notamment une structure de bicyclette correcte, des pattes placées de chaque côté et des ailes touchant le guidon. Le second essai était donc beaucoup plus rapide, mais l’auteur juge le délai de 21 minutes injustifié. Un modèle Qwen 3.8 2.4T-A95B a aussi produit un SVG animé via OpenRouter.

La vision reste solide Sur une photographie de pélicans, Qwen 3.8 27B a renvoyé deux cadres dans une échelle de 0 à 1 000. Les coordonnées correspondaient précisément aux oiseaux visibles dans l’image. Willison a ensuite demandé au modèle de créer hors ligne un outil HTML affichant ces cadres sur une image. Avec le raisonnement activé, Qwen a généré une interface complète, mais y a ajouté une scène de démonstration non demandée. Sans raisonnement, l’outil plaçait presque correctement les cadres, mais leur position restait erronée. L’essai illustre donc une différence entre précision de vision et exécution directe d’une consigne.

Qwen accélère avec le MTP

Le code passe les tests Willison a connecté Qwen 3.8 27B à l’agent de programmation Pi via LM Studio et un NVIDIA DGX Spark. Le modèle a parcouru plusieurs fichiers du projet Datasette pour expliquer le fonctionnement de l’authentification. Il a ensuite écrit et testé un script Python convertissant un fichier JSONL en Markdown. Ces essais suggèrent que le modèle peut appeler des outils et travailler avec un contexte long. La vitesse reste toutefois limitée. Willison mesure environ 15 à 30 tokens par seconde avec LM Studio. Il compare ce débit aux 74 tokens par seconde d’OpenAI 5.6 Sol et aux 184 de 5.6 Luna, selon Artificial Analysis.

Le MTP améliore le débit Qwen prend en charge le Multi-Token Prediction, une méthode qui propose plusieurs tokens avant leur vérification par le modèle principal. Willison a testé cette fonction avec llama.cpp sur le DGX Spark. Sa configuration utilisait une version Q4_K_M, une version Q4_0 et l’option draft-mtp. Un benchmark comparatif exécuté par GPT-5.6 dans Codex a mesuré un avantage d’environ 72 % face au GGUF par défaut de LM Studio. L’auteur anticipe d’autres optimisations de déploiement dans les prochaines semaines. Il estime cependant que les performances restent le principal obstacle à l’usage quotidien de ce modèle local. Consulter les détails techniques de l’essai

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi