Par Arthur Dekeyser
En résumé
Alibaba publie Qwen3.8-Flash-Next comme aperçu de l’architecture Qwen4.
Le modèle multimodal à poids ouverts possède une base de 125 milliards de paramètres.
Qwen3.8-Flash-Next active 6 milliards de paramètres par jeton.
Le signal : Alibaba présente Qwen3.8-Flash-Next avec 125 milliards de paramètres et seulement 6 milliards actifs par jeton.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Alibaba publie Qwen3.8-Flash-Next, un modèle multimodal à poids ouverts développé par l’équipe Qwen. Cette publication présente une architecture Mixture-of-Experts, ou mélange d’experts. Le modèle possède une base de 125 milliards de paramètres. Seuls 6 milliards de paramètres sont actifs pour chaque jeton. Alibaba présente également cette sortie comme un aperçu de l’architecture Qwen4. La publication concerne donc à la fois un modèle disponible et une orientation architecturale annoncée. Les informations techniques sont détaillées dans le billet officiel de Qwen. Qwen3.8-Flash-Next combine ainsi une capacité totale élevée avec une activation limitée par jeton, selon les caractéristiques publiées par l’équipe Qwen.
Une architecture détaillée Qwen3.8-Flash-Next comprend une base de 125 milliards de paramètres. Cette base s’accompagne d’une table d’embeddings N-gram de 51 milliards de paramètres. Le modèle intègre aussi un module de prédiction multi-jetons de 4 milliards de paramètres. Ces trois chiffres décrivent des composants distincts de l’architecture publiée. L’activation par jeton reste fixée à 6 milliards de paramètres. Le modèle est également multimodal et à poids ouverts. La combinaison annoncée réunit donc une base de grande taille, une table N-gram importante et une prédiction multi-jetons intégrée. Qwen présente cette configuration comme une prévisualisation de l’architecture Qwen4 dans sa communication officielle.
Un coût annoncé Alibaba indique que le coût d’entraînement de Qwen3.8-Flash-Next représente environ un neuvième de celui de Qwen3.7-Plus. Cette comparaison porte sur le coût d’entraînement des deux modèles. Elle ne décrit pas leurs performances respectives. Le chiffre fournit toutefois un repère direct entre les deux générations citées par Alibaba. Qwen3.8-Flash-Next conserve une base de 125 milliards de paramètres, avec 6 milliards actifs par jeton. La publication associe donc une architecture Mixture-of-Experts à un coût d’entraînement annoncé comme inférieur. Le modèle est présenté comme un aperçu de Qwen4, sans que cette annonce établisse les caractéristiques finales de cette prochaine architecture.
Des poids volumineux Les fichiers publiés existent en deux formats de précision indiqués par Qwen. Le point de contrôle FP8 atteint 172,78 Gio. Le point de contrôle BF16 atteint 335,28 Gio. La version BF16 occupe donc davantage d’espace que la version FP8, selon les tailles communiquées. Ces fichiers correspondent au modèle Qwen3.8-Flash-Next publié par l’équipe Qwen. Le point de contrôle FP8 est disponible sur Hugging Face. La documentation d’exécution est également référencée dans les recettes vLLM pour Qwen3.8-Flash-Next. Les tailles annoncées donnent une mesure concrète du volume associé à chaque format.
Un aperçu architectural La sortie de Qwen3.8-Flash-Next sert de prévisualisation à l’architecture Qwen4, selon l’annonce d’Alibaba. Le modèle publié est multimodal et à poids ouverts. Sa base atteint 125 milliards de paramètres, tandis que 6 milliards sont actifs par jeton. Son architecture comprend aussi 51 milliards de paramètres dans la table d’embeddings N-gram. Le module de prédiction multi-jetons ajoute 4 milliards de paramètres. Alibaba associe enfin cette publication à un coût d’entraînement annoncé à environ un neuvième de celui de Qwen3.7-Plus. Les points de contrôle FP8 et BF16 mesurent respectivement 172,78 et 335,28 Gio. Qwen4 est présenté comme l’architecture préfigurée par cette sortie.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés