Qwen, Jamba et DBRX diversifient les modèles MoE ouverts
#qwen #chatgpt #gemini 3 min · 25 août 2026

Qwen, Jamba et DBRX diversifient les modèles MoE ouverts

Par Arthur Dekeyser

En résumé

1

Qwen1.5-MoE-A2.7B active seulement 2,7 milliards de paramètres.

2

DBRX compte 132 milliards de paramètres, dont 36 milliards sont actifs.

3

Jamba combine des couches Transformer et SSM dans une architecture MoE.

💡

Le signal : Qwen1.5-MoE-A2.7B active 2,7 milliards de paramètres, tout en annonçant 75 % de coûts d’entraînement en moins.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Les modèles ouverts gagnent en diversité avec plusieurs architectures Mixture-of-Experts présentées en dix jours, selon Data Machina #247, publié le 31 mars 2024. AI21 Labs a présenté Jamba, un modèle fondé sur une architecture MoE hybride combinant des couches Transformer et SSM. Alibaba a publié Qwen1.5-MoE-A2.7B, qui active 2,7 milliards de paramètres. Databricks a dévoilé DBRX, un modèle MoE de 132 milliards de paramètres. xAI a annoncé Grok-1.5, construit sur le modèle MoE Grok-1. La sélection complète et les liens vers les annonces sont disponibles dans la source originale. Ces modèles ouverts cherchent à équilibrer qualité, coût d’entraînement, mémoire et vitesse d’inférence.

Jamba combine deux architectures pour réunir leurs caractéristiques annoncées. Le modèle intercale des couches Transformer et SSM, au lieu de s’appuyer sur une seule famille de composants. AI21 Labs associe cette conception à trois objectifs rapportés dans la source : une sortie de haute qualité, un débit élevé et de faibles besoins en mémoire. La page Introducing Jamba présente le modèle. Data Machina renvoie aussi vers un carnet de code consacré à son ajustement fin. La source ne fournit toutefois aucun résultat chiffré de benchmark pour Jamba. Elle décrit donc l’architecture et les objectifs annoncés, sans établir une supériorité générale sur les autres modèles cités.

Qwen réduit les coûts annoncés

Qwen concentre l’activation sur 2,7 milliards de paramètres et vise les performances de modèles ouverts 7B, comme Mistral 7B. Alibaba attribue cette comparaison à plusieurs choix architecturaux : des experts finement combinés, une initialisation par remontée de modèle, ainsi que des experts partagés et de routage. Selon la source, Qwen1.5-MoE-A2.7B annonce une baisse de 75 % des coûts d’entraînement. Il annonce aussi une inférence 1,74 fois plus rapide que des modèles ouverts 7B plus grands. Ces chiffres décrivent les résultats rapportés par Alibaba. La source fournit également un lien vers le papier et le dépôt Qwen.

DBRX mobilise 132 milliards de paramètres au total, avec 36 milliards actifs pour chaque entrée. Databricks indique que le modèle a été préentraîné sur 12 000 milliards de jetons de texte et de code. Les poids de DBRX Base et DBRX Instruct sont disponibles sur Hugging Face avec une licence ouverte, selon Data Machina. Databricks affirme que DBRX atteint des performances de pointe dans les benchmarks de modèles ouverts, avec une efficacité de coût et une qualité de sortie également annoncées comme de pointe. L’entreprise affirme aussi que DBRX dépasse GPT-3.5 et Gemini 1.0 Pro. La source propose un accès gratuit à DBRX-Instruct via Perplexity Labs Playground.

xAI étend le contexte ouvert

Grok-1.5 ouvre 128 000 tokens de contexte et repose sur le modèle MoE Grok-1, indique la source. xAI présente le modèle comme performant pour le code, la recherche augmentée par récupération et le raisonnement. Son entraînement utilise un cadre distribué personnalisé fondé sur JAX, Rust et Kubernetes. Selon les chercheurs de xAI, Grok-1.5 dépasse la plupart des modèles ouverts et atteint des performances proches de Gemini 1.5 Pro ou GPT-4. Cette comparaison reste une affirmation attribuée à xAI. Le modèle doit être disponible dans X, anciennement Twitter. La même édition de Data Machina cite également BTX de Meta AI, une méthode qui entraîne des experts en parallèle depuis un modèle initial. Pour aller plus loin, consultez notre guide sur réduire ses coûts grâce à l’IA.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi