# Qwen, Jamba, DBRX et Grok relancent les modèles ouverts

> Jamba, Qwen1.5-MoE et DBRX illustrent la montée des modèles ouverts à experts multiples, avec des gains annoncés en coût, vitesse et performance.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-09-02 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/qwen-jamba-et-dbrx-propulsent-les-modeles-ouverts
Tags : modèles ouverts, moe, infrastructure ia, entraînement, inférence, chatgpt, gemini, mistral

---

## En résumé

- Jamba combine des couches Transformer et SSM dans une architecture à experts multiples.
- Qwen1.5-MoE-A2.7B annonce une baisse de 75 % des coûts d’entraînement.
- DBRX active 36 milliards de paramètres parmi 132 milliards pour chaque entrée.

**Le signal :** Qwen1.5-MoE-A2.7B active 2,7 milliards de paramètres et annonce 75 % de coûts d’entraînement en moins.

**Quatre [modèles ouverts](/signal-ia/actu/qwen15-moe-a27b-promet-75-pourcent-de-couts-en-moins)** ont été présentés en une dizaine de jours selon Data Machina #247, publiée le 31 mars 2024. Jamba, Qwen1.5-MoE-A2.7B, DBRX et Grok-1.5 reposent sur des architectures à experts multiples. Ces modèles cherchent à équilibrer coût d’entraînement, qualité des sorties et vitesse d’inférence. Data Machina les présente comme une nouvelle génération de modèles ouverts face aux modèles fermés d’OpenAI et Google. L’article signale aussi des performances proches des meilleurs résultats établis pour certains modèles. L’introduction de [Hugging Face sur les MoE](https://huggingface.co/blog/moe) détaille le principe général de ces architectures. Les modèles mobilisent toutefois des choix techniques différents.

**Des architectures différenciées** caractérisent cette série de modèles. Jamba, développé par AI21 Labs, combine des couches Transformer et SSM dans une architecture MoE. Cette combinaison vise une sortie de qualité, un débit élevé et des besoins mémoire réduits. Qwen1.5-MoE-A2.7B, développé par Alibaba, active seulement 2,7 milliards de paramètres. Il atteint, selon Alibaba, les performances de modèles ouverts de 7 milliards de paramètres comme [Mistral](/signal-ia/actu/databricks-revolutionne-lia-avec-dbrx) 7B. Son architecture utilise des experts fins combinés, une initialisation par remontée et des experts partagés et routés. La présentation de [Jamba par AI21 Labs](https://www.ai21.com/jamba) décrit son approche hybride.

## Jamba et Qwen réduisent les coûts

**Les chiffres annoncés** distinguent particulièrement Qwen1.5-MoE-A2.7B. Alibaba annonce une baisse de 75 % des coûts d’entraînement par rapport à des modèles ouverts plus grands de 7 milliards de paramètres. L’entreprise annonce également une accélération de l’inférence d’un facteur 1,74. Ces résultats restent associés à des performances compétitives sur la plupart des évaluations citées dans l’article. Meta AI a présenté de son côté Branch-Train-MiX, une méthode qui part d’un modèle initial. Ce modèle est ensuite ramifié pour entraîner plusieurs experts en parallèle. Meta AI décrit cette méthode comme réduisant les communications nécessaires pendant l’entraînement.

**DBRX change d’échelle** avec 132 milliards de paramètres au total et 36 milliards actifs pour chaque entrée. Databricks indique que le modèle a été préentraîné sur 12 000 milliards de tokens de texte et de code. Les poids de DBRX Base et DBRX Instruct sont disponibles sur Hugging Face sous une licence ouverte. Selon Databricks, DBRX atteint les meilleurs résultats des évaluations de modèles ouverts en performance, efficacité des coûts et qualité des sorties. L’entreprise affirme aussi qu’il dépasse GPT-3.5 et Gemini 1.0 Pro. DBRX-Instruct peut être essayé gratuitement dans Perplexity Labs Playground, en sélectionnant le modèle dans le menu.

## DBRX et Grok élargissent l’offre

**Grok-1.5 complète** cette série de modèles ouverts à experts multiples. xAI indique que le modèle repose sur le modèle MoE Grok-1 et dispose d’une fenêtre de contexte de 128 000 tokens. L’entreprise le présente comme performant pour le code, la recherche augmentée par génération et le [raisonnement](/signal-ia/actu/deepseek-v32-combine-attention-parcimonieuse-et-raisonnement). Grok-1.5 a été entraîné avec une infrastructure distribuée personnalisée basée sur JAX, Rust et Kubernetes. Selon les chercheurs de xAI, il dépasse la plupart des modèles ouverts et atteint des performances proches de Gemini 1.5 Pro et GPT-4. xAI a annoncé une disponibilité de Grok-1.5 dans X, anciennement Twitter. L’article référence également son annonce officielle.
