# Qwen1.5-MoE d’Alibaba rivalise avec GPT-4 à moindre coût

> Data Machina #247 présente Jamba, Qwen1.5-MoE, DBRX et Grok-1.5, des modèles ouverts qui optimisent paramètres actifs, coûts et inférence.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-21 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/qwen15-moe-promet-75-pourcent-de-couts-dentrainement-en-moins
Tags : modèles ouverts, mélange d’experts, inférence, entraînement, agents, chatgpt, gemini, grok

---

## En résumé

- Jamba combine des couches Transformer et SSM dans une architecture MoE.
- Qwen1.5-MoE-A2.7B atteint les performances de modèles 7B avec moins de paramètres activés.
- DBRX active 36 milliards de paramètres sur 132 milliards au total.

**Le signal :** Qwen1.5-MoE-A2.7B active 2,7 milliards de paramètres et annonce 75 % de baisse des coûts d’entraînement.

**Data Machina présente** quatre modèles ouverts fondés sur le mélange d’experts, ou MoE, dans son numéro 247. La sélection cite Jamba d’AI21 Labs, Qwen1.5-MoE-A2.7B d’Alibaba, DBRX de Databricks et Grok-1.5 de xAI. Ces architectures cherchent à combiner qualité de sortie, coûts d’entraînement, vitesse d’inférence et besoins mémoire. La publication rapproche certains de ces modèles des performances de GPT-4 et Gemini 1.5 Pro. Elle souligne aussi la diversité des choix techniques. Jamba associe des couches Transformer et SSM. Qwen1.5-MoE-A2.7B limite les paramètres activés. DBRX utilise une architecture MoE fine. Grok-1.5 propose une fenêtre de contexte de 128 000 tokens. [Lire le numéro 247](https://datamachina.substack.com/p/data-machina-247).

**Les architectures évoluent** autour d’experts spécialisés et de mécanismes de routage. Alibaba présente Qwen1.5-MoE-A2.7B avec des experts fins combinés, une initialisation par remontée et des experts partagés et routés. Meta AI décrit de son côté Branch-Train-MiX, ou BTX. Cette méthode part d’un modèle initial, puis crée plusieurs branches pour entraîner des experts en parallèle. Data Machina relie ces travaux à la recherche d’une architecture MoE plus efficace. Le billet de Hugging Face propose une introduction détaillée au fonctionnement des mélanges d’experts. Ces modèles ouverts s’inscrivent ainsi dans une série d’approches qui répartissent le calcul entre plusieurs composants spécialisés. [Consulter l’explication de Hugging Face](https://huggingface.co/blog/moe).

## Alibaba réduit les paramètres actifs

**Qwen affiche des résultats** comparables à ceux de modèles ouverts de 7 milliards de paramètres, selon Alibaba. Qwen1.5-MoE-A2.7B n’active que 2,7 milliards de paramètres. La publication indique une baisse de 75 % des coûts d’entraînement par rapport à des modèles ouverts 7B plus grands. Elle rapporte également une accélération de l’inférence d’un facteur 1,74. Le modèle reste compétitif sur la plupart des évaluations citées. Cette combinaison repose sur plusieurs choix d’architecture, dont les experts fins combinés, l’initialisation par remontée et les experts partagés. Alibaba a publié un article, un dépôt et une démonstration dédiés à Qwen1.5-MoE. [Voir la présentation de Qwen1.5-MoE](https://qwenlm.github.io/blog/qwen-moe/).

**Databricks change d’échelle** avec DBRX, un modèle MoE de 132 milliards de paramètres. Chaque entrée active 36 milliards de paramètres. Le modèle a été préentraîné sur 12 000 milliards de tokens de textes et de code. Databricks a rendu disponibles DBRX Base et DBRX Instruct sur Hugging Face, sous licence ouverte. L’entreprise affirme que DBRX atteint des performances de pointe sur des évaluations de modèles ouverts. Elle affirme aussi qu’il dépasse GPT-3.5 et Gemini 1.0 Pro. DBRX-Instruct peut être essayé gratuitement dans Perplexity Labs Playground. Un dépôt décrit également une quantification en quatre bits pour exécuter DBRX sur un MacBook avec Apple MLX.

## xAI ouvre Grok-1.5

**Grok-1.5 complète la sélection** consacrée aux modèles ouverts MoE. xAI l’a construit sur le modèle MoE Grok-1 et lui attribue une fenêtre de contexte de 128 000 tokens. La publication décrit des capacités fortes en programmation, en recherche augmentée par récupération et en raisonnement. xAI indique aussi que Grok-1.5 dépasse la plupart des modèles ouverts et atteint des performances proches de Gemini 1.5 Pro ou GPT-4. Son entraînement repose sur une infrastructure distribuée développée avec JAX, Rust et Kubernetes. xAI prévoit la disponibilité de Grok-1.5 dans X, anciennement Twitter. Le numéro présente enfin OpenDevin et AgentStudio parmi les ressources liées aux flux de travail agentiques.
Pour aller plus loin, consultez notre guide sur [réduire ses coûts grâce à l'IA](/signal-ia/guides/reduire-couts-ia-automatisations-pme-2026).
