Databricks révolutionne l'IA avec DBRX
#chatgpt #gemini #mistral 2 min · 15 août 2026

Databricks révolutionne l'IA avec DBRX

Par Arthur Dekeyser

En résumé

1

Jamba, de AI21Labs, intègre des couches SSM et Transformer pour combiner qualité et performance.

2

Qwen1.5-MoE-Alibaba se distingue par sa réduction de 75 % des coûts de formation.

3

DBRX de Databricks surpasse les modèles fermés, avec SOTA en efficacité et qualité.

💡

Le signal : Le modèle DBRX de Databricks utilise 132 milliards de paramètres, établissant de nouveaux standards de performance.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

La course à l’innovation dans le domaine de l’intelligence artificielle voit l’émergence de nouveaux modèles Mixture-of-Experts (MoE) ouverts, conçus pour rivaliser avec les modèles fermés des grandes entreprises technologiques comme GPT-4 d’OpenAI et Gemini 1.5 Pro de Google. Un exemple est le modèle DBRX de Databricks qui, avec ses 132 milliards de paramètres, se distingue par sa performance SOTA en termes de coût et d’efficacité de sortie. Selon Databricks, DBRX dépasse même les modèles fermés populaires, offrant une flexibilité d’utilisation accrue grâce à son accès sous licence ouverte sur Hugging Face.

AI21Labs avec Jamba a développé un modèle basé sur une architecture hybride SSM-Transformer. Jamba parvient à fusionner les avantages des structures Transformer et SSM pour offrir une haute qualité de sortie tout en optimisant les besoins en mémoire. Ce modèle est particulièrement innovant en combinant différents types de couches pour équilibrer les performances et l’efficacité du coût de formation. Pour ceux qui souhaitent peaufiner ce modèle puissant, un tutoriel spécifique est disponible.

Alibaba et son modèle Qwen1.5-MoE

Alibaba et son modèle Qwen1.5-MoE, qui active seulement 2,7 milliards de paramètres, égale les performances des modèles SOTA de 7 milliards de paramètres tels que le Mistral 7B. Le modèle parvient à réduire les coûts d’entraînement de 75 % tout en accélérant la vitesse d’inférence par un facteur de 1,74. Ce succès s’explique par plusieurs innovations architecturales, comme l’initialisation réutilisée et le routage d’experts partagés. Ses résultats impressionnants sont détaillés dans le blog dédié à Qwen.

Meta AI et l’approche BTX adoptent également une stratégie de mélange d’experts en IA. Avec le Branch-Train-MiX, des experts sont formés parallèlement à partir d’un modèle de base, permettant une efficacité architecturale supérieure. Ce modèle Open MoE met en lumière de nouvelles méthodes pour optimiser les coûts de communication et les performances.

Des modèles comme xAI Grok-1.5, qui excelle dans des tâches de codage et de raisonnement, continuent d’enrichir l’écosystème des MoE ouverts. Développé par une équipe utilisant JAX et Rust sur une infrastructure Kubernetes, ce modèle met en avant ses capacités avec une fenêtre contextuelle étendue et des performances impressionnantes. Selon les chercheurs de xAI, Grok-1.5 est parmi les plus compétitifs sur le marché actuel des modèles ouverts.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi