En résumé
Jamba combine des couches Transformer et SSM dans une architecture MoE.
Qwen1.5-MoE-A2.7B active 2,7 milliards de paramètres avec des experts spécialisés.
DBRX dispose de 132 milliards de paramètres, dont 36 milliards sont actifs par entrée.
Le signal : Qwen1.5-MoE-A2.7B active 2,7 milliards de paramètres et réduit de 75 % le coût d’entraînement annoncé.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Le 31 mars 2024, Data Machina présente une nouvelle génération de modèles ouverts fondés sur l’architecture Mixture-of-Experts, ou MoE. La sélection regroupe notamment Jamba d’AI21 Labs, Qwen1.5-MoE-A2.7B d’Alibaba et DBRX de Databricks. Ces modèles cherchent à équilibrer coût d’entraînement, qualité des sorties, vitesse d’inférence et consommation mémoire. Le dossier compare aussi leurs choix architecturaux avec des modèles fermés comme GPT-4 et Gemini 1.5 Pro. Il signale des résultats proches des meilleurs niveaux annoncés sur certains tests. La présentation complète est disponible dans Data Machina #247, publiée le 31 mars 2024.
Les architectures ouvertes exploitent plusieurs experts plutôt qu’un réseau unique mobilisé de manière identique. Le guide de Hugging Face explique le principe général des modèles MoE. Jamba combine des couches Transformer et SSM, selon une alternance conçue par AI21 Labs. Cette construction vise simultanément une sortie de qualité, un débit élevé et des besoins mémoire réduits. AI21 Labs propose aussi une présentation dédiée à Jamba, ainsi qu’un exemple de réglage fin. Le dossier cite également la méthode Branch-Train-MiX de Meta AI. Celle-ci part d’un modèle initial, puis entraîne plusieurs experts en parallèle avec une communication réduite.
Qwen réduit les paramètres actifs avec Qwen1.5-MoE-A2.7B, un modèle qui n’active que 2,7 milliards de paramètres. Ses performances rejoignent celles de modèles ouverts de 7 milliards de paramètres, comme Mistral 7B. Alibaba associe plusieurs choix techniques dans cette architecture. Le modèle utilise des experts fins combinés, une initialisation par remontée de modèle, ainsi que des experts partagés et routés. Alibaba annonce une baisse de 75 % des coûts d’entraînement face à des modèles ouverts plus grands. L’inférence serait aussi accélérée d’un facteur 1,74. Le billet Qwen consacré au modèle MoE détaille cette approche.
DBRX élargit l’échelle avec une architecture MoE fine de 132 milliards de paramètres. Databricks indique que 36 milliards de paramètres sont actifs pour chaque entrée. Le modèle a été préentraîné sur 12 000 milliards de jetons de texte et de code. DBRX Base et DBRX Instruct sont disponibles sur Hugging Face sous une licence ouverte. Databricks affirme que DBRX atteint des résultats de pointe sur des tests de modèles ouverts, en performance, coût et qualité de sortie. L’entreprise indique aussi qu’il dépasse GPT-3.5 et Gemini 1.0 Pro. DBRX-Instruct peut être essayé gratuitement dans Perplexity Labs Playground, en sélectionnant le modèle dans le menu.
Grok-1.5 complète cette sélection avec un modèle ouvert construit sur la base MoE de Grok-1. xAI annonce une fenêtre de contexte de 128 000 éléments. L’équipe présente le modèle comme performant en programmation, en recherche augmentée et en raisonnement. Son entraînement repose sur un cadre distribué utilisant JAX, Rust et Kubernetes. Les chercheurs de xAI indiquent que Grok-1.5 dépasse la plupart des modèles ouverts et atteint des performances proches de Gemini 1.5 Pro ou GPT-4. Le modèle devait être disponible dans X, anciennement Twitter. Data Machina relie enfin cette évolution à d’autres travaux sur les agents, dont OpenDevin et AgentStudio. Pour aller plus loin, consultez notre guide sur réduire ses coûts grâce à l’IA.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés