En résumé
Jamba combine des couches Transformer et SSM dans une architecture à experts multiples.
Qwen1.5-MoE-A2.7B annonce une baisse de 75 % des coûts d’entraînement.
DBRX active 36 milliards de paramètres parmi 132 milliards pour chaque entrée.
Le signal : Qwen1.5-MoE-A2.7B active 2,7 milliards de paramètres et annonce 75 % de coûts d’entraînement en moins.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Quatre modèles ouverts ont été présentés en une dizaine de jours selon Data Machina #247, publiée le 31 mars 2024. Jamba, Qwen1.5-MoE-A2.7B, DBRX et Grok-1.5 reposent sur des architectures à experts multiples. Ces modèles cherchent à équilibrer coût d’entraînement, qualité des sorties et vitesse d’inférence. Data Machina les présente comme une nouvelle génération de modèles ouverts face aux modèles fermés d’OpenAI et Google. L’article signale aussi des performances proches des meilleurs résultats établis pour certains modèles. L’introduction de Hugging Face sur les MoE détaille le principe général de ces architectures. Les modèles mobilisent toutefois des choix techniques différents.
Des architectures différenciées caractérisent cette série de modèles. Jamba, développé par AI21 Labs, combine des couches Transformer et SSM dans une architecture MoE. Cette combinaison vise une sortie de qualité, un débit élevé et des besoins mémoire réduits. Qwen1.5-MoE-A2.7B, développé par Alibaba, active seulement 2,7 milliards de paramètres. Il atteint, selon Alibaba, les performances de modèles ouverts de 7 milliards de paramètres comme Mistral 7B. Son architecture utilise des experts fins combinés, une initialisation par remontée et des experts partagés et routés. La présentation de Jamba par AI21 Labs décrit son approche hybride.
Les chiffres annoncés distinguent particulièrement Qwen1.5-MoE-A2.7B. Alibaba annonce une baisse de 75 % des coûts d’entraînement par rapport à des modèles ouverts plus grands de 7 milliards de paramètres. L’entreprise annonce également une accélération de l’inférence d’un facteur 1,74. Ces résultats restent associés à des performances compétitives sur la plupart des évaluations citées dans l’article. Meta AI a présenté de son côté Branch-Train-MiX, une méthode qui part d’un modèle initial. Ce modèle est ensuite ramifié pour entraîner plusieurs experts en parallèle. Meta AI décrit cette méthode comme réduisant les communications nécessaires pendant l’entraînement.
DBRX change d’échelle avec 132 milliards de paramètres au total et 36 milliards actifs pour chaque entrée. Databricks indique que le modèle a été préentraîné sur 12 000 milliards de tokens de texte et de code. Les poids de DBRX Base et DBRX Instruct sont disponibles sur Hugging Face sous une licence ouverte. Selon Databricks, DBRX atteint les meilleurs résultats des évaluations de modèles ouverts en performance, efficacité des coûts et qualité des sorties. L’entreprise affirme aussi qu’il dépasse GPT-3.5 et Gemini 1.0 Pro. DBRX-Instruct peut être essayé gratuitement dans Perplexity Labs Playground, en sélectionnant le modèle dans le menu.
Grok-1.5 complète cette série de modèles ouverts à experts multiples. xAI indique que le modèle repose sur le modèle MoE Grok-1 et dispose d’une fenêtre de contexte de 128 000 tokens. L’entreprise le présente comme performant pour le code, la recherche augmentée par génération et le raisonnement. Grok-1.5 a été entraîné avec une infrastructure distribuée personnalisée basée sur JAX, Rust et Kubernetes. Selon les chercheurs de xAI, il dépasse la plupart des modèles ouverts et atteint des performances proches de Gemini 1.5 Pro et GPT-4. xAI a annoncé une disponibilité de Grok-1.5 dans X, anciennement Twitter. L’article référence également son annonce officielle.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés