Mixture of Experts (MoE)
L'architecture Mixture of Experts divise un modèle en plusieurs sous-réseaux spécialisés (les experts) dont seuls quelques-uns sont activés pour chaque token traité. Cette approche multiplie la capacité du modèle sans multiplier proportionnellement le coût de calcul.
GPT-4 utiliserait une architecture MoE avec plusieurs experts, n'en activant qu'une fraction pour chaque token, ce qui expliquerait ses performances supérieures pour un coût d'inférence finalement raisonnable.
L'architecture Mixture of Experts divise un modèle en plusieurs sous-réseaux spécialisés (les experts) dont seuls quelques-uns sont activés pour chaque token traité. Cette approche multiplie la capacité du modèle sans multiplier proportionnellement le coût de calcul.
GPT-4 utiliserait une architecture MoE avec plusieurs experts, n'en activant qu'une fraction pour chaque token, ce qui expliquerait ses performances supérieures pour un coût d'inférence finalement raisonnable.
Mixture of Experts et LLM sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : LLM, Transformer, Paramètres, Mixtral.
Gardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés