MIXTURE OF EXPERTS

Mixture of Experts (MoE)

🧠 MODELES AVANCE +30 XP

Definition

L'architecture Mixture of Experts divise un modèle en plusieurs sous-réseaux spécialisés (les experts) dont seuls quelques-uns sont activés pour chaque token traité. Cette approche multiplie la capacité du modèle sans multiplier proportionnellement le coût de calcul.

Exemple concret

GPT-4 utiliserait une architecture MoE avec plusieurs experts, n'en activant qu'une fraction pour chaque token, ce qui expliquerait ses performances supérieures pour un coût d'inférence finalement raisonnable.

Questions frequentes

Qu'est-ce que le mixture of experts ? +

L'architecture Mixture of Experts divise un modèle en plusieurs sous-réseaux spécialisés (les experts) dont seuls quelques-uns sont activés pour chaque token traité. Cette approche multiplie la capacité du modèle sans multiplier proportionnellement le coût de calcul.

Comment fonctionne le mixture of experts en pratique ? +

GPT-4 utiliserait une architecture MoE avec plusieurs experts, n'en activant qu'une fraction pour chaque token, ce qui expliquerait ses performances supérieures pour un coût d'inférence finalement raisonnable.

Quelle est la différence entre le mixture of experts et un LLM ? +

Mixture of Experts et LLM sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : LLM, Transformer, Paramètres, Mixtral.

NEWSLETTER BUSINESS & IA

Gardez un coup d'avance en business et IA

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés