Massive Multitask Language Understanding
MMLU (Massive Multitask Language Understanding) est l'un des benchmarks les plus utilisés pour évaluer les LLMs sur 57 disciplines académiques : mathématiques, droit, médecine, physique, histoire... Il teste la connaissance factuelle et le raisonnement multi-domaines.
Claude 3 Opus atteint 86,8% sur MMLU contre 86,4% pour GPT-4, ce qui en fait l'une des comparaisons de référence pour évaluer les capacités générales des LLMs entre laboratoires concurrents.
MMLU (Massive Multitask Language Understanding) est l'un des benchmarks les plus utilisés pour évaluer les LLMs sur 57 disciplines académiques : mathématiques, droit, médecine, physique, histoire... Il teste la connaissance factuelle et le raisonnement multi-domaines.
Claude 3 Opus atteint 86,8% sur MMLU contre 86,4% pour GPT-4, ce qui en fait l'une des comparaisons de référence pour évaluer les capacités générales des LLMs entre laboratoires concurrents.
MMLU et Benchmark sont deux concepts liés mais distincts dans l'écosystème IA. Pour approfondir : Benchmark, LLM, Foundation model, Modèle de raisonnement.
Gardez un coup d'avance en business et IA
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés