En résumé
Les évaluations de LLM se répartissent entre benchmarks et jugements, avec quatre approches courantes : choix multiple, vérificateurs, classements et juges LLM.
MMLU couvre 57 matières et environ 16 000 questions, avec un score calculé selon la proportion de réponses correctes.
L’exemple de code utilise une implémentation PyTorch de Qwen3 0.6B nécessitant environ 1,5 Go de mémoire vive.
Le signal : MMLU réunit environ 16 000 questions réparties dans 57 matières pour comparer les modèles selon leur taux de réponses correctes.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Comment comparer deux modèles de langage ou mesurer les progrès réalisés lors d’un fine-tuning ? Sebastian Raschka propose une cartographie des quatre approches couramment utilisées en pratique: les questions à choix multiple, les vérificateurs, les classements et les juges fondés sur des LLM. Ces méthodes apparaissent dans les articles de recherche, les supports marketing, les rapports techniques et les fiches de modèle. Elles se répartissent en deux familles: l’évaluation fondée sur des benchmarks et celle fondée sur un jugement. La perte d’entraînement, la perplexité et les récompenses constituent d’autres mesures, généralement utilisées en interne pendant le développement.
La première méthode étudiée est l’évaluation par questions à choix multiple, notamment avec MMLU, pour Massive Multitask Language Understanding. Ce benchmark couvre 57 matières, des mathématiques au lycée à la biologie, et rassemble environ 16 000 questions. Le score correspond à la proportion de réponses exactes: 87,5 % signifie par exemple que 14 000 questions sur 16 000 ont été correctement résolues. Cette approche mesure le rappel de connaissances de façon quantifiable, à la manière d’un examen standardisé ou d’un test théorique de conduite.
Dans sa forme la plus simple, le modèle génère une lettre, puis celle-ci est comparée à la bonne réponse du jeu de données. Raschka mentionne aussi deux méthodes populaires reposant sur le calcul de probabilités logarithmiques, dont les implémentations sont disponibles sur GitHub.
Pour illustrer le calcul du score MMLU, l’auteur charge une implémentation réalisée entièrement en PyTorch de Qwen3 0.6B. Cette version nécessite environ 1,5 Go de mémoire vive et est importée depuis la bibliothèque Python reasoning_from_scratch, installable avec pip install reasoning_from_scratch ou uv add reasoning_from_scratch. Le code peut utiliser le modèle de base ou sa version orientée raisonnement, avec les tokenizers correspondants, puis charger les poids depuis des fichiers dédiés. Une compilation avec torch.compile est également proposée en option.
L’article ne cherche pas à détailler l’architecture de Qwen3, mais à traiter ce modèle comme un système à évaluer. Raschka renvoie toutefois à un précédent tutoriel consacré à l’implémentation de Qwen3 et au code disponible sur GitHub. Cette présentation s’inscrit dans son livre Build a Reasoning Model (From Scratch), actuellement en accès anticipé avec plus de 100 pages en ligne. Trente pages supplémentaires viennent d’être finalisées et doivent encore être ajoutées par l’équipe de mise en page. Le livre adopte une démarche pratique, en construisant un LLM de raisonnement entièrement à partir de zéro en PyTorch.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs