Par Arthur Dekeyser
En résumé
BenchMIRT audite les benchmarks de LLM question par question.
L’analyse distingue la sécurité du raisonnement général.
Un score unique peut combiner plusieurs signaux différents.
Le signal : BenchMIRT distingue deux dimensions dominantes, la sécurité et le raisonnement général, après analyse de 100 LLM.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Nouvelle méthode d’audit BenchMIRT est présenté comme une méthode destinée à auditer les benchmarks de grands modèles de langage. L’approche analyse les performances modèle par modèle, question par question. Elle estime ensuite les capacités sous-jacentes associées aux réponses correctes. L’article présentant cette méthode a été publié le 1er septembre 2026. BenchMIRT ne se limite donc pas à comparer des scores agrégés. Il examine les tâches individuelles utilisées par les évaluations. Cette granularité sert à relier une réponse correcte à une capacité estimée. La méthode vise ainsi à examiner ce que les résultats d’un benchmark représentent effectivement. Le projet est présenté dans l’article d’Allen Institute.
Une base de 34 000 questions BenchMIRT a été entraîné sur les résultats de 100 LLM. Ces résultats couvrent 16 benchmarks et plus de 34 000 questions. Cet ensemble permet d’analyser des performances provenant de plusieurs évaluations. La méthode utilise l’IRT multidimensionnelle pour séparer plusieurs capacités. Cette approche traite donc les compétences comme des dimensions distinctes. Elle ne réduit pas nécessairement chaque résultat à une seule aptitude. L’analyse porte sur les réponses correctes associées à des tâches précises. Les 100 modèles constituent l’échantillon utilisé pour estimer ces dimensions. Le code du projet est disponible sur GitHub, tandis que la présentation technique figure dans le document d’AllenAI.
Deux dimensions dominantes L’analyse a retrouvé indépendamment deux dimensions dominantes. La première correspond à la sécurité. La seconde correspond au raisonnement général. Cette séparation provient de l’application de l’IRT multidimensionnelle aux résultats étudiés. BenchMIRT a aussi confirmé qu’une forte performance sur les benchmarks de raisonnement suit la capacité de raisonnement. Ce résultat relie donc les performances observées sur ces évaluations à cette dimension estimée. La sécurité et le raisonnement général apparaissent séparément dans l’analyse. Le résultat décrit des signaux distincts derrière les réponses correctes. Il ne présente pas un score unique comme une mesure suffisante de toutes les capacités.
Des scores aux signaux Les résultats concernant WMDP et HarmBench illustrent cette séparation entre capacités. Les scores WMDP, pris dans leur ensemble, étaient davantage associés au raisonnement général qu’à la sécurité. Pour HarmBench, les questions standard correspondaient à la sécurité. Ses questions liées au droit d’auteur correspondaient au raisonnement général. Ces associations diffèrent selon le type de questions évaluées. Un même benchmark peut donc réunir des tâches liées à plusieurs dimensions. L’analyse montre ainsi qu’un score de benchmark unique peut combiner plusieurs signaux différents. BenchMIRT examine ces signaux au niveau des questions, plutôt que de considérer seulement le résultat global.
Une lecture plus détaillée BenchMIRT fournit une méthode pour relier les réponses correctes aux capacités estimées. Son analyse distingue la sécurité du raisonnement général dans un corpus de 16 benchmarks. Les résultats WMDP et HarmBench montrent que les catégories de questions ne correspondent pas toutes au même signal. Les questions standard de HarmBench s’alignent avec la sécurité. Ses questions sur le droit d’auteur s’alignent avec le raisonnement général. WMDP présente également une association plus forte avec le raisonnement général qu’avec la sécurité. Ces observations concernent les scores analysés par BenchMIRT. Elles montrent que l’interprétation d’un résultat dépend des tâches incluses dans le benchmark.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés