Par Arthur Dekeyser
En résumé
BenchMIRT audite les benchmarks au niveau de chaque question.
La méthode a été entraînée sur 100 modèles et 16 benchmarks.
BBQ s’aligne davantage sur le raisonnement général que sur la sécurité.
Le signal : BenchMIRT a analysé les résultats de 100 modèles sur 16 benchmarks et plus de 34 000 questions.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
BenchMIRT audite les benchmarks de modèles de langage au niveau de chaque question. La méthode analyse la performance sur chaque tâche. Elle estime ensuite les capacités sous-jacentes associées à une réponse correcte. Cette granularité distingue l’évaluation globale de l’examen des items individuels. BenchMIRT a été entraîné sur des résultats produits par 100 modèles. Ces résultats couvrent 16 benchmarks et plus de 34 000 questions. La méthode fournit donc un cadre d’audit centré sur les questions évaluées. Elle ne se limite pas à comparer des scores finaux. Les équipes peuvent ainsi examiner les dimensions associées à chaque réponse correcte. Présentation de BenchMIRT
Cent modèles évalués ont alimenté l’entraînement de BenchMIRT. L’ensemble couvre six benchmarks de raisonnement général. Il comprend notamment MMLU-Pro, GPQA, MATH et BBH. Dix autres benchmarks proviennent de la suite de sécurité Olmo 3. Cette suite inclut HarmBench, StrongReject, WildJailbreak, BBQ, WMDP et XSTest. Au total, la méthode s’appuie sur 16 évaluations distinctes. Les données représentent plus de 34 000 questions. BenchMIRT compare donc des résultats issus de domaines de raisonnement général et de sécurité. Cette composition permet d’observer les dimensions récupérées par la méthode parmi plusieurs familles d’évaluations. Article de recherche d’Allen Institute
Deux dimensions dominantes ont été récupérées indépendamment par BenchMIRT. La première correspond à la sécurité. La seconde correspond au raisonnement général. Ce résultat décrit la structure observée dans les résultats de benchmarks analysés. Il ne réduit pas chaque évaluation à une seule capacité. La méthode examine plutôt les associations entre réussite sur une question et capacités sous-jacentes estimées. Les six benchmarks de raisonnement général fournissent notamment les résultats liés à MMLU-Pro, GPQA, MATH et BBH. Les dix évaluations de sécurité proviennent de la suite Olmo 3. BenchMIRT met ainsi en regard ces deux ensembles dans une même analyse des performances de modèles.
BBQ mesure les biais sociaux, mais BenchMIRT l’a davantage aligné sur le raisonnement général que sur la sécurité. Cette observation concerne la structure récupérée par la méthode. Elle distingue donc la capacité mesurée par l’intention d’un benchmark et les associations observées dans ses résultats. BenchMIRT a également établi qu’un raisonnement général plus fort était associé à des scores WMDP plus faibles. WMDP appartient à la suite de sécurité Olmo 3. Cette association relie donc un axe de raisonnement général à une évaluation de sécurité. Elle ne constitue pas une explication causale. Elle décrit uniquement l’association identifiée par l’analyse de BenchMIRT. Dépôt du code BenchMIRT
Les résultats précisent ce que BenchMIRT attribue aux questions évaluées. BBQ, malgré son évaluation du biais social, s’aligne davantage sur le raisonnement général. WMDP, lui, présente des scores plus faibles lorsque le raisonnement général est plus fort. Ces deux observations concernent des benchmarks de la suite Olmo 3. Elles montrent que les catégories annoncées d’une évaluation et les dimensions récupérées peuvent différer. BenchMIRT fournit cette lecture au niveau des questions, plutôt qu’au seul niveau des scores agrégés. Les équipes disposent ainsi d’un moyen pour examiner les capacités associées aux réponses correctes dans 16 benchmarks et plus de 34 000 questions.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés