# Meta FAIR trie les essais IA avant leur exécution

> Meta FAIR présente les RPM, des modèles qui classent les expériences d’agents IA avant leur exécution, avec jusqu’à 1,6 fois plus d’efficacité.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-07 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/meta-fair-classe-les-essais-ia-et-atteint-0729-sur-airs-bench
Tags : ia, recherche, gpu, modèles, open source, agents-ia, inference

---

## En résumé

- Meta FAIR classe les expériences non exécutées avant de consommer du temps GPU.
- Le score normalisé moyen atteint 0,729 avec la version agentique sur AIRS-Bench.
- Les deux variantes atteignent le score de référence en environ quinze heures.

**Le signal :** Les RPM de Meta FAIR font passer le score normalisé moyen de 0,684 à 0,729 sur AIRS-Bench.

**Meta FAIR présente** les AI Research Preference Models, ou RPM, avec des chercheurs de l’Université d’Oxford et de University College London. Ces modèles classent les expériences proposées par un agent de [recherche](/signal-ia/actu/anthropic-revele-huit-fois-plus-de-code-fusionne-en-2026) avant leur exécution. L’objectif opérationnel est de sélectionner un seul candidat parmi plusieurs propositions non testées. La méthode évite donc d’exécuter chaque idée avant comparaison. Les auteurs indiquent que la génération d’idées coûte peu, tandis que leur vérification peut mobiliser plusieurs heures ou plusieurs jours de calcul GPU. Les RPM ne prédisent pas une note absolue. L’équipe les utilise plutôt pour comparer directement des candidats selon leur intérêt relatif pour la recherche. [Lire l’article détaillé](https://www.marktechpost.com/2026/09/06/meta-fair-introduces-ai-research-preference-models-rpms-ranking-ml-experiments-before-spending-gpu-hours/).

**Le système intervient** dans AIRA-dojo, un environnement de recherche organisé comme une recherche arborescente évolutionnaire. L’agent sélectionne un parent, puis applique les opérateurs Draft, Improve ou Debug. Avec un RPM, il produit quinze candidats en parallèle avant de les comparer dans un tournoi à élimination directe. Seul le gagnant est ensuite exécuté. Chaque comparaison s’appuie sur des nœuds déjà explorés, recueillis par un parcours en largeur de l’arbre. Ces nœuds affichent aussi leur score de validation. Le meilleur nœud selon la validation est retourné à la fin de la recherche. Le code d’AIRA-dojo est disponible sur [GitHub](https://github.com/facebookresearch/aira-dojo).

## Meta FAIR compare quinze candidats

**Deux variantes mobilisent** des modèles de langage préentraînés et figés, sans ajustement supplémentaire. La version dite [inference](/signal-ia/actu/grpo-redefinit-lia-68-moins-cher-135pourcent-plus-performant)-only juge les plans, le code et l’historique de recherche. Son invite a été optimisée avec MIPROv2, dans DSPy. Elle atteint une précision hors ligne comprise entre 57,7 % et 59,0 %. La version agentic ajoute un bac à sable qui clone l’environnement de l’agent. Elle dispose d’un H200, ainsi que des outils Python, bash et submit_solution. Elle lance de petites expériences pilotes, puis un modèle de retour choisit un essai suivant ou arrête la boucle. Les pilotes sont plafonnés à trente, avec un seuil de soixante secondes.

**Les résultats proviennent** d’AIRS-Bench, qui regroupe vingt tâches publiques de texte et de données tabulaires. Chaque tâche reçoit vingt-quatre heures sur un H200, avec dix graines. Qwen3.6-27B sert à la fois aux opérateurs et aux RPM. Le score normalisé moyen atteint 0,684 sans RPM, 0,711 avec la version inference-only et 0,729 avec la version agentic. Les plafonds théoriques atteignent 0,748 pour l’oracle de validation et 0,759 pour l’oracle de test. La probabilité d’amélioration sur la référence s’établit à 0,5923 et 0,5913. Les bornes inférieures des intervalles de confiance à 95 % atteignent 0,5066 et 0,5018.

## Les RPM réduisent le temps calcul

**Le gain apparaît** surtout dans le temps nécessaire pour atteindre le score final de référence. La version inference-only atteint 0,684 en 14,88 heures, contre vingt-quatre heures pour la référence, soit un facteur de 1,61. La version agentic atteint ce même score en 15,50 heures, soit un facteur de 1,55. L’inférence auto-hébergée ajoute 0,660 heure par exécution. Après cet ajustement, la version concernée obtient 0,708 en 23,34 heures. Les auteurs rapportent aussi deux nouveaux meilleurs scores. WinoGrande atteint 94,1 % avec la version agentic, contre 90,4 % pour AIRA₂. SVAMP atteint 95,7 % avec inference-only, contre 94,2 % pour un meilleur résultat humain antérieur.
