# PROOF-Gen récupère 93 % des scénarios échoués

> PROOF-Gen récupère 93 % des scénarios échoués sur τ 2-bench et améliore les performances de Qwen3-4B-Instruct-2507 après distillation.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-28 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/proof-gen-recupere-93-pourcent-des-scenarios-echoues
Tags : distillation, modèles, données, outils, ia générative, raisonnement, inference

---

## En résumé

- PROOF-Gen transforme les échecs du professeur en trajectoires exploitables.
- La méthode récupère 93 % des scénarios échoués sur τ 2-bench.
- Qwen3-4B-Instruct-2507 progresse de 0,132 à 0,529 en Passˆ1.

**Le signal :** PROOF-Gen récupère 93 % des scénarios échoués sur τ 2-bench grâce à une optimisation des consignes par scénario.

**Apple publie PROOF-Gen.** Anh Ta, Junjie Zhu et Shahin Shayandeh présentent PROOF-Gen dans un article publié en août 2026 à la conférence EMNLP. La méthode vise la distillation des capacités d’appel d’outils vers des modèles déployables. Elle intervient après la génération de trajectoires par un modèle professeur. Les chaînes de post-entraînement réexécutent souvent cette étape quotidiennement ou chaque semaine. Chaque cycle mobilise donc le coût du professeur de pointe. Le mécanisme habituel conserve les trajectoires réussies et écarte les autres. PROOF-Gen exploite au contraire les échecs pour produire de nouvelles trajectoires valides. L’article est disponible sur le [site de recherche](https://machinelearning.apple.com/research/proof-gen-optimized-distillation) et sur [arXiv](https://arxiv.org/abs/2608.23911).

**Les échecs concentrent un signal.** Sur τ 2-bench, 57 % des essais du professeur échouent. Deux tiers de ces échecs sont des quasi-réussites. La plupart des appels d’outils restent corrects dans ces cas. Une seule erreur décisive suffit pourtant à faire échouer la tâche. Le filtrage classique élimine alors ces exemples sans exploiter leur contenu. Les mêmes scénarios difficiles peuvent ainsi réapparaître lors des cycles suivants. PROOF-Gen ajoute un réflecteur pour analyser chaque tâche échouée. Celui-ci examine la trace d’exécution et le retour de l’évaluation. Il rédige ensuite des indications correctives adaptées au scénario. Ces indications orientent le professeur vers une trajectoire qui réussit la tâche.

## PROOF-Gen récupère les scénarios échoués

**La consigne disparaît ensuite.** PROOF-Gen retire les indications correctives avant l’entraînement du modèle étudiant. L’étudiant apprend donc à partir de démonstrations propres. Il ne reçoit aucun échafaudage spécifique à la tâche. Cette séparation distingue l’optimisation du scénario de la donnée finalement utilisée. Sur τ 2-bench, l’optimisation par scénario récupère 93 % des scénarios échoués. Les résultats concernent ainsi des cas initialement rejetés par le filtrage. L’approche transforme une trace incorrecte en nouvelle démonstration validée. Elle conserve également l’objectif de distiller des capacités d’appel d’outils. Les auteurs évaluent ensuite des modèles ajustés sur les données combinées. Les gains rapportés portent sur plusieurs modèles et plusieurs protocoles d’évaluation.

**Qwen3 progresse fortement.** Après ajustement sur les données combinées, Qwen3-4B-Instruct-2507 passe de Passˆ1=0,132 à 0,529. Gemma 4 E4B-it gagne 7,2 points de pourcentage sur BFCL v4 multi-tour. Ces résultats mesurent la qualité des trajectoires après l’intégration des exemples récupérés. Le protocole compare donc les performances avant et après l’utilisation des données combinées. L’étude rapporte aussi un déploiement dans une chaîne de production. La qualité des trajectoires y augmente de 6,3 points de pourcentage en achèvement d’objectif. Le transfert atteint ensuite un modèle déployé sur appareil. Son achèvement d’objectif progresse de 1,5 point de pourcentage. Les métriques de qualité des réponses gagnent entre 1,7 et 5,0 points.

## Le transfert atteint un modèle embarqué

**Les gains couvrent chaque locale.** Le transfert vers le modèle déployé reste positif dans toutes les locales évaluées. La moyenne hors anglais progresse de 1,48 point de pourcentage. Ce résultat complète la hausse de 1,5 point observée sur l’achèvement d’objectif. L’article relie ces améliorations au transfert des trajectoires produites après correction. Les indications du réflecteur ne sont toutefois pas conservées dans les données d’apprentissage. Le modèle reçoit uniquement les démonstrations finales jugées réussies. PROOF-Gen s’inscrit dans les travaux récents sur la distillation de modèles de raisonnement. Une publication associée, datée du 9 juillet 2026, étudie la supervision par jetons de la distillation sur politique. Une autre, publiée en 2025 à ICML, propose des lois d’échelle pour répartir le calcul entre professeur et étudiant.
