# Apple sauve 93 % des scénarios ratés avec PROOF-Gen

> Apple présente PROOF-Gen, une méthode qui récupère 93 % des scénarios échoués et améliore plusieurs modèles sur des tests d'agents.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-07 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/apple-recupere-93-pourcent-des-scenarios-echoues-avec-proof-gen
Tags : distillation, agents, appel d'outils, modèles, évaluation, inference

---

## En résumé

- PROOF-Gen analyse les échecs des enseignants pour produire des trajectoires corrigées.
- La méthode récupère 93 % des scénarios échoués sur τ2-bench.
- Qwen3-4B-Instruct-2507 progresse de 0,132 à 0,529 en Passˆ1.

**Le signal :** PROOF-Gen récupère 93 % des scénarios échoués sur τ2-bench grâce à une optimisation par scénario.

**Apple publie** PROOF-Gen, une méthode de [distillation](/signal-ia/actu/proof-gen-recupere-93-pourcent-des-scenarios-echoues) destinée aux capacités d’appel d’outils. Les auteurs Anh Ta, Junjie Zhu et Shahin Shayandeh présentent leurs travaux dans le domaine du traitement automatique de la parole et du langage naturel. L’article a été publié en août 2026 et est associé à la conférence EMNLP. La méthode cible la première étape habituelle du réglage supervisé. Cette étape utilise des trajectoires générées par un modèle enseignant. Les modèles déployables apprennent ensuite à reproduire ces démonstrations. Apple décrit un problème récurrent dans ces chaînes de post-entraînement. Elles relancent cette génération chaque jour ou chaque semaine. Chaque cycle réutilise le coût du modèle enseignant avancé.

**Les échecs persistent** Le mécanisme habituel conserve les trajectoires validées par l’enseignant et écarte les autres. Sur τ2-bench, 57 % des essais de l’enseignant échouent. Les deux tiers de ces échecs sont des quasi-réussites. Les appels d’outils sont alors majoritairement corrects, mais une erreur décisive annule le résultat. Ces échecs ne fournissent pas de signal d’apprentissage dans le mécanisme décrit. PROOF-Gen traite chaque tâche échouée séparément. Un réflecteur analyse la trace d’exécution et le retour de l’[évaluation](/signal-ia/actu/ai2-lance-olmo-eval-latelier-qui-compare-les-modeles). Il rédige ensuite des instructions correctives pour guider l’enseignant. Cette guidance est retirée avant l’entraînement de l’élève. Le modèle apprend donc avec des démonstrations sans échafaudage spécifique à la tâche.

## PROOF-Gen corrige les trajectoires échouées

**La récupération atteint** PROOF-Gen récupère 93 % des scénarios échoués sur τ2-bench grâce à l’optimisation par scénario. Les trajectoires corrigées rejoignent ensuite les données utilisées pour le réglage fin. Avec ces données combinées, Qwen3-4B-Instruct-2507 passe de 0,132 à 0,529 sur la mesure Passˆ1. Le résultat compare le modèle réglé avec les données combinées à sa valeur précédente. Apple rapporte aussi un gain de 7,2 points de pourcentage pour Gemma 4 E4B-it sur BFCL v4 en multi-tour. Ces résultats concernent des modèles et des évaluations distincts. Ils mesurent la qualité de trajectoires d’[agents](/signal-ia/actu/harvey-tenet-reussit-presque-deux-fois-plus-de-taches-que-kimi-k3) qui utilisent des outils externes. La méthode conserve ainsi les démonstrations propres après suppression de la guidance corrective.

**Le pipeline progresse** Dans un pipeline déployé, PROOF-Gen augmente de 6,3 points de pourcentage l’achèvement des objectifs. Le transfert vers un modèle déployé sur appareil ajoute 1,5 point de pourcentage sur ce même indicateur. Apple rapporte aussi des gains de 1,7 à 5,0 points sur plusieurs mesures de qualité des réponses. Le transfert positif apparaît dans chaque langue évaluée. La moyenne hors anglais progresse de 1,48 point de pourcentage. Ces chiffres décrivent les résultats rapportés pour le pipeline et le modèle sur appareil. L’article ne présente pas ces gains comme une suppression du coût d’inférence. Il décrit plutôt une récupération de données issues d’échecs de génération.

## Apple mesure les gains sur plusieurs modèles

**La publication détaille** L’article PROOF-Gen est disponible dans la rubrique de recherche d’Apple consacrée à l’apprentissage automatique. La publication présente la méthode comme une optimisation des invites par scénario. Son principe repose sur trois éléments liés à chaque échec. Le réflecteur consulte la trace d’exécution. Il utilise également le retour de l’évaluation. Il formule enfin une guidance destinée à obtenir une trajectoire validée. Cette guidance ne reste pas dans les données finales d’entraînement. Les auteurs évaluent la méthode sur τ2-bench et BFCL v4. Les résultats citent Qwen3-4B-Instruct-2507, Gemma 4 E4B-it et un modèle déployé sur appareil. La version complète est également référencée sur [arXiv](https://arxiv.org/abs/2608.23911). La publication originale est disponible chez [Apple Machine Learning Research](https://machinelearning.apple.com/research/proof-gen-optimized-distillation).
