# Apple transforme 93 % des échecs en données utiles

> Apple présente PROOF-Gen, une méthode qui récupère 93 % des scénarios échoués et améliore les performances d’agents capables d’utiliser des outils.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-15 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/apple-devoile-proof-gen-qui-recupere-93-pourcent-des-echecs
Tags : agents, distillation, outils, modèles, données, inference

---

## En résumé

- PROOF-Gen transforme les échecs du professeur en trajectoires utilisables pour entraîner l’élève.
- La méthode récupère 93 % des scénarios échoués sur τ 2-bench.
- Qwen3-4B-Instruct-2507 progresse de 0,132 à 0,529 en Passˆ1.

**Le signal :** PROOF-Gen récupère 93 % des scénarios échoués sur τ 2-bench grâce à une optimisation de prompt par scénario.

**Apple présente PROOF-Gen** dans un article accepté à EMNLP et publié en août 2026. La méthode vise la [distillation](/signal-ia/actu/proof-gen-recupere-93-pourcent-des-scenarios-echoues) des capacités d’appel d’outils vers des modèles déployables. Les auteurs Anh Ta, Junjie Zhu et Shahin Shayandeh décrivent une optimisation de prompt par scénario. Sur τ 2-bench, 57 % des essais du modèle professeur échouent. Parmi ces échecs, deux tiers sont des quasi-réussites. Les appels d’outils sont alors majoritairement corrects, mais une erreur décisive fait échouer la tâche. Le pipeline standard conserve seulement les trajectoires réussies. Il écarte donc les traces capables d’indiquer précisément ce qui doit être corrigé. [Lire l’article d’Apple](https://machinelearning.apple.com/research/proof-gen-optimized-distillation) et [la publication sur arXiv](https://arxiv.org/abs/2608.23911).

**Le filtrage laisse des cas difficiles** derrière lui. Les pipelines d’entraînement postérieur qui produisent des agents utilisant des outils répètent cette étape quotidiennement ou chaque semaine. Chaque répétition mobilise le coût du modèle professeur avancé. Pourtant, le mécanisme reste fondé sur la génération puis le filtrage. Les trajectoires validées sont gardées, tandis que les autres sont supprimées. Les scénarios difficiles peuvent donc réapparaître lors des cycles suivants. PROOF-Gen traite ces échecs comme des traces exploitables. Pour chaque tâche ratée, un réflecteur examine la trace d’exécution et le retour de l’[évaluation](/signal-ia/actu/apple-recupere-93-pourcent-des-scenarios-echoues-avec-proof-gen). Il rédige ensuite une consigne corrective destinée au modèle professeur.

## PROOF-Gen corrige les trajectoires échouées

**La consigne guide le professeur** vers une nouvelle trajectoire réussie. Cette indication reste toutefois absente des données finales utilisées pour l’entraînement. Elle est retirée avant la phase de fine-tuning. L’élève apprend ainsi à partir de démonstrations propres, sans échafaudage spécifique à la tâche. Sur τ 2-bench, l’optimisation par scénario récupère 93 % des scénarios échoués. Les résultats concernent des modèles entraînés sur les données combinées. Qwen3-4B-Instruct-2507 passe de Passˆ1=0,132 à 0,529. Cette mesure compare la réussite au premier essai. Le résultat associe donc la récupération des échecs à une progression mesurée sur ce banc d’essai précis.

**Gemma 4 E4B-it progresse aussi** sur une autre évaluation. Le modèle gagne 7,2 points de pourcentage sur BFCL v4 en mode multi-tour. Cette mesure porte sur des échanges comportant plusieurs appels ou étapes. Dans un pipeline déployé, PROOF-Gen augmente la réalisation des objectifs de 6,3 points. La méthode est également transférée vers un modèle déployé sur appareil. Celui-ci gagne 1,5 point de réalisation des objectifs. Les indicateurs de qualité des réponses progressent de 1,7 à 5,0 points. Le transfert est positif dans chaque langue évaluée. La moyenne des gains hors anglais atteint 1,48 point de pourcentage.

## Apple mesure le transfert vers l’appareil

**Le déploiement confirme plusieurs gains** dans le pipeline étudié par Apple. La qualité des trajectoires augmente de 6,3 points pour la réalisation des objectifs. Le modèle sur appareil reçoit ensuite ce bénéfice avec 1,5 point supplémentaire. Les mesures de qualité des réponses affichent des hausses comprises entre 1,7 et 5,0 points. Les résultats hors anglais atteignent 1,48 point en moyenne. PROOF-Gen s’inscrit dans les travaux d’Apple sur les [agents](/signal-ia/actu/apple-devoile-agent-seer-le-testeur-doutils-mcp) utilisant des outils. Un article connexe, Agent Seer, porte sur la synthèse de scénarios à partir de spécifications. Un autre travail étudie les lois d’échelle de la distillation depuis juillet 2025.
