Apple compresse ses modèles d’IA de 2,8 à 1,3 milliard
3 min · 28 août 2026

Apple compresse ses modèles d’IA de 2,8 à 1,3 milliard

Par Arthur Dekeyser

En résumé

1

Apple propose un pipeline intégré combinant préentraînement élargi, élagage et récupération.

2

La méthode compresse des modèles de 2,8 milliards à 1,3 milliard de paramètres.

3

Les expériences utilisent jusqu’à 2 000 milliards de tokens pendant le préentraînement.

💡

Le signal : IDEA Prune compresse des modèles de 2,8B à 1,3B avec jusqu’à 2T tokens préentraînés.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Apple publie une méthode Le 28 août 2026, Apple présente IDEA Prune, un pipeline intégré pour le préentraînement de modèles de langage génératifs. Les auteurs sont Yixiao Li, Xianzhi Du, Ajay Jaiswal, Tao Lei, Tuo Zhao, Chong Wang et Jianyu Wang. L’article porte sur les méthodes et algorithmes appliqués au traitement du langage naturel. Il étudie l’élargissement d’un modèle, son élagage structuré, puis sa récupération. L’objectif est de produire un modèle compressé adapté à des budgets d’inférence limités. Les travaux ont été réalisés par des chercheurs associés à Apple, Georgia Institute of Technology et University of Texas at Austin. Lire la présentation d’Apple et consulter l’article sur arXiv.

Le pipeline pose deux questions IDEA Prune examine d’abord l’intérêt de préentraîner un modèle élargi, même lorsque ce modèle ne doit jamais être déployé. L’étude analyse ensuite l’optimisation de l’ensemble du parcours, plutôt que chaque étape séparément. Les auteurs décrivent les pipelines d’élagage structuré comme une approche prometteuse pour améliorer l’efficacité en tokens. Cette approche est comparée à l’entraînement direct d’un modèle de taille cible. Le modèle élargi sert ensuite de base à la suppression de paramètres. L’article traite donc simultanément le préentraînement, la compression et la récupération. Les auteurs relient cette organisation à la recherche de modèles plus efficaces sous contrainte de calcul pendant l’inférence.

Apple combine trois étapes

Une planification unique structure l’entraînement Le pipeline combine l’entraînement du modèle élargi, l’élagage et la récupération sous un seul calendrier d’apprentissage cosine annealing. Les auteurs proposent aussi une méthode d’élagage structuré itératif. Cette méthode retire progressivement les paramètres au lieu de les supprimer en une seule opération. Selon l’article, cette combinaison atténue la perte de connaissances associée à la hausse du taux d’apprentissage dans les pipelines d’élargissement et d’élagage naïfs. Elle permet également une redistribution de la capacité entre les neurones conservés. Le processus vise ainsi une compression progressive et une meilleure performance des modèles élagués. Ces mécanismes constituent les deux éléments méthodologiques centraux présentés dans IDEA Prune.

Les essais portent sur deux tailles Les expériences compressent des modèles de 2,8 milliards de paramètres vers des modèles de 1,3 milliard de paramètres. Le préentraînement utilise jusqu’à 2 000 milliards de tokens. L’étude indique que l’approche intégrée fournit des résultats sur l’efficacité en tokens du préentraînement d’un modèle élargi. Elle rapporte aussi une performance supérieure pour les modèles élagués. Le protocole compare donc une trajectoire incluant un modèle élargi avec la production d’un modèle cible. Les travaux ne décrivent pas seulement la suppression de paramètres. Ils évaluent le pipeline complet, depuis l’entraînement initial jusqu’à la récupération. Les résultats présentés concernent précisément la compression de 2,8B vers 1,3B.

IDEA Prune mesure l’efficacité

Le modèle compressé devient la cible L’article positionne le modèle élagué comme le résultat final du pipeline, tandis que le modèle élargi intervient pendant le préentraînement. Cette distinction répond à la question de l’intérêt d’un modèle intermédiaire non destiné au déploiement. Les auteurs associent leur méthode à une réduction progressive des paramètres et à une redistribution de capacité parmi les neurones survivants. Les expériences indiquent une performance supérieure des modèles élagués avec l’approche intégrée. Elles fournissent également des éléments sur l’efficacité en tokens du préentraînement élargi. La publication est classée dans les méthodes et algorithmes ainsi que dans le traitement du langage naturel, avec des auteurs ayant travaillé à Apple.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi