# Google accélère Gemini Nano sur les Pixel 9 et 10

> Google déploie une architecture MTP sur les Pixel 9 et 10 pour accélérer Gemini Nano, réduire la mémoire utilisée et préserver les sorties du modèle.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-24 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/google-accelere-gemini-nano-de-50-pourcent-sur-les-pixel-9
Tags : gemini nano, pixel, inférence locale, optimisation, google, gemini, inference

---

## En résumé

- Google ajoute une tête MTP aux modèles Gemini Nano v3 déjà entraînés.
- L’architecture zero-copy économise jusqu’à 130 Mo par instance face à un générateur séparé.
- Les Pixel 9 et 10 prédisent près de deux jetons supplémentaires par passe en production.

**Le signal :** Sur Pixel 9, MTP accélère la génération d’au moins 50 % selon la tâche et économise jusqu’à 130 Mo par instance.

**Google déploie MTP** le 26 juin 2026 sur les modèles [Gemini Nano](/signal-ia/actu/google-accelere-gemini-nano-sur-pixel-avec-le-mtp) v3 déjà utilisés en production. L’architecture équipe progressivement les séries Pixel 9 et Pixel 10. Elle ajoute une tête légère de prédiction multi-jetons au modèle principal, dont les paramètres restent gelés. Google présente cette méthode comme une optimisation de l’inférence sur appareil. Les fonctions AI Notification Summaries et Proofread génèrent ainsi du texte plus rapidement et avec une consommation énergétique réduite. Les sorties finales restent identiques au modèle principal, car les prédictions incorrectes sont rejetées pendant la vérification. Le déploiement conserve donc la compatibilité avec les capacités et l’alignement de sécurité existants.

**Les téléphones limitent l’inférence** par leur budget énergétique et leur mémoire vive disponible. Les modèles de langage classiques produisent un seul jeton par étape. Cette génération autorégressive sous-utilise alors la puissance de calcul et sollicite la bande passante mémoire. Le décodage spéculatif sépare habituellement la rédaction et la vérification. Un petit modèle autonome propose plusieurs jetons, puis le grand modèle les vérifie en parallèle. [Google](/signal-ia/actu/google-deepmind-gemini-robotics-2-bouscule-la-robotique) cite toutefois une concurrence pour la mémoire vive avec un générateur autonome de 128 millions de paramètres. Ce générateur reste aussi séparé de l’état interne riche déjà calculé par le modèle principal.

## Google intègre la prédiction au modèle

**La tête MTP réutilise** les représentations finales du modèle principal. Elle prédit autorégressivement une séquence de jetons futurs à partir des activations déjà calculées. Google l’entraîne après avoir gelé les poids d’un modèle [Gemini](/signal-ia/actu/gemini-36-flash-ecrase-les-couts-acces-gratuit-et-hooks-inclus) Nano v3 entièrement formé. Seuls les paramètres de la pile Transformer ajoutée sont optimisés pour réduire l’erreur sur les jetons futurs. Cette méthode évite de réentraîner le modèle de base. L’architecture zero-copy permet aussi à la tête MTP d’interroger directement le cache clé-valeur du modèle principal. Elle ne conserve donc pas son propre historique. Google indique une économie de 130 Mo par instance face à un générateur autonome.

**Les résultats dépassent 50 %** sur les appareils Pixel 9, selon la tâche et par rapport à des générateurs autonomes de taille comparable. Google attribue cet écart à l’accès de MTP aux représentations internes du modèle principal. Sur les tâches de résumé ou de réécriture avec contraintes complexes, les générateurs MTP ont nettement surpassé les générateurs autonomes ajustés. Pour les réponses intelligentes, la tête MTP a atteint jusqu’à 55 % d’amélioration de l’acceptation des jetons. En production, notamment pour les résumés de notifications et Proofread, elle prédit correctement près de deux jetons supplémentaires par passe. Ces résultats réduisent aussi le nombre d’étapes de vérification.

## Google explore plusieurs architectures

**Google prépare la suite** de ce travail pour de futurs appareils Pixel. L’équipe étudie notamment le décodage parallèle et des méthodes sans têtes auxiliaires. Elle cherche à réduire davantage la latence de rédaction et à vérifier simultanément davantage de jetons. Google examine aussi des techniques capables d’explorer plusieurs branches lorsque la génération de langage reste ambiguë. Le système actuel suppose une seule trajectoire future optimale. Une exploration parallèle pourrait augmenter la probabilité d’accepter des séquences plus longues dans les contextes incertains. L’équipe étudie enfin une vérification moins stricte pour certains usages, en relâchant la correspondance exacte entre prédiction et résultat vérifié.

Source originale : [Google Research](https://research.google/blog/accelerating-gemini-nano-models-on-pixel-with-frozen-multi-token-prediction/). Les travaux précédents sur [Gemma 4 et MTP](https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/) et la documentation de [Gemini Nano](https://developer.android.com/ai/gemini-nano) complètent cette annonce.
