# Google booste Gemini Nano sur Pixel avec MTP innovant

> Google déploie une architecture MTP sur les Pixel 9 et 10 pour accélérer Gemini Nano, réduire la mémoire utilisée et limiter la consommation énergétique.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-14 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/google-accelere-gemini-nano-sur-pixel-avec-le-mtp
Tags : google, gemini nano, pixel, inférence, mt​​p, gemini, inference

---

## En résumé

- Google ajoute une tête MTP entraînée séparément aux modèles Gemini Nano v3 figés, sans modifier leur sortie ni leur alignement de sécurité.
- L'architecture zero-copy économise jusqu'à 130 Mo par instance par rapport à un drafter autonome en réutilisant le cache KV du modèle principal.
- Sur Pixel 9, les gains atteignent au moins 50 % selon les tâches, avec près de deux tokens correctement prédits en plus par passe en production.

**Le signal :** Sur Pixel 9, le MTP économise jusqu'à 130 Mo par instance et accélère certaines tâches d'au moins 50 %.

## Google déploie le MTP sur Pixel

Google annonce une architecture capable d'ajouter la prédiction multi-token, ou Multi-Token Prediction (MTP), à des modèles [Gemini Nano v3](/signal-ia/actu/gemini-3-un-modele-dia-de-google) déjà entraînés et figés. Déployée sur les séries Pixel 9 et Pixel 10, cette méthode accélère l'inférence directement sur l'appareil, sans modifier les capacités ni l'alignement de sécurité du modèle de base.

Sur mobile, les modèles de langage génèrent habituellement le texte de manière autorégressive, un token après l'autre. Cette approche mobilise fortement la bande passante mémoire et limite l'utilisation de la puissance de calcul, dans un contexte marqué par des contraintes strictes de RAM et de consommation énergétique. Le MTP vise notamment les fonctions AI Notification Summaries et Proofread, qui peuvent ainsi générer du texte plus rapidement et avec moins d'énergie.

## Un modèle figé, un assistant intégré

La méthode reprend le principe du décodage spéculatif. Un modèle léger propose plusieurs tokens, puis le grand modèle vérifie ces propositions en parallèle. Google remplace toutefois le drafter autonome par une tête Transformer légère, ajoutée aux dernières couches du modèle principal. Cette tête exploite directement les représentations internes et les états cachés déjà calculés par [Gemini Nano v3](/signal-ia/actu/gemini-3-un-modele-dia-de-google).

Google entraîne uniquement cette tête MTP, tandis que les poids du backbone restent gelés. Les propositions incorrectes étant rejetées lors de la vérification, la sortie finale reste identique, bit par bit, à celle du modèle principal. Cette compatibilité permet d'ajouter un gain d'efficacité sans réentraîner le modèle complet ni créer un modèle de brouillon distinct pour chaque tâche.

## Jusqu'à 130 Mo de mémoire économisés

L'architecture dite « zero-copy » permet à la tête MTP d'interroger directement le cache KV du modèle principal, au lieu de conserver son propre historique. Elle supprime ainsi le temps de préremplissage du drafter et réduit son empreinte mémoire. Google observe une économie de 130 Mo par instance par rapport à un drafter autonome, notamment grâce à la suppression de tables d'embedding, de variantes d'attention et de paramètres de réglage spécifiques aux applications.

Dans les essais menés sur Pixel 9, les drafters MTP ont fourni des prédictions plus précises que des drafters autonomes de taille comparable, avec des accélérations d'au moins 50 % selon les tâches. En production, dans AI Notification Summaries et Proofread, le système prédit correctement près de deux tokens supplémentaires par passe d'inférence. Google prévoit d'intégrer le MTP à de futurs appareils Pixel et d'explorer aussi le décodage parallèle ainsi que des architectures sans tête auxiliaire.
