Google booste Gemini Nano sur Pixel avec MTP innovant
#gemini 2 min · 14 août 2026

Google booste Gemini Nano sur Pixel avec MTP innovant

Par Arthur Dekeyser

En résumé

1

Google ajoute une tête MTP entraînée séparément aux modèles Gemini Nano v3 figés, sans modifier leur sortie ni leur alignement de sécurité.

2

L'architecture zero-copy économise jusqu'à 130 Mo par instance par rapport à un drafter autonome en réutilisant le cache KV du modèle principal.

3

Sur Pixel 9, les gains atteignent au moins 50 % selon les tâches, avec près de deux tokens correctement prédits en plus par passe en production.

💡

Le signal : Sur Pixel 9, le MTP économise jusqu'à 130 Mo par instance et accélère certaines tâches d'au moins 50 %.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

Google déploie le MTP sur Pixel

Google annonce une architecture capable d’ajouter la prédiction multi-token, ou Multi-Token Prediction (MTP), à des modèles Gemini Nano v3 déjà entraînés et figés. Déployée sur les séries Pixel 9 et Pixel 10, cette méthode accélère l’inférence directement sur l’appareil, sans modifier les capacités ni l’alignement de sécurité du modèle de base.

Sur mobile, les modèles de langage génèrent habituellement le texte de manière autorégressive, un token après l’autre. Cette approche mobilise fortement la bande passante mémoire et limite l’utilisation de la puissance de calcul, dans un contexte marqué par des contraintes strictes de RAM et de consommation énergétique. Le MTP vise notamment les fonctions AI Notification Summaries et Proofread, qui peuvent ainsi générer du texte plus rapidement et avec moins d’énergie.

Un modèle figé, un assistant intégré

La méthode reprend le principe du décodage spéculatif. Un modèle léger propose plusieurs tokens, puis le grand modèle vérifie ces propositions en parallèle. Google remplace toutefois le drafter autonome par une tête Transformer légère, ajoutée aux dernières couches du modèle principal. Cette tête exploite directement les représentations internes et les états cachés déjà calculés par Gemini Nano v3.

Google entraîne uniquement cette tête MTP, tandis que les poids du backbone restent gelés. Les propositions incorrectes étant rejetées lors de la vérification, la sortie finale reste identique, bit par bit, à celle du modèle principal. Cette compatibilité permet d’ajouter un gain d’efficacité sans réentraîner le modèle complet ni créer un modèle de brouillon distinct pour chaque tâche.

Jusqu’à 130 Mo de mémoire économisés

L’architecture dite « zero-copy » permet à la tête MTP d’interroger directement le cache KV du modèle principal, au lieu de conserver son propre historique. Elle supprime ainsi le temps de préremplissage du drafter et réduit son empreinte mémoire. Google observe une économie de 130 Mo par instance par rapport à un drafter autonome, notamment grâce à la suppression de tables d’embedding, de variantes d’attention et de paramètres de réglage spécifiques aux applications.

Dans les essais menés sur Pixel 9, les drafters MTP ont fourni des prédictions plus précises que des drafters autonomes de taille comparable, avec des accélérations d’au moins 50 % selon les tâches. En production, dans AI Notification Summaries et Proofread, le système prédit correctement près de deux tokens supplémentaires par passe d’inférence. Google prévoit d’intégrer le MTP à de futurs appareils Pixel et d’explorer aussi le décodage parallèle ainsi que des architectures sans tête auxiliaire.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi