En résumé
Google introduit le Multi-Token Prediction sur les modèles Gemini Nano.
Les dispositifs Pixel 9 et 10 intègrent cette technologie pour une meilleure efficacité.
Une économie de mémoire de 130MB par instance est réalisée.
Le signal : L'architecture MTP sur Pixel 9 permet une économie de mémoire de 130MB par instance.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Google a récemment intégré le Multi-Token Prediction (MTP) dans ses modèles Gemini Nano pour les dispositifs Pixel 9 et 10. Cette technologie permet aux modèles de langage de réaliser des prédictions sur plusieurs tokens simultanément, accélérant ainsi les processus d’inférence sur appareil. Cela se traduit par une consommation d’énergie réduite et une expérience utilisateur améliorée. En réduisant la latence, cette nouveauté permet d’activer plus vite des fonctionnalités comme les résumés de notifications AI et la relecture de messages importants sans exploiter externe de données personnelles.
Un progrès dans l’efficacité mobile Les téléphones mobiles, contrairement aux serveurs, fonctionnent avec des limitations strictes en mémoire et en énergie. Pour contrer cela, l’architecture MTP réutilise les états cachés du modèle principal, réduisant la mémoire requise par de précédents systèmes. Un fait marquant est l’économie de 130MB par instance grâce à une architecture zéro-copie, où le MTP utilise directement le cache du modèle principal. Ce progrès a permis des améliorations de performance significatives, telles qu’une augmentation de vitesse jusqu’à 50% pour certaines tâches sur Pixel 9.
L’innovation derrière les chiffres est la capacité du MTP à générer des structures textuelles prévisibles et d’exécuter des tâches complexes plus efficacement grâce à un accès direct aux représentations riches du modèle principal. Cette méthode élimine le recours à un modèle séparé pour la génération, évitant ainsi les redondances coûteuses en ressources. La possibilité de mettre à jour en arrière-plan ces modèles déjà déployés sans affecter leur fiabilité a été validée par les différentes applications sur les dispositifs Pixel récents.
L’intégration réussie du MTP sur les dispositifs Pixel a permis de réduire la nécessité des étapes de vérification, améliorant encore l’efficacité. Google prévoit d’étendre cette technologie à de futurs appareils Pixel, tout en explorant de nouvelles architectures pour réduire davantage la latence de rédaction tout en augmentant la vérification simultanée de tokens. Les recherches en cours visent également à mieux gérer l’ambiguïté inhérente à la génération de langage. Les développements futurs pourraient inclure la possibilité pour le modèle d’explorer des trajectoires alternatives en parallèle, maximisant ainsi les chances d’accepter des séquences longues même dans des contextes incertains. Pour en savoir plus, consultez le blog de Google.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs
On utilise des cookies de mesure d'audience (Google Analytics, Meta, PostHog) pour comprendre ce qui t'intéresse et améliorer le site. Tu décides. En savoir plus