# Google rend l’analyse vidéo de Gemini jusqu’à 66 % moins chère

> Google active le mode agentique de Gemini, qui réduit jusqu’à 66 % le coût et 88 % les tokens pour analyser des vidéos longues.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-04 · Signal IA - Order & Chaos · Secteur : Marketing
Source : https://www.orderchaos.eu/signal-ia/actu/google-reduit-jusqua-66-pourcent-le-cout-danalyse-video-de-gemini
Tags : gemini, analyse vidéo, api, productivité, marketing, agents-ia, raisonnement, inference

---

## En résumé

- Google a lancé le mode agentique de Gemini le 1er septembre 2026.
- Le traitement agentique réduit jusqu’à 66 % le coût et 88 % les tokens.
- Gemini peut rechercher des moments précis et détecter des anomalies dans des vidéos longues.

**Le signal :** Gemini 3.7 Flash peut réduire jusqu’à 66 % le coût d’analyse vidéo grâce au mode agentique lancé par Google le 1er septembre 2026.

**Google a lancé** le mode agentique d’analyse vidéo le 1er septembre 2026. Gemini choisit désormais les passages à examiner, la vitesse d’échantillonnage et la modalité utilisée. Le modèle peut sélectionner des images, l’audio ou la transcription selon la question posée. Google annonce jusqu’à 66 % de coût en moins face au traitement statique à une image par seconde. La consommation de tokens baisse jusqu’à 88 %. La précision progresse de 7 % sur les benchmarks cités. Le mode est disponible sur Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. La documentation inclut aussi Gemini 3.8 Flash. L’activation demande seulement le paramètre `processing` réglé sur `agentic` dans l’appel API. [Lire l’article complet](https://www.leptidigital.fr/intelligence-artificielle-ia/gemini-analyser-video-cas-usage-91591/?utm_source=rss&utm_medium=rss&utm_campaign=gemini-analyser-video-91591).

**Le traitement change** par rapport au fonctionnement historique de Gemini. Le mode statique découpait la vidéo à raison d’une image par seconde. Il versait ensuite toutes les images dans le contexte du modèle. Le mode agentique explore plutôt la timeline pendant son raisonnement. Il charge uniquement les segments jugés utiles à la demande. Un appel à un outil interne lui permet de choisir entre frames, audio et transcription. Google indique qu’aucune réécriture du pipeline existant n’est nécessaire. Les deux modes peuvent coexister vidéo par vidéo dans une même requête. Aucun frais de fonctionnalité ne s’ajoute. La tarification token habituelle reste appliquée. Les tokens de navigation sont facturés comme tokens de raisonnement, tandis que les contenus chargés relèvent de l’utilisation d’outils.

## Gemini réduit les coûts vidéo

**Un webinaire de 90 minutes** illustre l’intérêt économique du changement. En basse résolution, le mode statique représente environ 100 tokens par seconde. Une vidéo de 90 minutes atteint ainsi près de 540 000 tokens. En haute résolution, le volume monte à environ 300 tokens par seconde. Le même contenu approche alors 1,6 million de tokens. Ce total dépasse la fenêtre de contexte d’un million de tokens. Avec 88 % de tokens économisés, l’analyse du webinaire pourrait descendre autour de 65 000 tokens. Le coût suit donc davantage la complexité de la question posée que la durée complète du contenu. Google conserve toutefois le statut d’objectif maximal pour ces économies, annoncé sur ses benchmarks.

**Quatre capacités deviennent** particulièrement utiles pour les équipes vidéo et contenu. Gemini peut rechercher un moment à une fraction de seconde près. Cette fonction vise notamment les changements d’état et les limites de plans. Le modèle peut aussi répondre à une question précise dans une vidéo de plusieurs heures. Il peut rééchantillonner une séquence suspecte pour détecter un mouvement rapide ou un artefact visuel. Enfin, il peut compter des actions et des objets distincts au fil du temps. Ces fonctions concernent le dérushage de conférences, la veille sur des présentations et la détection de coupes. Elles peuvent également soutenir le chapitrage, l’extraction de verbatims et le repérage de séquences réutilisables. [Voir les usages détaillés](https://www.leptidigital.fr/intelligence-artificielle-ia/gemini-analyser-video-cas-usage-91591/?utm_source=rss&utm_medium=rss&utm_campaign=gemini-video-usages).

## Le mode statique garde sa place

**Les vidéos courtes** restent un cas distinct selon la documentation de Google. Pour un clip de moins de cinq minutes, la navigation ajoute des appels d’outils. Elle peut donc allonger le temps de première réponse. Le mode statique conserve aussi le découpage avec `start_offset` et `end_offset`. Il permet également de définir une cadence personnalisée en images par seconde. Ces réglages ne sont pas disponibles avec le mode agentique. Les équipes doivent donc conserver deux chemins de traitement lorsqu’elles imposent une fenêtre temporelle ou une cadence précise. En conversation à plusieurs tours sans état, les étapes `processing_call` et `processing_result` doivent être renvoyées dans la requête suivante. Leur oubli peut réduire la qualité des réponses de suivi sans produire d’erreur API. Le test conseillé concerne les contenus de plus de dix minutes via AI Studio.
Pour aller plus loin, consultez notre guide sur [réduire ses coûts grâce à l'IA](/signal-ia/guides/reduire-couts-ia-automatisations-pme-2026).
