# Avec IVT, Apple accélère de plus de cinq fois l’analyse vidéo

> Apple présente IVT, une méthode qui internalise la prédiction visuelle durant l’entraînement et réduit de plus de cinq fois la latence face à Visual CoT.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-10 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/apple-reduit-de-plus-de-cinq-fois-la-latence-video-avec-ivt
Tags : vision par ordinateur, vidéo, raisonnement, modèles multimodaux, apple, inference

---

## En résumé

- Apple présente IVT pour raisonner sur des vidéos partiellement observées.
- La méthode prédit des représentations latentes de futures images pendant l’entraînement.
- IVT réduit la latence de bout en bout de plus de cinq fois face à Visual CoT.

**Le signal :** IVT réduit de plus de 5× la latence de bout en bout face à Visual CoT, selon l’étude publiée par Apple en août 2026.

**Apple publie** une étude sur Internalized Visual Thinking, ou IVT, un cadre de post-entraînement pour le raisonnement vidéo proactif. Les auteurs sont Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel et Joerg Liebelt. L’étude a été publiée en août 2026 dans les domaines de la [vision par ordinateur](/signal-ia/actu/apple-reduit-de-plus-de-5-fois-la-latence-video-avec-ivt), des méthodes et des algorithmes. IVT vise les modèles multimodaux qui analysent des environnements spatiaux, temporels et incarnés. La méthode apprend à anticiper des éléments vidéo durant l’entraînement. À l’inférence, elle produit directement une réponse textuelle. Elle ne synthétise donc pas de futures images pour répondre.

**Visual CoT génère** des images intermédiaires pour soutenir le [raisonnement](/signal-ia/actu/ivt-de-xiaoyu-zhu-bat-le-visual-cot-plus-de-5-fois) visuel. Cette approche fournit un mécanisme de prévision visuelle, mais elle augmente fortement le coût d’inférence. L’étude cible particulièrement le raisonnement vidéo proactif, qui repose sur une observation partielle d’une séquence. IVT propose une autre organisation du calcul. Le modèle apprend à représenter des images futures sans les produire explicitement au moment de la réponse. Les auteurs formulent ainsi une question précise sur l’apprentissage du raisonnement visuel. Un modèle peut-il apprendre cette capacité durant son entraînement, puis raisonner directement pendant l’inférence ? Les expériences présentées évaluent cette hypothèse à travers plusieurs choix techniques.

## Apple entraîne IVT sur des vidéos

**La méthode prédit** deux sorties à partir d’une vidéo partiellement observée. Elle prédit des représentations latentes de futures images et la réponse textuelle attendue. L’optimisation combine donc la prédiction textuelle et la prédiction de l’incorporation suivante. Les vidéos utilisées pour cette étape sont non annotées. Selon l’étude, cet apprentissage encourage le modèle à capturer le mouvement, les transitions d’objets, les interactions et l’intention latente. Ces éléments décrivent des changements qui peuvent apparaître après la portion observée. IVT conserve ces informations sous forme interne. Pendant l’inférence, le système génère la réponse sans synthétiser ni réencoder les futures images. L’architecture évite ainsi le passage explicite par les pixels futurs.

**Les auteurs testent** plusieurs configurations dans des études contrôlées. Ils comparent différentes représentations cibles et plusieurs conceptions de décodeurs. Ils examinent aussi les horizons de prédiction, les mélanges de données et les programmes d’entraînement. Les objectifs prédictifs font également partie des variables étudiées. IVT améliore le post-entraînement textuel dans les six configurations d’évaluation rapportées. L’étude indique que cette amélioration conserve le même chemin d’inférence efficace. Les résultats concernent donc à la fois la qualité mesurée et le mode de calcul utilisé pour produire la réponse. [Apple](/signal-ia/actu/apple-bouscule-la-synthese-video-avec-lvsum) présente ces expériences dans [sa publication de recherche](https://machinelearning.apple.com/research/internalized-visual-thinking), publiée en août 2026.

## IVT réduit la latence face à Visual CoT

**La comparaison montre** des résultats comparables ou supérieurs à Visual CoT, selon les évaluations de l’étude. IVT réduit aussi la latence de bout en bout de plus de cinq fois face à cette méthode. Cette mesure concerne le chemin complet d’inférence. Visual CoT synthétise et réencode des images intermédiaires pour raisonner. IVT répond directement après avoir internalisé les prédictions visuelles durant l’entraînement. Les auteurs associent ces résultats à une conclusion précise. La génération explicite dans l’espace des pixels ne serait pas nécessaire pour le raisonnement vidéo proactif. Ils proposent plutôt d’internaliser la modélisation prédictive du monde. L’article complet est disponible sur [arXiv](https://arxiv.org/abs/2608.15869).
