Apple accélère plus de cinq fois le raisonnement vidéo
3 min · 25 août 2026

Apple accélère plus de cinq fois le raisonnement vidéo

Par Arthur Dekeyser

En résumé

1

Apple présente IVT pour raisonner sur des vidéos partiellement observées.

2

La méthode prédit des représentations latentes de futures images pendant l’entraînement.

3

IVT atteint des performances comparables ou supérieures à Visual CoT avec une latence réduite de plus de 5 fois.

💡

Le signal : IVT réduit de plus de 5 fois la latence de bout en bout par rapport à Visual CoT, selon l’étude d’Apple.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Apple présente IVT dans une étude publiée en août 2026 sur le raisonnement vidéo proactif. La méthode, appelée Internalized Visual Thinking, cherche à permettre aux modèles de réfléchir visuellement pendant leur entraînement. À l’inférence, elle produit directement une réponse textuelle à partir d’une vidéo partiellement observée. Elle ne génère donc pas d’images intermédiaires futures. L’étude est signée Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel et Joerg Liebelt. Apple décrit cette approche dans sa publication de recherche. Le document est également disponible sur arXiv. La recherche relève de la vision par ordinateur ainsi que des méthodes et algorithmes.

Visual CoT coûte davantage car il produit des images de raisonnement intermédiaires avant la réponse finale. Cette génération ajoute une étape d’inférence et peut devenir problématique pour le raisonnement vidéo proactif. Les auteurs posent donc une question précise. Un modèle peut-il apprendre à anticiper visuellement pendant l’entraînement, puis raisonner directement pendant l’inférence ? IVT répond à cette question en combinant deux objectifs. Le premier concerne la prédiction textuelle. Le second concerne la prédiction de l’embedding suivant sur des vidéos non étiquetées. Le modèle apprend ainsi à représenter des mouvements, des transitions d’objets, des interactions et une intention latente, sans synthétiser de futures images au moment de répondre.

IVT prédit les états futurs

La méthode anticipe implicitement les représentations de futures images à partir d’une séquence partiellement observée. Elle associe cette prédiction latente à la réponse textuelle attendue. Les auteurs évaluent plusieurs choix de représentation cible, architectures de décodeur, horizons de prédiction, mélanges de données, programmes d’entraînement et objectifs prédictifs. Ces études contrôlées examinent donc la contribution de différents composants d’IVT. La méthode ne dépend pas d’une génération explicite en espace pixel pendant l’inférence. Le modèle conserve plutôt un chemin de réponse direct. Cette conception vise le raisonnement sur les mouvements, les changements d’état des objets et les interactions observables dans une vidéo partiellement connue.

Les six évaluations montrent qu’IVT dépasse le post-entraînement fondé uniquement sur le texte dans les six configurations étudiées. L’étude précise que cette amélioration conserve le même chemin d’inférence efficace. La comparaison avec Visual CoT donne aussi un résultat central. IVT obtient des performances comparables ou supérieures, tout en réduisant de plus de cinq fois la latence de bout en bout. Cette mesure concerne directement le coût temporel de la génération et du réencodage d’images futures. Les auteurs ne présentent pas un chiffre absolu de latence. Ils rapportent un facteur relatif supérieur à cinq entre les deux approches testées.

Visual CoT reste plus coûteux

Les auteurs remettent en cause la nécessité d’une génération explicite de pixels pendant l’inférence. Leur conclusion porte sur le raisonnement vidéo proactif, et non sur tous les usages des modèles multimodaux. Selon l’étude, un modèle peut internaliser un modèle prédictif du monde pendant son post-entraînement. Il peut ensuite répondre sans produire ni réencoder les images futures. Cette architecture associe donc une anticipation visuelle apprise à une sortie textuelle directe. Les résultats rapportés concernent les six paramètres d’évaluation étudiés et la comparaison avec Visual CoT. Ils suggèrent une voie où l’efficacité d’inférence accompagne une performance comparable ou meilleure.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi