En résumé
IVT apprend à prédire des représentations latentes de futures images vidéo.
La méthode produit directement une réponse sans générer ni réencoder les images futures.
IVT dépasse le post-entraînement textuel dans les six configurations évaluées.
Le signal : IVT réduit de plus de 5 fois la latence de bout en bout face au Visual CoT.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Xiaoyu Zhu et ses coauteurs présentent Internalized Visual Thinking, ou IVT, un cadre de post-entraînement destiné au raisonnement vidéo proactif. L’équipe décrit cette méthode dans une publication datée d’août 2026. IVT apprend à un modèle multimodal à raisonner visuellement pendant son entraînement, puis à répondre directement pendant l’inférence. Le travail porte sur des vidéos partiellement observées et sur la prédiction de réponses textuelles. Il vise des situations nécessitant une compréhension spatiale, temporelle ou incarnée. Les auteurs indiquent que leur approche évite la génération d’images intermédiaires au moment de répondre. La publication est disponible sur le site de recherche d’Apple et sur arXiv.
Le Visual CoT génère des images intermédiaires pour soutenir le raisonnement visuel. Cette stratégie offre un mécanisme de projection visuelle, mais elle ajoute un coût d’inférence important. Ce coût pénalise particulièrement le raisonnement vidéo proactif, selon les auteurs. IVT déplace cette capacité de prédiction vers la phase d’apprentissage. Le cadre optimise conjointement la prédiction textuelle et la prédiction du prochain plongement sur des vidéos non annotées. À partir d’une séquence partielle, le modèle prédit des représentations latentes de futures images. Il prédit aussi la réponse textuelle attendue. L’objectif est d’intégrer les mouvements, les transitions d’objets, les interactions et l’intention latente dans le raisonnement du modèle.
Les représentations latentes remplacent les pixels pendant l’inférence. IVT génère la réponse sans synthétiser ni réencoder les images futures. Les auteurs ont étudié plusieurs représentations cibles et plusieurs architectures de décodeur. Ils ont également comparé différents horizons de prédiction, mélanges de données et programmes d’entraînement. Les objectifs prédictifs ont eux aussi fait partie des études contrôlées. Cette série d’expériences examine donc les principaux choix nécessaires au fonctionnement de la méthode. Le principe reste identique dans ces variantes. Le modèle apprend à anticiper des états visuels futurs, tout en produisant la réponse textuelle associée à une vidéo partiellement observée.
Les six évaluations favorisent IVT par rapport au post-entraînement textuel, d’après les résultats rapportés. La méthode conserve le même chemin d’inférence efficace dans les six configurations évaluées. Face au Visual CoT, IVT obtient des performances comparables ou supérieures. Les auteurs mesurent aussi une réduction de plus de cinq fois de la latence de bout en bout. Cette comparaison porte donc simultanément sur la qualité de réponse et le temps nécessaire à l’inférence. Les résultats soutiennent l’hypothèse selon laquelle la génération explicite de pixels pendant l’inférence n’est pas indispensable au raisonnement vidéo proactif. Le modèle internalise plutôt la prédiction pendant son entraînement.
Le cadre formalise un modèle prédictif entraîné sur des vidéos non annotées. Il associe la prédiction du prochain plongement à la prédiction textuelle, au lieu de produire des images futures visibles. Les auteurs relient cette optimisation à la capture de mouvements, de transitions d’objets, d’interactions et d’intentions latentes. Leur conclusion est précise : la modélisation prédictive du monde peut être internalisée pendant l’entraînement. Elle peut ainsi produire des raisonneurs multimodaux plus exacts et sensiblement plus efficaces. Les résultats rapportés concernent les six cadres d’évaluation étudiés. La publication positionne IVT comme une alternative au Visual CoT pour le raisonnement vidéo proactif.
Xiaoyu Zhu, Xinke Deng et leurs coauteurs détaillent cette approche dans l’article publié en août 2026. L’équipe comprend aussi Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel et Joerg Liebelt. Le travail relève de la vision par ordinateur et des méthodes et algorithmes. Les prochaines analyses décrites dans l’article portent sur les représentations cibles, les décodeurs, les horizons, les mélanges de données, les curricula et les objectifs prédictifs. Ces axes structurent les études contrôlées présentées. Le résultat central reste mesuré : IVT égale ou dépasse Visual CoT selon les évaluations rapportées, avec une latence de bout en bout réduite de plus de cinq fois.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés