En résumé
Veo 3.1 combine jusqu’à trois images de référence dans une même scène vidéo.
Le modèle interpole une séquence entre une première et une dernière image fournies.
Les versions rapides réduisent le temps de génération à moins de 60 secondes.
Le signal : Veo 3.1 combine jusqu’à trois images de référence pour maintenir l’identité d’un personnage dans une vidéo générée.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Google présente Veo 3.1 avec plusieurs fonctions destinées à mieux contrôler la génération vidéo. Le modèle accepte désormais jusqu’à trois images de référence pour composer une scène cohérente. Il peut aussi utiliser une première et une dernière image afin d’interpoler une séquence complète. Replicate décrit ces nouveautés dans un guide publié le 16 octobre 2025, accessible sur son article consacré à Veo 3.1. Le service conserve également la génération vidéo à partir d’une seule image. Cette version améliorée suit mieux les instructions textuelles et produit des mouvements plus naturels à partir du contenu visuel fourni.
Les consignes structurent les scènes en précisant le cadrage, le nombre de sujets, la mise au point et l’objectif. Les instructions peuvent aussi définir le style, la position de la caméra et son mouvement. Replicate cite notamment le plan rapproché, le plan large, la mise au point profonde ou réduite, ainsi que le travelling et le panoramique. Ces indications organisent la composition avant de traiter les nouvelles fonctions. Le guide recommande donc de décrire séparément la scène, l’effet optique et le déplacement de caméra. Cette méthode s’applique aux vidéos de science-fiction, de comédie romantique, d’action ou d’animation.
La référence vidéo préserve les identités en combinant jusqu’à trois images d’entrée avec une consigne textuelle. Replicate montre une scène réunissant une femme et un flacon de shampoing dans une vidéo de présentation. Le modèle conserve le personnage et le produit pendant la génération. Une image de référence peut également placer un même personnage dans plusieurs environnements. Le guide cite un personnage d’anime intégré à une scène en prise de vues réelles, puis montré sous la pluie sur le chemin du retour. Cette fonction peut donc réunir un personnage, un produit et un décor dans une seule séquence. Elle vise les récits comportant plusieurs éléments visuels précis.
Les images de début et de fin donnent un cadre plus précis à la trajectoire narrative. L’utilisateur fournit une première image, une dernière image et une instruction décrivant la transformation attendue. Replicate illustre cette fonction avec le passage d’un agneau à un tigre. Un autre exemple montre la transformation d’une pièce. Le modèle génère les étapes intermédiaires entre les deux points fournis. Cette interpolation convient aux vidéos dont le début et la conclusion doivent rester définis. La génération classique à partir d’une seule image reçoit aussi des améliorations. Elle produit des transitions fluides et peut déduire une action cohérente depuis l’image d’entrée.
Les versions rapides réduisent le délai pour tous les points d’accès, sauf la fonction de référence vidéo. Replicate indique une génération en moins de 60 secondes, contre environ 90 secondes pour la version standard. Le prix annoncé correspond approximativement à la moitié de celui de la génération standard. La qualité est légèrement réduite, tout en restant élevée selon le guide. L’API Replicate permet de lancer Veo 3.1 avec JavaScript et de renseigner une image, une consigne, une durée de huit secondes et une définition de 1080p. Elle accepte aussi plusieurs images de référence ou les paramètres de première et dernière image. La réponse renvoie une adresse vidéo exploitable dans une application.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés