En résumé
Veo 3.1 combine jusqu’à trois images de référence dans une scène vidéo cohérente.
Le modèle interpole une séquence entre une première image et une dernière image.
Les versions rapides réduisent le temps de génération à moins de 60 secondes.
Le signal : Google Veo 3.1 conserve un personnage et un produit dans une même vidéo à partir de trois images de référence.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Google a lancé Veo 3.1, un modèle de génération vidéo présenté par Replicate le 16 octobre 2025. Sa nouveauté principale combine jusqu’à trois images de référence dans une scène cohérente. Un prompt textuel guide la manière dont les éléments doivent être réunis. Replicate montre notamment une vidéo de type contenu produit, avec une femme et une bouteille de shampoing. Le modèle préserve le personnage et le produit pendant la génération. Cette fonction peut aussi conserver l’apparence d’un personnage dans plusieurs environnements. Un exemple publié par fofr montre un personnage d’anime intégré à une scène en prise de vues réelle. Lire le guide de Replicate.
Les prompts structurent le cadrage, le nombre de sujets et la direction artistique de chaque plan. Replicate recommande des termes comme « single shot », « two shot » ou « over-the-shoulder shot ». Les effets d’objectif peuvent préciser une mise au point courte, profonde ou douce. Les styles peuvent évoquer la science-fiction, la comédie romantique, le film d’action ou l’animation. Le prompt peut également indiquer la position et le mouvement de caméra. Les expressions citées incluent notamment « eye level », « high angle », « dolly shot », « zoom shot » et « tracking shot ». Ces indications servent à guider la composition et les mouvements générés.
La référence vidéo permet d’assembler jusqu’à trois images dans une seule séquence. Replicate présente cette capacité comme un outil de contrôle des éléments visuels d’une scène. Les images peuvent représenter un personnage, un produit et un environnement. Le prompt décrit ensuite l’action ou la relation entre ces éléments. L’exemple du shampoing produit une vidéo de présentation au style contenu utilisateur. La conservation du personnage et de la bouteille est mise en avant dans cette démonstration. Un autre exemple place un personnage d’anime dans une scène réaliste sous la pluie. Replicate indique que cette approche ouvre des possibilités narratives avec des éléments visuels précis.
Les deux images de début et de fin ajoutent un autre niveau de contrôle. Veo 3.1 reçoit une première image, une dernière image et un prompt décrivant la transition. Le modèle interpole alors la séquence entre ces deux points. Replicate illustre cette fonction avec une transformation progressive d’un agneau en tigre. Un autre exemple montre la transformation d’une pièce. Cette méthode convient aux vidéos qui nécessitent un début et une fin déterminés. Elle étend le principe de la génération vidéo depuis une image unique. La durée et la résolution figurent aussi parmi les paramètres utilisés dans les exemples d’appel API.
L’image animée bénéficie également d’améliorations dans Veo 3.1. Cette fonction utilise une seule image de départ et un prompt décrivant l’action souhaitée. Replicate rapporte une meilleure qualité et un suivi plus réactif des instructions. Le modèle peut aussi interpréter le contenu de l’image fournie. Dans un exemple, une image du siège de Replicate sur une carte sert de point de départ. Le prompt demande de montrer ce qui se déroule dans cet endroit. Replicate explique que Veo 3.1 génère une transition fluide sans instruction spécifique sur cette transition. Le modèle produit ainsi un mouvement jugé naturel et cohérent avec l’image initiale.
Les versions rapides sont disponibles sur tous les points d’accès, sauf la référence vidéo. Replicate indique une génération en moins de 60 secondes, contre environ 90 secondes pour la version standard. Le prix est présenté comme environ deux fois inférieur. La qualité est légèrement réduite, tout en restant élevée selon Replicate. L’API JavaScript accepte notamment une image, un prompt, une durée de huit secondes et une résolution de 1080p. Les appels avec plusieurs images utilisent le paramètre reference_images. La fonction première et dernière image utilise first_frame et last_frame. L’API renvoie une URL vidéo exploitable dans une application.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés