Google guide Veo 3.1 avec trois images de référence
Marketing 3 min · 26 septembre 2026

Google guide Veo 3.1 avec trois images de référence

Par Arthur Dekeyser

En résumé

1

Veo 3.1 combine jusqu’à trois images de référence dans une même scène vidéo.

2

Le modèle interpole une séquence entre une première et une dernière image.

3

Les versions rapides réduisent le délai sous 60 secondes et le prix d’environ moitié.

💡

Le signal : Veo 3.1 génère une scène cohérente avec jusqu’à trois images de référence et un prompt textuel.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Google a publié Veo 3.1, un modèle de génération vidéo présenté par Replicate le 16 octobre 2025. La version ajoute deux fonctions principales aux outils vidéo de Google. La première combine jusqu’à trois images de référence dans une scène guidée par un prompt textuel. La seconde utilise une première image et une dernière image pour générer la séquence intermédiaire. Replicate propose aussi des exemples d’utilisation et des appels API pour ces fonctions. La présentation complète les recommandations générales de Replicate sur la composition, les objectifs, le style, la position de caméra et ses mouvements. Veo 3.1 accepte notamment une sortie en 1080p et une durée de huit secondes dans les exemples fournis.

Les prompts cadrent la composition du plan et le nombre de sujets présents. Replicate recommande des formulations comme « single shot », « two shot » ou « over-the-shoulder shot ». Les effets de mise au point peuvent préciser une profondeur faible, une profondeur importante, un objectif macro ou un grand-angle. Le style peut orienter la scène vers la science-fiction, la comédie romantique, le film d’action ou l’animation. Le prompt peut également indiquer un niveau de caméra, un angle en plongée ou contre-plongée, ainsi qu’un travelling, un zoom, un panoramique ou un suivi. Ces paramètres décrivent séparément le cadrage, l’optique, la direction artistique et le mouvement souhaité.

Veo 3.1 combine trois références

Les images préservent un personnage et un produit dans une même vidéo. Replicate montre un exemple avec l’image d’une femme et celle d’un flacon de shampoing, pour produire une vidéo de présentation au format UGC. La fonction peut aussi conserver l’apparence et l’identité d’un personnage dans plusieurs environnements. Un autre exemple place un personnage d’anime dans une scène en prise de vues réelles. Le compte fofrAI a publié un exemple où ce personnage rentre chez lui sous la pluie. Replicate présente cette combinaison d’images et de texte comme un moyen de contrôler des scènes comportant plusieurs éléments visuels précis.

La séquence relie deux images imposées par l’utilisateur. Avec la fonction first and last frame to video, le modèle reçoit une image de départ, une image d’arrivée et un prompt décrivant l’action. Il interpole ensuite les étapes entre ces deux points. Replicate illustre ce procédé avec une transformation d’un agneau en tigre. Un autre exemple montre la transformation d’une pièce. Cette méthode fixe donc le début et la fin d’une séquence, au lieu de fournir uniquement une image initiale. Replicate indique que cette approche convient aux vidéos dont l’arc narratif doit respecter des points de départ et d’arrivée précis, notamment pour des transformations visuelles.

Replicate accélère les générations vidéo

Le modèle améliore également la fonction classique image-vers-vidéo. L’utilisateur fournit une image de départ et un prompt qui décrit le mouvement ou l’action attendue. Replicate indique que Veo 3.1 suit mieux les prompts et produit une qualité améliorée. Le modèle peut aussi raisonner à partir du contenu de l’image fournie. Dans un exemple, une image du siège de Replicate visible sur une carte sert de point de départ à une vidéo montrant ce qui se passe dans ce lieu. Replicate précise qu’aucune transition précise n’a été demandée dans cet exemple. Le modèle a produit une transition jugée cohérente avec les informations de l’image.

Les versions rapides sont disponibles pour tous les points d’accès, sauf la fonction de référence vers vidéo. Replicate annonce un délai inférieur à 60 secondes, contre environ 90 secondes pour la génération standard. Le prix est annoncé à environ la moitié de celui de la version standard. La qualité est légèrement réduite, tout en restant présentée comme élevée. Les exemples JavaScript utilisent l’API Replicate avec le modèle [google](/signal-ia/actu/veo-31-transforme-trois-images-en-video-coherente)/veo-3.1. Ils montrent trois entrées distinctes : une image unique, un tableau de trois images de référence, ou une première et une dernière image. L’API renvoie une adresse vidéo utilisable dans une application.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi