# Google fait de trois images une scène vidéo cohérente

> Veo 3.1 accepte jusqu’à trois images de référence et deux images clés, avec une version rapide annoncée sous 60 secondes par Replicate.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-25 · Signal IA - Order & Chaos · Secteur : Marketing
Source : https://www.orderchaos.eu/signal-ia/actu/veo-31-unifie-trois-images-en-video-coherente
Tags : génération vidéo, google, replicate, création de contenu

---

## En résumé

- Veo 3.1 combine jusqu’à trois images de référence dans une scène vidéo cohérente.
- Le modèle interpole une séquence entre une première image et une dernière image.
- Les versions rapides réduisent le temps de génération à moins de 60 secondes.

**Le signal :** Veo 3.1 combine jusqu’à trois images de référence pour préserver un personnage et un produit dans une même vidéo.

**[Replicate](/signal-ia/actu/google-lance-veo-31-avec-des-fonctionnalites-de-generation-video) présente Veo 3.1** comme un modèle vidéo de Google doté de nouvelles fonctions de contrôle. L’outil accepte désormais jusqu’à trois images de référence pour composer une scène cohérente. Il prend aussi une première image et une dernière image afin d’interpoler une séquence complète. Replicate a publié son guide de prise en main le 16 octobre 2025. La plateforme propose [Veo 3.1](https://replicate.com/blog/veo-3-1) via son API. Les exemples couvrent notamment une vidéo de présentation de produit, une transformation visuelle et une scène construite depuis une image existante. Le guide recommande de préciser le cadrage, le nombre de sujets, l’objectif, le style et les mouvements de caméra.

**Les consignes structurent la scène** avec des indications de cadrage comme « single shot », « two shot » ou « over-the-shoulder shot ». Le guide conseille aussi de décrire la mise au point et les effets d’objectif. Les termes cités comprennent « shallow focus », « deep focus », « macro lens » et « wide-angle lens ». La position et le mouvement de la caméra peuvent être précisés avec « eye level », « high angle », « dolly shot », « zoom shot » ou « tracking shot ». Le style général peut prendre la forme d’un film de science-fiction, d’une comédie romantique, d’un film d’action ou d’une animation. Ces indications servent à cadrer la génération selon Replicate.

## Veo 3.1 combine trois références

**Les images de référence** permettent de réunir jusqu’à trois éléments dans une seule scène vidéo. Replicate montre une créatrice et un flacon de shampoing utilisés pour produire une vidéo de présentation au style témoignage. Selon le guide, [Veo 3.1](/signal-ia/actu/veo-31-bouscule-la-video-avec-3-images-cles) préserve le personnage et le produit pendant la génération. Cette fonction peut également conserver l’apparence et l’identité d’un personnage placé dans plusieurs environnements. Un exemple publié par [fofrAI sur X](https://x.com/fofrAI/status/1978584915630329990?ref_src=twsrc%5Etfw) met en scène un personnage d’animation dans une séquence en prise de vues réelles. Le texte fourni guide ensuite la combinaison des éléments visuels et la situation demandée.

**Les deux images clés** définissent un début et une fin que le modèle relie selon le texte fourni. Replicate illustre cette fonction avec une transformation progressive d’un agneau en tigre. Un autre exemple montre une pièce qui change de configuration entre un état initial et un état final. Le guide attribue à cette méthode un contrôle précis des points de départ et d’arrivée d’une vidéo. La génération standard peut utiliser une durée de huit secondes et une résolution de 1080p dans les exemples d’appel JavaScript. L’option de première et dernière image permet donc de décrire une trajectoire visuelle encadrée par deux références distinctes.

## Replicate accélère certaines générations

**La fonction image vers vidéo** reçoit une seule image de départ et un texte décrivant le mouvement souhaité. Replicate indique que Veo 3.1 améliore la qualité et le suivi des consignes sur cette fonction classique. Le modèle peut aussi déduire des éléments présents dans l’image fournie. Dans un exemple, une image du siège de Replicate repéré sur une carte sert de point de départ à une séquence montrant ce qui se déroule sur place. Le guide précise qu’aucune transition spécifique n’a été demandée dans cet exemple. Veo 3.1 a généré une transition jugée cohérente avec les informations contenues dans l’image initiale.

**Les versions rapides** sont disponibles sur tous les points d’accès, sauf la fonction de référence vers vidéo. Replicate annonce un temps inférieur à 60 secondes, contre environ 90 secondes pour la génération standard. Le coût indiqué représente approximativement la moitié du tarif standard. La qualité est annoncée comme légèrement réduite, tout en restant élevée selon la source. L’appel JavaScript présenté utilise le modèle « [google](/signal-ia/actu/veo-31-unifie-trois-images-en-video-coherente)/veo-3.1 », une image, une consigne, une durée de huit secondes et une résolution de 1080p. L’API renvoie ensuite une adresse vidéo utilisable dans une application. Replicate invite les créateurs d’applications vidéo génératives à essayer cette version via sa plateforme.
