# Google transforme la vidéo avec Veo 3.1 novateur

> Google lance Veo 3.1 avec des images de référence, des premières et dernières frames, une image-vidéo améliorée et des versions rapides via Replicate.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-14 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/google-lance-veo-31-avec-des-fonctionnalites-de-generation-video
Tags : veo 3.1, google, replicate, génération vidéo, api

---

## En résumé

- Veo 3.1 combine jusqu'à trois images de référence pour créer une scène vidéo cohérente à partir d'un prompt.
- La génération entre une première et une dernière image permet de contrôler les transformations et les points de départ et d'arrivée.
- Les versions rapides produisent une vidéo en moins de 60 secondes pour environ la moitié du prix standard, avec une qualité légèrement réduite.

**Le signal :** Veo 3.1 peut combiner jusqu'à trois images de référence dans une seule scène vidéo.

## Veo 3.1

Google a lancé Veo 3.1, un modèle de génération vidéo présenté sur le blog de [Replicate](/signal-ia/actu/grok-imagine-video-15-genere-des-videos-realistes). Sa principale nouveauté est la possibilité d'utiliser jusqu'à trois images de référence dans une même scène vidéo, à partir d'une consigne textuelle. Le modèle peut ainsi combiner un personnage, un produit et un environnement tout en conservant leur cohérence visuelle. Replicate l'illustre avec une vidéo de type UGC montrant une femme présentant un flacon de shampoing, ainsi qu'avec un personnage de référence placé dans une scène en prise de vues réelle.

Pour obtenir des résultats plus précis, le guide recommande de décrire la composition du plan et le nombre de sujets, par exemple avec « single shot », « two shot » ou « over-the-shoulder shot ». Les effets de mise au point et d'objectif peuvent aussi être spécifiés, comme « shallow focus », « deep focus », « macro lens » ou « wide-angle lens ». La direction artistique repose sur des styles tels que la science-fiction, la comédie romantique, le film d'action ou l'animation. Enfin, la position et les mouvements de caméra peuvent être détaillés avec « eye level », « high angle », « dolly shot », « zoom shot », « pan shot » ou « tracking shot ».

## Trois images pour une scène cohérente

La fonction « reference to video » accepte jusqu'à trois images et les combine selon le prompt. Replicate met en avant la constance des personnages: une même identité visuelle peut être placée dans des scénarios et des environnements différents. Cette possibilité est notamment présentée comme adaptée aux mascottes de marque, aux personnages principaux et aux récits comportant plusieurs éléments visuels précis.

Veo 3.1 propose aussi la génération vidéo à partir d'une première et d'une dernière image. Le modèle interpole alors le contenu entre ces deux points en suivant la consigne textuelle. Les exemples cités montrent la transformation d'un agneau en tigre et celle d'une pièce avant et après réaménagement. Cette approche donne un contrôle plus précis sur le début, la fin et l'arc narratif d'une séquence.

## Image-vidéo améliorée et API Replicate

L'image-vidéo classique a également été améliorée. L'utilisateur fournit une image de départ et décrit le mouvement ou l'action attendus. Selon Replicate, Veo 3.1 peut raisonner à partir du contenu de l'image et produire des transitions fluides sans qu'une transition précise soit nécessairement indiquée dans le prompt. Dans l'exemple présenté, une image du siège de Replicate repéré sur une carte est transformée en séquence vidéo cohérente avec le lieu représenté.

Tous les endpoints, à l'exception de « reference to video », disposent d'une [version rapide](/signal-ia/actu/openai-accelere-gpt-56-sol-jusqua-14-fois). Celle-ci génère une vidéo en moins de 60 secondes, contre environ 90 secondes pour la version standard, pour un coût approximativement réduit de moitié. Sa qualité est légèrement inférieure, tout en restant présentée comme élevée. [L'API Replicate](/signal-ia/actu/replicate-lance-flux2-pour-la-generation-dimages) permet notamment de définir les images et le prompt. Pour la vidéo de référence, plusieurs URL d'images peuvent être transmises et l'audio peut être désactivé. L'API renvoie ensuite une URL vidéo exploitable dans une application.
