En résumé
Veo 3.1 combine jusqu’à trois images de référence dans une scène vidéo cohérente.
Le modèle interpole une séquence entre une première image et une dernière image.
Les versions rapides réduisent le temps de génération sous 60 secondes et le prix d’environ moitié.
Le signal : Veo 3.1 accepte jusqu’à trois images de référence pour préserver un personnage et un produit dans une même vidéo.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Google présente Veo 3.1 comme un modèle vidéo doté de nouvelles commandes de génération. Le modèle accepte jusqu’à trois images de référence pour créer une scène cohérente, guidée par un prompt textuel. Cette fonction peut conserver l’apparence d’un personnage et d’un produit dans une même séquence. Veo 3.1 propose aussi une génération entre une première image et une dernière image. Le modèle construit alors l’interpolation entre ces deux points, selon les instructions du prompt. Replicate présente ces fonctions dans son guide de prompting pour Veo 3.1. La page fournit également des exemples d’utilisation et des appels à l’API.
Le prompting structure les plans avec plusieurs familles d’instructions. Replicate recommande de préciser le cadrage et le nombre de sujets, comme un plan unique ou un plan à deux sujets. Les termes liés à la mise au point incluent « shallow focus », « deep focus » et « macro lens ». Le style peut s’appuyer sur des directions comme la science-fiction, la comédie romantique ou l’animation. Le prompt peut aussi décrire la position et le mouvement de la caméra. Les expressions citées comprennent le niveau des yeux, la plongée, le travelling et le panoramique. Ces indications encadrent la composition visuelle demandée au modèle.
Les images de référence permettent de réunir jusqu’à trois éléments dans une vidéo unique. Replicate montre notamment une femme et une bouteille de shampoing utilisées pour produire une séquence de présentation de type contenu généré par utilisateur. Selon l’article, Veo 3.1 préserve le personnage et la bouteille pendant la génération d’une vidéo réaliste. La même fonction peut placer un personnage dans plusieurs environnements tout en maintenant son apparence et son identité. Replicate cite aussi un exemple publié par fofrAI, avec un personnage d’anime intégré à une scène en prises de vues réelles. L’exemple montre un personnage qui rentre chez lui sous la pluie, selon le prompt associé.
Les deux images bornent une autre méthode de génération vidéo. L’utilisateur fournit une première image et une dernière image, puis décrit la transition souhaitée. Replicate illustre cette fonction avec une transformation d’un agneau en tigre. Un autre exemple montre la transformation progressive d’une pièce. Cette interpolation permet de définir plus précisément le début et la fin d’une séquence. Elle peut donc convenir à des vidéos construites autour de deux états visuels déterminés. La fonction image-vers-vidéo classique reçoit, elle, une seule image de départ et un prompt décrivant le mouvement. Replicate indique que cette version améliorée suit mieux les instructions et produit une qualité supérieure.
Les versions rapides sont proposées sur tous les points d’accès, sauf la fonction de référence vers vidéo. Replicate indique un temps inférieur à 60 secondes, contre environ 90 secondes pour la génération standard. Le prix annoncé représente approximativement la moitié de celui de la version standard. La qualité est légèrement réduite, tout en restant décrite comme élevée. L’API Replicate accepte notamment une durée de huit secondes et une résolution de 1080p dans les exemples fournis. Pour une vidéo à partir d’une image, l’appel JavaScript utilise le modèle google/veo-3.1. La réponse de l’API renvoie une URL vidéo utilisable dans une application, selon l’article.
Les exemples JavaScript couvrent trois scénarios distincts. Le premier fournit une image, un prompt, une durée de huit secondes et une résolution de 1080p. Le deuxième transmet trois URL dans reference_images, avec un prompt décrivant une vidéo de présentation produit. Il désactive aussi la génération audio avec generate_audio: false. Le troisième utilise first_frame et last_frame pour demander une transformation fluide. Replicate présente ces appels comme une manière de commencer avec l’API. L’article recommande également Veo 3.1 aux créateurs d’applications vidéo génératives. Les utilisateurs peuvent essayer le modèle directement depuis la page Veo 3.1 sur Replicate, tandis que l’exemple public de personnage est disponible sur X.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés