Replicate dévoile comment guider Grok Imagine Video 1.5
#grok 3 min · 24 août 2026

Replicate dévoile comment guider Grok Imagine Video 1.5

Par Arthur Dekeyser

En résumé

1

Grok Imagine Video 1.5 génère une vidéo réaliste avec un audio synchronisé.

2

Replicate recommande une section Sound détaillée pour guider la conception sonore.

3

Une image fixe peut définir la composition avant l’ajout des mouvements vidéo.

💡

Le signal : Replicate recommande de séparer l’image de départ et les mouvements demandés pour mieux piloter Grok Imagine Video 1.5.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

xAI lance Grok Imagine Video 1.5, présenté par Replicate comme une sortie vidéo de xAI. Le modèle génère une vidéo réaliste avec un audio synchronisé en une seule passe. Il peut gérer des mouvements complexes tout en respectant précisément les consignes. Replicate a publié son guide le 21 mai 2026, après avoir testé le modèle sur plusieurs scènes. Les exemples couvrent une conversation téléphonique, des skateboarders, un personnage de jeu et des soins de la peau. Ils incluent aussi un singe lecteur, une prise aérienne d’architecture, une vague et une course matinale à Bangkok. Le guide original de Replicate détaille ces essais.

Les scènes combinent actions, cadrage et ambiance sonore. La scène des skateboarders décrit une accélération progressive, une caméra latérale suivant le visage et des bâtiments qui défilent rapidement. Le personnage dit aussi une phrase précise avant de se taire. La scène de Bangkok suit quatre coureurs et mentionne leurs respirations, les scooters et le marché matinal. Une séquence calme décrit un téléphone abaissé, un chat qui relève la tête et une télévision à tube cathodique qui vacille. Ces exemples montrent que le prompt peut préciser plusieurs battements successifs. Replicate indique toutefois que le modèle gère mieux les consignes ciblées que les descriptions trop étendues pour chaque scène vidéo générée par Grok Imagine Video 1.5.

Replicate détaille le son

Le son compte dans chaque exemple présenté par Replicate. Le guide recommande d’écrire une section « Sound: » comme un concepteur sonore. « City sounds, traffic » reste vague, tandis que les voitures, les skateboards sur le bitume et les adolescents qui rient décrivent des éléments ciblés. Le modèle distingue ainsi le bruit ambiant d’une conception sonore précise. Replicate cite aussi des indications comme « no music » et « camera not moving ». La vague doit associer le choc contre les rochers, le retrait de l’eau, le vent et les embruns sur un microphone. Ces détails sonores accompagnent directement les actions et les matières décrites dans la scène.

Grok suit les mouvements demandés

Les modificateurs d’intensité précisent l’échelle du mouvement. Replicate oppose « the wave crests » à une vague qui se forme pleinement, bascule et s’écrase avec force. Dans la scène de skateboard, les étapes « slowly », « faster » et « very fast » évitent une séquence plate selon le guide. Le cadrage doit également être explicite. Les formulations proposées incluent « slow push-in », « tracking shot alongside », « locked » et « static ». Le modèle reste statique lorsque le prompt ne demande aucun déplacement. Replicate estime qu’une caméra verrouillée peut alors produire un mouvement plus patient. Le guide recommande donc de demander seulement les déplacements nécessaires.

L’image fixe sépare composition et action

L’image de départ peut fixer la composition et la lumière avant l’animation. Replicate recommande d’utiliser une image générée ou une photographie déjà réglée. Le prompt vidéo décrit ensuite uniquement les changements attendus. Dans l’exemple de la forme irisée, l’image fixe établit des surfaces brillantes, un fond noir et des couleurs cyan, magenta, or et bleu électrique. Le texte vidéo ajoute ensuite les ondulations, la rotation et le son. Pour un intérieur wabi-sabi belge, l’image définit le canapé, la table, le mur et la lampe. La vidéo fait évoluer la lumière dorée vers des tons plus froids. Replicate propose aussi une exécution via son interface et son code d’exemple.

Cette méthode sépare clairement la composition de l’action. L’image de départ stabilise les éléments visuels importants, tandis que le prompt vidéo se concentre sur les transformations, le rythme, le déplacement de la caméra et l’environnement sonore. Pour obtenir des résultats plus prévisibles, il est donc préférable de décrire les changements dans un ordre lisible et de limiter les mouvements aux éléments réellement nécessaires.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi