FLUX 3 de Black Forest Labs génère des vidéos avec audio
Marketing 3 min · 9 septembre 2026

FLUX 3 de Black Forest Labs génère des vidéos avec audio

Par Arthur Dekeyser

En résumé

1

Black Forest Labs présente FLUX 3 comme un modèle multimodal pour générer des vidéos avec audio.

2

FLUX 3 transforme deux images, prolonge un clip existant et accepte jusqu’à 10 images clés.

3

Replicate et Cloudflare AI Gateway proposent des appels programmatiques avec une durée de huit secondes.

💡

Le signal : FLUX 3 accepte une image de départ, une image finale ou jusqu’à 10 images clés pour guider une génération vidéo.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Black Forest Labs présente FLUX 3 comme son nouveau modèle de fondation multimodal. L’entreprise affirme avoir développé une architecture consolidée qui apprend à partir d’images, d’audio et de vidéos. Le modèle génère ensuite des sorties multimodales. Replicate décrit cette approche dans un guide publié le 4 août 2026. FLUX 3 vise notamment la génération vidéo à partir d’une phrase ou d’une description détaillée. Il peut aussi produire une bande sonore. Les exemples présentés couvrent des scènes réalistes, des transformations d’images et des séquences stylisées. Lire le guide complet de Replicate.

Une architecture multimodale Black Forest Labs relie plusieurs types de données dans un même entraînement. Les images représentent les structures spatiales. Les vidéos ajoutent la dimension temporelle. L’audio renseigne sur les relations causales entre phénomènes mécaniques et sons. Le langage relie ces perceptions aux objectifs et aux instructions. Replicate rapporte que cette combinaison semble intégrer davantage de lois physiques au modèle. Le son doit correspondre à l’impact. Le mouvement doit respecter la masse. Le futur doit découler du passé. FLUX 3 est ainsi présenté comme un ensemble de paramètres cherchant à mieux représenter une réalité commune entre modalités.

FLUX 3 génère des scènes vidéo

Des prompts flexibles FLUX 3 peut produire une scène vidéo à partir d’une phrase simple ou d’une description dense. Replicate montre notamment un train traversant la Suisse rurale, un plongeur descendant dans un cénote et une pieuvre avançant sur un fond marin. Le modèle peut aussi représenter une course de véhicule dans le désert. Les descriptions précisent parfois la caméra, la lumière, les textures et les sons. Pourtant, le guide indique qu’elles n’ont pas toujours besoin d’être longues. FLUX 3 choisit par défaut plusieurs coupes de scène, sauf instruction contraire. Un prompt peut donc demander une prise continue ou imposer des changements de plan.

Trois modes vidéo FLUX 3 accepte une image de départ et une image finale pour guider une transformation. Un exemple montre une voiture rouillée devenant un véhicule rouge restauré, sans changement d’identité ni de cadrage. Le paramètre start_video permet aussi de prolonger un clip depuis sa dernière image. Replicate décrit une conservation du mouvement, du cadrage et de l’audio. Le modèle accepte enfin des plans horodatés dans un seul prompt. Une génération peut donc enchaîner un plan large, un gros plan et un travelling. Le mode storyboard autorise jusqu’à dix images clés. La durée indiquée dans l’exemple atteint huit secondes.

Replicate et Cloudflare structurent l’accès

Des styles variés FLUX 3 ne se limite pas au rendu cinématographique hyperréaliste utilisé dans plusieurs exemples. Replicate montre des scènes en animation image par image avec des personnages en pâte à modeler. D’autres essais combinent encrage de bande dessinée, rendu 3D, tramage et effets de séparation chromatique. Le modèle peut également imiter des séquences vidéo analogiques. Les instructions décrivent alors un caméscope ancien, une mise au point hésitante, une exposition imparfaite et du bruit VHS. Un exemple partagé par fofr explore un déplacement continu dans un habitat spatial en apesanteur. Le guide renvoie à cette démonstration publiée sur X.

Un appel programmatique Replicate fournit un exemple JavaScript utilisant le modèle black-forest-labs/flux-3. L’appel définit une durée de huit secondes, une résolution de 720p et un format 16:9. L’option generate_audio active la génération sonore. Le même appel peut recevoir une image, une image finale, des images clés ou une vidéo de départ. Cloudflare AI Gateway propose aussi un appel avec ces paramètres principaux. Ses requêtes peuvent utiliser la journalisation, la mise en cache et la limitation de débit. Cloudflare indique gérer les identifiants du fournisseur et facturer l’usage via Unified Billing, car FLUX 3 est un modèle tiers.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi