# Black Forest Labs unifie image, audio et vidéo avec FLUX 3

> Black Forest Labs présente FLUX 3, un modèle multimodal qui génère des vidéos avec audio, transformations d’images et prolongements de plans.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-25 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/flux-3-de-black-forest-labs-genere-video-et-audio
Tags : génération vidéo, flux 3, black forest labs, modèles multimodaux, multimodal

---

## En résumé

- Black Forest Labs entraîne FLUX 3 sur les images, l’audio et la vidéo.
- FLUX 3 transforme deux images ou prolonge un clip existant.
- Replicate et Cloudflare AI Gateway proposent des appels programmatiques à FLUX 3.

**Le signal :** FLUX 3 accepte jusqu’à 10 images clés et génère des vidéos en 720p avec audio.

**[Black Forest Labs](/signal-ia/actu/flux-3-de-black-forest-labs-genere-video-et-audio)** présente FLUX 3, son nouveau modèle fondation multimodal, dans un article publié le 4 août 2026. Le laboratoire explique que le modèle apprend simultanément à partir d’images, d’audio et de vidéo. Il génère ainsi des sorties multimodales à partir de ces signaux combinés. Replicate décrit FLUX 3 comme une approche différente de modèles séparant ces modalités. Le modèle est disponible via [Replicate](https://replicate.com/blog/flux-3), qui détaille ses principaux usages et son appel programmatique. L’article présente notamment la génération vidéo depuis un texte, la transformation d’images, la continuation de clips et les scènes découpées par horodatage. Ces fonctions couvrent plusieurs étapes de production vidéo dans une même interface de génération.

**Une architecture consolidée** relie les informations spatiales des images aux dynamiques temporelles de la vidéo. L’audio apporte aussi des indices sur les relations causales entre phénomènes mécaniques et acoustiques. Black Forest Labs affirme que ces contraintes mutuelles décrivent mieux une réalité sous-jacente. Replicate rapporte que cette méthode semble intégrer davantage de lois physiques dans les sorties du modèle. Le laboratoire associe ainsi le son au mouvement et le mouvement à la masse. Cette interprétation reste présentée comme l’approche de conception de [FLUX 3](/signal-ia/actu/black-forest-labs-devoile-flux-3-la-video-avec-audio). L’article ne fournit pas de mesure comparative chiffrée avec d’autres modèles. Il montre toutefois plusieurs exemples destinés à tester la cohérence des actions, des textures et des environnements.

## FLUX 3 génère des scènes vidéo

**Le texte suffit** pour produire des séquences simples ou très détaillées. Replicate montre un camion de compétition traversant des dunes, avec suspension, poussière et caméra basse. Un autre exemple décrit une pieuvre avançant sur un fond marin rocheux, avec huit bras et ventouses en mouvement. FLUX 3 peut aussi générer un homme observant les montagnes depuis un train en Suisse. Le modèle adopte parfois plusieurs plans lorsqu’une consigne ne précise pas le contraire. Une poursuite à moto alterne ainsi un angle de poursuite et une vue depuis le guidon. Les exemples indiquent que les utilisateurs peuvent déléguer au modèle certains choix de mouvement et d’esthétique, sans multiplier systématiquement les mots-clés.

**Les images guident** également une transformation entre une image de départ et une image finale. Replicate propose l’exemple d’une voiture rouillée devenant rouge et restaurée. La consigne demande de conserver le véhicule, l’angle, l’empattement, la carrosserie et l’arrière-plan. Elle précise aussi l’absence de coupes, de téléportation et de changement d’identité. Le paramètre `start_video` permet ensuite de prolonger un clip depuis sa dernière image. L’article décrit un skateur poursuivant son mouvement après une rampe, ainsi qu’un surfeur attrapant une vague. FLUX 3 conserve alors l’élan, le cadrage et l’audio du clip fourni, selon les exemples publiés par Replicate.

## Replicate structure les appels vidéo

**Les plans horodatés** permettent de demander plusieurs scènes dans une seule génération. Replicate montre une séquence de douze secondes avec un stade, un gros plan sur les pieds d’un sprinteur, puis un suivi vers la ligne d’arrivée. Le modèle peut aussi adopter un style qui ne repose pas sur le réalisme cinématographique. Les exemples incluent une animation en pâte à modeler avec empreintes digitales visibles et une esthétique inspirée de la bande dessinée. Des consignes spécifiques reproduisent également une [vidéo](/signal-ia/actu/flux-3-de-black-forest-labs-la-video-sonore-reinventee) VHS, avec mise au point hésitante, bruit analogique et cadrage instable. Pour tester des séquences plus inhabituelles, l’article renvoie aussi à des publications de fofr sur [X](https://x.com/fofrAI/status/2083670630570807451?ref_src=twsrc%5Etfw).

**L’appel programmatique** utilise le modèle `black-forest-labs/flux-3` avec plusieurs paramètres. L’exemple Replicate fixe une durée de 8 secondes, une résolution de 720p et un format 16:9. Il active aussi la génération audio. Les entrées peuvent inclure une image de départ, une image finale, jusqu’à 10 images clés ou une vidéo existante. Cloudflare AI Gateway propose un appel comparable avec `duration`, `resolution`, `aspect_ratio` et `generate_audio`. Selon l’article, cette passerelle ajoute la journalisation, la mise en cache et la limitation de débit. Cloudflare gère les identifiants du fournisseur et facture l’usage via Unified Billing, car FLUX 3 est un modèle tiers.
