En résumé
Black Forest Labs entraîne FLUX 3 sur des images, de l’audio et des vidéos.
FLUX 3 accepte des images de départ et de fin pour guider une transformation.
Replicate propose FLUX 3 en 720p, sur huit secondes, avec génération audio.
Le signal : FLUX 3 de Black Forest Labs génère des vidéos en 720p, sur 8 secondes, avec audio activable.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Black Forest Labs lance FLUX 3, son nouveau modèle de fondation multimodal, selon une présentation publiée le 4 août 2026. Le laboratoire, connu pour FLUX.1, s’oriente désormais vers la vidéo. Son architecture unifiée apprend à partir d’images, d’audio et de vidéos. Elle produit des sorties multimodales. Black Forest Labs explique que les images décrivent les structures spatiales. Les vidéos ajoutent le temps et les dynamiques physiques. L’audio apporte des relations causales entre phénomènes mécaniques et sons. Le langage relie ces perceptions aux objectifs et aux instructions. La présentation complète de Replicate détaille les usages testés avec FLUX 3.
Les modalités se combinent pour relier mouvement, son et évolution temporelle. Replicate indique que FLUX 3 fonctionne avec une phrase simple comme avec une description dense. Les exemples couvrent un véhicule tout-terrain traversant un désert, une pieuvre avançant sur un fond marin et un homme observant les montagnes suisses depuis un train. Le modèle peut aussi produire une scène de plongée dans un cénote maya. Ses résultats visent alors les mouvements indépendants des tentacules, les particules dans l’eau et les rayons lumineux filtrés. Le modèle adopte par défaut plusieurs plans, sauf instruction contraire. Cette préférence peut être précisée directement dans le texte demandé.
Les transformations guidées utilisent une image de départ et une image finale. Replicate décrit un test avec la même voiture, d’abord abandonnée dans une casse, puis restaurée et rouge. Le texte demande de conserver le véhicule, l’angle de caméra, l’empattement, la carrosserie et l’arrière-plan. La rouille disparaît progressivement. Les bosses se redressent. Le pare-brise devient clair. Les pneus se gonflent. La voiture démarre ensuite et rejoint la route. FLUX 3 accepte aussi le paramètre start_video. Celui-ci prolonge une séquence existante depuis sa dernière image. Le modèle conserve l’élan, la logique du cadrage et l’audio, avec des exemples de skateboard et de surf.
Les plans horodatés permettent de demander plusieurs scènes dans une seule génération. Replicate propose une structure avec un plan large de zéro à quatre secondes, un gros plan de quatre à huit secondes, puis un suivi de huit à douze secondes. L’exemple suit un sprinteur dans un stade, depuis le public jusqu’à la ligne d’arrivée. FLUX 3 peut également adopter une esthétique différente du rendu cinématographique hyperréaliste. Les exemples incluent une animation en pâte à modeler, un univers de bande dessinée et des images de caméscope VHS. Un message publié par fofr sur X montre aussi une séquence en apesanteur.
L’appel de génération utilise le modèle black-forest-labs/flux-3 avec une durée, une résolution et un format d’image. L’exemple fourni demande huit secondes, une définition de 720p et un ratio 16:9. Le paramètre generate_audio active la création sonore. L’appel accepte aussi une image de départ, une image finale et jusqu’à dix images clés. Ces images peuvent servir à construire un storyboard. Le code présenté par Replicate utilise la bibliothèque JavaScript replicate. Un second exemple passe par la passerelle d’IA de Cloudflare. Celle-ci ajoute la journalisation, la mise en cache et la limitation de débit. Cloudflare gère les identifiants du fournisseur et facture l’usage via sa facturation unifiée.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés