TLDR
FLUX 3 est le modèle de fondation multimodal de Black Forest Labs du 23 juillet 2026. Positionnement officiel : une architecture qui apprend conjointement à partir des images, de la vidéo et de l’audio, avec une voie de prédiction d’action pour les partenaires robotique (blog BFL ; modèles BFL). Les points forts vidéo publics incluent des clips jusqu’à environ 20 secondes, des séquences multi-plans à partir d’un seul prompt, et de l’audio natif (effets sonores, ambiance, dialogue) (résumé The Decoder des matériaux BFL ; notes d’accès anticipé de Justine Moore / a16z). Sur FLUX 3 (ce site), ouvrez le générateur vidéo ou le générateur d’image et commencez gratuitement—sans carte requise pour essayer.
Points clés
- Date de sortie : 23 juillet 2026 pour le lancement public de FLUX 3 (@bfl_ai ; bfl.ai/blog/flux-3).
- Périmètre : Image + Vidéo + Audio + Prédiction d’action sous un design multimodal (modèles BFL ; communiqué).
- Atouts vidéo : génération jusqu’à ~20 s, multi-plans depuis un prompt, audio natif (The Decoder ; notes anticipées venturetwins).
- Contexte de série : FLUX.1 (ère image 2024) → FLUX.2 image/édition (nov. 2025) → FLUX 3 modèles multimodaux du monde réel (post BFL FLUX.2 ; post BFL FLUX 3).
- Essai ici : FLUX 3 vidéo (par défaut pour les clips courts) et FLUX 3 image dans le même espace produit.
Ce qui a réellement été livré
1. Un pitch multimodal unifié—pas « de la vidéo collée sur l’image »
Black Forest Labs décrit FLUX 3 comme apprenant conjointement à partir des images, de la vidéo et de l’audio dans une architecture unifiée, car aucune modalité seule ne capture le monde (blog BFL ; The Decoder). L’entreprise présente cela comme un pas vers l’intelligence visuelle du monde réel—des modèles qui perçoivent, prédisent et (via des partenaires) agissent (fil d’annonce BFL).

Langage d’image du quotidien au cinématographique · frame showcase sur FLUX 3
2. Vidéo : durée, multi-plans, audio natif
Les matériaux publics et la couverture de la semaine de lancement insistent sur :
| Capacité | Affirmation publique | Sources principales | | --- | --- | --- | | Durée | Clips vidéo jusqu’à environ 20 secondes | The Decoder ; CryptoBriefing | | Multi-plans | Plusieurs plans / angles à partir d’un seul prompt | Justine Moore (a16z) | | Audio natif | Son aligné sur le clip (SFX, ambiance, voies de dialogue) | cadrage de lancement BFL ; The Decoder | | Interfaces | Text-to-video, image-to-video et workflows vidéo associés dans le récit public | The Decoder ; chemin produit sur le générateur vidéo de ce site |
Les tableaux de préférence précoces publiés dans la couverture de lancement (par exemple, comparaisons courtes en 720p vs d’autres systèmes vidéo) sont des signaux précoces rapportés par le fournisseur, pas des certifications indépendantes de l’industrie du film (résumé de graphique The Decoder). Prenez-les comme contexte, puis jugez avec vos propres prompts.

Langage de mouvement piloté par le prompt · keyframe showcase sur FLUX 3
3. Voie image dans la même famille
Les posts officiels montrent des échantillons FLUX 3 Image et décrivent synthèse/édition à travers styles, ratios d’aspect et résolutions comme partie de la stack multimodale (échantillons PS du fil BFL ; blog BFL). Sur ce produit, les stills sont sur le générateur d’image avec FLUX 3 comme défaut image maison.
4. Action / robotique (contexte, pas le CTA créateur principal)
BFL a aussi annoncé le travail FLUX-mimic avec Mimic Robotics, y compris des récits de tests industriels impliquant Audi (post action BFL dans le fil de lancement ; communiqué). C’est important pour l’histoire du « world model ». Pour les pubs sociales, démos produit et courts métrages, la surface pratique reste la génération vidéo + image.
5. Chronologie de la série (FLUX → FLUX.2 → FLUX 3)
| Génération | Thème public | Ancre | | --- | --- | --- | | Ère FLUX.1 | Vague open/image qui a fait de FLUX un défaut créateur | Histoire de la série sur BFL / aperçu Wikipedia | | FLUX.2 | Génération & édition d’image production (multi-référence, plus haute fidélité) | blog FLUX.2, 25 nov. 2025 | | FLUX 3 | Backbone multimodal vidéo + audio + image | blog FLUX 3, 23 juillet 2026 |
Zoom : pour qui est FLUX 3
Marketers social et UGC
Des clips courts qui tiennent les visages, le mouvement et l’éclairage du quotidien—sans une journée de prod complète—sont les jobs que multi-plans + audio natif débloquent. Commencez sur text to video.
Équipes produit et growth
L’image-to-video transforme un still packaging ou un frame hero produit en première passe de pub motion. Utilisez un still propre, puis animez dans le même espace vidéo.
Cinéastes IA et storyboardeurs
Le multi-plans en un prompt est le différenciateur dont les créateurs parlent en semaine de lancement (venturetwins). Traitez les sorties précoces comme des premières passes éditables, puis affinez les prompts plan par plan.
Designers still déjà dans FLUX
Si vous connaissez FLUX pour les stills, le récit public de FLUX 3 est « même famille, maintenant le temps + le son ». Gardez les stills sur image et le motion sur vidéo.
Ce que nous savons vs. ce que nous ne savons pas
| Nous savons (sourcé) | Nous ne savons pas / ne revendiquons pas | | --- | --- | | Lancement public le 23 juillet 2026 avec positionnement multimodal (@bfl_ai ; blog BFL) | Que chaque hôte, résolution ou bascule de durée soit identique sur tous les produits dans le monde | | Le récit vidéo inclut ~20 s, multi-plans, audio natif (The Decoder) | La perfection garantie au premier take pour chaque visage, main et rotation corps entier | | Des scores de préférence précoces existent dans la couverture de lancement et sont préliminaires (The Decoder) | Des classements indépendants peer-reviewed qui couronnent un « modèle vidéo n°1 » permanent | | FLUX.2 a établi un fort chapitre image (BFL FLUX.2) | Que stills et vidéo partagent toujours exactement la même empreinte esthétique sur chaque seed | | Ce site expose des générateurs navigateur vidéo et image pour les workflows FLUX 3 | Des tableaux prix dollar-par-seconde cross-vendor (non comparés ici) |
Pourquoi c’est important pour les builders
- Vidéo + audio en une génération réduit le saut d’outils pour les premières passes de pubs et d’explainers.
- Le prompting multi-plans change la façon d’écrire les briefs—écrivez des coupes, pas seulement des vibes (notes multi-plans anticipées).
- La continuité de marque FLUX aide les équipes déjà dans le langage still FLUX à migrer le motion sans nouveau modèle mental.
- Les chemins d’essai navigateur battent l’attente d’une install locale parfaite quand vous devez seulement savoir si votre plan produit survit au mouvement.
Comment évaluer FLUX 3 vous-même sur ce site
- Ouvrez le générateur vidéo FLUX 3.
- Collez le Prompt A ci-dessous (multi-plans).
- Regardez une fois en plein écran : visages, clarté des coupes, adéquation audio (si présent), et survie du crop en 9:16.
- Sauvegardez les keepers ; optionnel : seconde passe en image to video depuis un still que vous aimez déjà sur image.
Prompt A — multi-shot backyard joust
Multi-shot short film, 12 seconds, playful daylight backyard.
Shot 1 wide: two kids jousting with bright pool noodles, green grass, summer sun.
Shot 2 medium: slow motion near-miss as noodles clash, fabric and hair motion clear.
Shot 3 close-up: both kids laughing, natural faces, soft bokeh fence in background.
Natural ambient audio feel, no music bed, no text overlays, no watermark.
Prompt B — product hero spin
Product commercial, 8 seconds, clean studio.
Shot 1: matte black wireless earbuds case on white seamless, soft key light.
Shot 2: lid opens smoothly, earbuds catch a specular highlight.
Shot 3: earbud floats closer to camera, macro detail on mesh.
Subtle whoosh SFX energy, no logos other than the product shape, no watermark.
Prompt C — rainy neon street (mood)
Cinematic street clip, 10 seconds, night rain, neon reflections.
Single continuous push-in toward a woman laughing under a translucent umbrella,
wet asphalt, cyan and magenta signs, handheld micro-motion, natural skin texture.
City ambience and light rain SFX, no dialogue, no on-screen text, no watermark.
À surveiller ensuite
- Recettes multi-plans créateurs (listes de plans en prompts)—voir notre FLUX 3 Video : multi-plans, clips ~20 s et audio natif.
- Workflows image pour des stills qui alimentent l’image-to-video (générateur d’image).
- Notes de recherche BFL officielles sur Self-Flow / backbone multimodal au fil des publications (hub recherche BFL via résumé d’architecture The Decoder).
FAQ
Qu’est-ce que FLUX 3 ?
FLUX 3 est le modèle de fondation multimodal de Black Forest Labs du 23 juillet 2026 pour l’image, la vidéo, l’audio et la prédiction d’action, entraîné conjointement plutôt que comme modèles monofonction séparés (blog BFL ; fil de lancement).
FLUX 3 n’est-il qu’un modèle vidéo ?
Non. Les matériaux publics décrivent des voies vidéo, image, audio et action sous un design multimodal unique (modèles BFL). Sur ce site vous pouvez commencer par vidéo ou image.
Quelle durée peuvent avoir les vidéos FLUX 3 ?
La couverture de lancement cite des clips jusqu’à environ 20 secondes dans le récit public de BFL (The Decoder). Confirmez toujours le contrôle de durée disponible dans l’UI du générateur pour votre run.
FLUX 3 prend-il en charge le multi-plans dans un prompt ?
Oui—c’est un highlight créateur de la semaine de lancement : plusieurs plans depuis un seul prompt (venturetwins). Écrivez des lignes explicites Shot 1 / Shot 2 / Shot 3 pour un meilleur contrôle.
Qu’est-ce que l’audio natif dans FLUX 3 ?
L’audio natif signifie que le modèle peut produire du son avec la vidéo—ambiance, SFX et démos orientées dialogue apparaissent dans la couverture publique (The Decoder ; lancement BFL).
En quoi FLUX 3 diffère-t-il de FLUX.2 ?
FLUX.2 (nov. 2025) est le chapitre production de génération & édition d’image (BFL FLUX.2). FLUX 3 élargit la famille en stack multimodale avec une narration vidéo + audio de premier plan (BFL FLUX 3).
Puis-je essayer FLUX 3 gratuitement en ligne ?
Oui. Ouvrez le générateur vidéo FLUX 3 sur flux3.video pour commencer gratuitement—sans carte requise pour démarrer. Stills : générateur d’image.
Text to video ou image to video—lequel d’abord ?
Utilisez text to video quand vous inventez une scène de zéro. Utilisez image to video quand vous avez déjà une photo produit ou un still de personnage à animer—les deux vivent sous vidéo.
Les comparaisons de win-rate publiées sont-elles finales ?
Non. Les taux de préférence précoces dans les articles de lancement sont des signaux préliminaires rapportés par le fournisseur sous des conditions de test spécifiques (The Decoder). Lancez vos propres prompts pour les décisions qui comptent.
Par où commencer maintenant ?
Collez le Prompt A dans le générateur vidéo, regardez une fois en plein écran, puis itérez les descriptions de plans—pas seulement les adjectifs.
À propos d’Avery Lin
Avery Lin est analyste de sorties de modèles IA qui suit les lancements de la famille FLUX et transforme les faits publics des modèles en chemins d’essai clairs pour les créateurs sur FLUX 3.
