Black Forest Labs positionne FLUX 3 comme un système multimodal capable de générer vidéo + audio natif à partir de texte pur ou de références image—y compris l’animation depuis une image de départ (blog BFL FLUX 3, 23 juillet 2026 ; page modèles BFL ; notes de lancement via @bfl_ai).
Sur FLUX 3 (ce produit), les deux parcours vivent dans le même générateur vidéo. L’erreur coûteuse n’est pas « choisir le modèle le plus faible »—c’est démarrer du mauvais côté pour le job : inventer un packaging qui doit coller à un artwork légal, ou sur-contraindre une scène qui n’avait besoin que d’un beat sheet écrit.
Ceci est un how-to de décision : quand partir du texte, quand verrouiller un still d’abord, et comment faire une boucle d’évaluation équitable gratuitement sur flux3.video. Pour la grammaire multi-plans, utilisez le companion multi-plans & audio natif. Pour la carte de lancement, voir Qu’est-ce que FLUX 3 ?.
TLDR
| Commencer par | Idéal quand | Éviter quand |
|---|---|---|
| Text to video | Vous inventez le monde, testez la grammaire multi-plans, ou explorez des styles | La marque exige une géométrie exacte de logo/packaging |
| Image to video | Vous avez déjà un still produit, un character board, ou une image approuvée | Vous n’avez ni still ni le temps d’en faire un—écrivez simplement du texte |
| Hybride (still → motion) | L’identité ou le packaging doit survivre aux coupes | Vous n’avez besoin que d’un test d’ambiance |
Règle par défaut : si le look doit coller à un still approuvé, utilisez image to video. Si l’histoire et la caméra inventent le look, utilisez text to video. Les deux tournent sur FLUX 3 vidéo ; craft des stills sur FLUX 3 image au besoin.
Points clés
- Double parcours officiel : FLUX 3 vidéo inclut le text-to-video et l’image-to-video (animation depuis une image de départ ou images comme références visuelles), avec audio natif sur les sorties (blog BFL).
- Le plafond public d’environ 20 s par génération est le récit de durée—pas une exigence pour chaque jet (résumé The Decoder des matériaux BFL ; blog BFL).
- Le multi-plans depuis un seul prompt est une compétence créateur de premier plan dans les notes précoces—numérotez vos plans dans les deux parcours (Justine Moore / a16z).
- Décalage de prompt image-to-video : décrivez mouvement + caméra + audio, pas une seconde tenue ni une nouvelle forme de produit (BFL : cadrage « animation » depuis l’image de départ).
- Pages monétisées ici : vidéo pour les deux modes ; craft de still optionnel sur image.
Face-à-face : départ texte vs still
Lisez d’abord ce tableau—environ 30 secondes pour choisir un parcours.
| Dimension | Text to video | Image to video |
|---|---|---|
| Ce que vous fournissez | Scène écrite seulement | Still + prompt de mouvement |
| Ce que le modèle invente | Look, costume, décor, lumière | Mouvement, caméra, temps, souvent l’énergie audio |
| Meilleurs jobs | Beats d’histoire, personas UGC, exploration de style, expériences multi-plans | Product spin, packshots de marque, verrouillage de personnage approuvé, poster-to-motion |
| Force de continuité | Vient des verrous de prompt (lignes costume/lieu) | Vient d’abord des pixels du still |
| Mode d’échec | Logo / visage / produit inventés et qui dérivent | Still trop chargé ; le prompt redécrit un autre objet |
| Temps de préparation | Le plus rapide | Besoin d’un still propre (photo ou générateur d’image) |
| Racine de capacité publique | Liste vidéo BFL FLUX 3 | Même post : animation depuis image de départ + références image |

Langage de motion prompt-first · keyframe showcase sur FLUX 3 · still de planification, pas un master noté
Quand le text to video pur gagne
Choisissez le text to video quand le still n’existe pas encore—ou quand inventer le still ferait perdre le sens de l’expérience.
1. Tests d’histoire multi-plans
Vous vous souciez de la lisibilité Shot 1 → Shot 2 → Shot 3 plus que d’un packaging pixel-parfait. Les commentaires publics d’accès anticipé soulignent le contrôle multi-plans depuis un seul prompt (venturetwins). Démarrez sur vidéo avec des plans numérotés (recettes complètes dans le how-to multi-plans).
2. Invention UGC / persona
Pas de photo de talent approuvée. Vous voulez un créateur handheld crédible, pas une correspondance kit de marque. Écrivez costume + pièce + énergie de parole en un bloc—puis itérez les lignes, pas les stills.
3. Exploration de plage de styles
BFL met l’accent sur une large plage de styles—de l’énergie camcorder candid à l’animation et au cinématique (blog BFL). Le texte est plus rapide pour « essayer trois looks » que de verrouiller trois masters d’abord.
4. Pitches de concept purs
Les parties prenantes n’ont besoin que d’un premier motion board. Le texte vous y mène sans boucle d’art direction sur les stills.
Évitez le texte pur quand : le legal, la marque ou l’e-commerce exigent un artwork d’étiquette exact, une couleur SKU, ou un personnage déjà validé comme image.
Quand l’image to video gagne
Choisissez l’image to video quand le look est déjà décidé et que le mouvement est le job restant.
1. Vrai produit / packaging
Si la boîte, le flacon ou la capture d’UI existent déjà, ne les re-hallucinez pas. Épinglez le still, puis promptez rotation, mains, lumière, SFX seulement. Voir aussi le pack de prompts démo produit.
2. Verrouillage d’identité de personnage
Image hero approuvée (ou un still généré sur image) → animez avec continuité. Le cadrage de BFL inclut la poursuite depuis une image de départ comme animation (blog BFL).
3. Poster / key art vers le motion
L’art de campagne est figé ; vous avez besoin d’un push-in social de 6–12 s. L’image-to-video garde la composition ; le text-to-video risque un keyframe « similaire mais pas le même ».
4. Après qu’un texte a déjà trouvé un still gagnant
Parcours hybride ci-dessous : figez le meilleur plan (ou régénérez un still propre), puis relancez le mouvement depuis ce verrou.
Évitez l’image-to-video quand : le still est encombré, basse résolution, ou a plusieurs sujets en concurrence—nettoyez d’abord le still.

Langage de verrouillage still-first · image showcase sur FLUX 3 · still de planification, pas un photogramme de film noté
Parcours hybride : page image → page vidéo
C’est la boucle de production dont la plupart des équipes de marque ont réellement besoin :
- Craft ou affinez un still sur FLUX 3 image (ou utilisez une vraie photo).
- Ouvrez FLUX 3 vidéo → image to video.
- Promptez seulement mouvement + caméra + audio + « preserve exact colors/logo/outfit ».
- Revue plein écran une fois ; si le logo échoue deux fois, arrêtez d’inventer—corrigez le still, pas les adjectifs.
Les matériaux publics notent aussi les références image comme ancres visuelles (pas seulement l’animation depuis l’image de départ) (blog BFL). Traitez le still comme le contrat ; le texte est la direction.
Comment faire tourner les deux parcours sur FLUX 3 (boucle d’évaluation)
- Ouvrez FLUX 3 vidéo (le modèle maison reste FLUX 3).
- Choisissez le parcours d’après le tableau ci-dessus.
- Collez le Prompt A (texte) ou le Prompt B (image-to-video) avec le nom de votre vrai produit.
- Jugez avec la checklist ci-dessous → gardez un gagnant.
- Optionnel : peaufinez un still sur image, puis réanimez.
Visez d’abord des jets d’environ 8–12 secondes même si les matériaux publics parlent de clips jusqu’à environ 20 secondes (The Decoder ; blog BFL). Les beats plus courts se lisent plus facilement sur téléphone.
Prompt A — text to video multi-plans (copier-coller)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — image to video depuis un still verrouillé (copier-coller)
À utiliser après avoir joint un still produit ou personnage propre sur vidéo.
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — craft du still puis animation (texte hybride pour la page image)
Générez un verrou propre sur image, puis utilisez le Prompt B :
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
Checklist pass/fail (valable pour les deux parcours)
Regardez une fois sans scrubbing, puis scrubbez :
- Adéquation du parcours — avez-vous inventé quand il fallait verrouiller, ou verrouillé quand il fallait de la liberté ?
- Identité / produit — même visage, costume ou logo sur tout le clip ?
- Mains / bords — boîte qui fond, doigts en trop, labels qui glissent ?
- Audio — correspond aux événements, ou avez-vous demandé le silence ? L’audio natif fait partie du récit multimodal officiel (@bfl_ai ; The Decoder).
- Crop — sujet sûr pour des placements type Reels/TikTok 9:16 (gardez les centres lisibles pour les ads feed—voir aperçu Meta ads et TikTok Ads Help).
- Pollution de texte — glyphes aléatoires ou watermarks ?
Deux échecs → changez de parcours ou de still, ne vous contentez pas d’ajouter des adjectifs.
Erreurs fréquentes
| Erreur | Pourquoi ça fait mal | Correctif |
|---|---|---|
| Text-to-video pour packaging légal | Le logo s’invente | Vrai still + image-to-video |
| Le prompt image-to-video réécrit le produit | Combat le still | Mouvement/caméra/audio seulement |
| Still chargé (beaucoup d’objets) | L’accroche motion échoue | Crop sur un seul sujet hero |
| Pas de liste de plans dans aucun parcours | Bouillie continue | Numérotez Shot 1/2/3 |
| Durée max dès le premier essai | Beats illisibles | Commencer ~8–12 s |
| Musique + dialogue + SFX d’un coup | Audio boueux | Une seule ligne de priorité audio |
Gagnants par scénario (si / alors)
| Si… | Alors commencez par… | Pourquoi |
|---|---|---|
| Vous n’avez qu’une idée en une ligne | Text to video | Boucle la plus rapide |
| La marque a envoyé un PNG packshot | Image to video | La géométrie est déjà la vérité |
| Le personnage ne tient que dans un seul still | Hybride | Figer le look, varier la caméra |
| Test de dialogue multi-plans | Text to video d’abord | Grammaire avant les verrous |
| Logo a échoué deux fois en texte | Stop → still + i2v | Ne brûlez plus de runs d’invention |
| Explorer camcorder vs style animation | Text to video | Le style est l’expérience (plage de styles BFL) |
Ce que nous savons vs. ce que nous ne savons pas
| Nous savons (sourcé) | Nous ne savons pas / ne revendiquons pas |
|---|---|
| Lancement public FLUX 3 le 23 juillet 2026 avec cadrage vidéo + audio multimodal (@bfl_ai ; blog BFL ; résumé wire) | Que chaque hôte expose des contrôles d’image de départ ou des durées identiques |
| La liste vidéo officielle inclut text-to-video et image-to-video (image de départ ou références image) (blog BFL) | Une perfection logo garantie au premier take pour chaque SKU |
| Des clips jusqu’à environ 20 secondes avec audio natif apparaissent dans les matériaux publics (blog BFL ; The Decoder) | Que plus long est toujours mieux pour les social ads |
| L’enchaînement multi-plans apparaît dans les notes créateur précoces (venturetwins) | Des certifications film indépendantes qui classeraient un parcours définitivement « meilleur » |
FAQ
Quelle est la différence entre FLUX 3 text-to-video et image-to-video ?
Le text-to-video construit le clip à partir d’un prompt écrit seul. L’image-to-video se conditionne sur un still—soit comme image de départ à animer, soit comme référence visuelle—puis suit vos directions de mouvement et d’audio (blog BFL).
Quel parcours utiliser en premier sur flux3.video ?
Si vous n’avez pas de still approuvé, commencez par le text to video. Si le look de marque est déjà figé, commencez par l’image to video sur le même générateur vidéo.
Puis-je utiliser les deux dans un même projet ?
Oui. Beaucoup d’équipes découvrent avec le texte, verrouillent un still sur image ou depuis une photo, puis finissent en image-to-video.
L’image-to-video inclut-il l’audio ?
Les capacités vidéo publiques de FLUX 3 listent la génération d’audio natif avec les sorties, y compris les parcours conditionnés par image dans le même ensemble de capacités (blog BFL ; The Decoder). Écoutez quand même chaque take.
Quelle durée pour mon premier clip ?
Le plafond narratif public est d’environ 20 secondes (blog BFL). Pour décider, commencez à 8–12 secondes pour que la qualité du parcours soit évidente.
Pourquoi mon logo produit casse-t-il en text-to-video ?
Le modèle invente des pixels. Passez à un vrai still + image to video, et interdisez le nouveau texte dans le prompt.
Pourquoi l’image-to-video ignore-t-il mon still ?
En général le still est encombré ou le prompt redécrit un autre produit. Croppez sur un sujet ; n’écrivez que mouvement + caméra + audio.
Ai-je besoin du générateur d’image ?
Seulement pour les verrous hybrides. Texte pur et photo→vidéo pure peuvent le sauter. Les stills vivent sur image quand vous en avez besoin.
Où s’insèrent les prompts multi-plans ?
Dans les deux parcours. Numérotez les plans explicitement—voir multi-plans & audio natif.
Est-ce le même type d’article qu’un classement de modèles pairs ?
Non. Cette page est la sélection de parcours à l’intérieur de FLUX 3. Pour les critères face à d’autres systèmes, lisez FLUX 3 vs modèles vidéo IA pairs.
Où essayer gratuitement ?
Ouvrez FLUX 3 vidéo sur flux3.video et commencez gratuitement—aucune carte requise pour démarrer.
À propos de Reese Okada
Reese Okada est une auteure de workflows vidéo IA qui transforme les prompts multi-plans en workflows navigateur répétables sur FLUX 3. Ce guide se concentre sur le choix texte vs still-first pour que les runs gratuits aillent au parcours qui correspond au job.