Black Forest Labs positioniert FLUX 3 als ein multimodales System, das Video + natives Audio aus reinem Text oder aus Bildreferenzen erzeugen kann—einschließlich Animation ab einem Startbild (BFL FLUX 3 Blog, 23. Juli 2026; BFL-Models-Seite; Launch-Notizen via @bfl_ai).
Auf FLUX 3 (dieses Produkt) liegen beide Pfade im selben Video-Generator. Der teure Fehler ist nicht „das schwächere Modell wählen“—sondern für den Job falsch zu starten: Packaging erfinden, das rechtlich freigegebener Artwork entsprechen muss, oder eine Szene übermäßig einschränken, die nur ein geschriebenes Beat-Sheet brauchte.
Das hier ist ein Entscheidungs-How-To: wann von Text starten, wann zuerst ein Still fixieren, und wie Sie eine faire Evaluierungs-Schleife kostenlos auf flux3.video fahren. Für Multi-Shot-Grammatik nutzen Sie den Companion Multi-Shot & natives Audio. Für die Launch-Map siehe Was ist FLUX 3?.
TLDR
| Starten mit | Am besten wenn | Überspringen wenn |
|---|---|---|
| Text to Video | Sie erfinden die Welt, testen Multi-Shot-Grammatik oder erkunden Styles | Brand braucht exakte Logo-/Packaging-Geometrie |
| Image to Video | Sie haben bereits ein Product-Still, Character Board oder freigegebenes Bild | Kein Still und keine Zeit, eins zu machen—einfach Text schreiben |
| Hybrid (Still → Motion) | Identität oder Packaging muss Cuts überstehen | Sie brauchen nur einen Mood-Test |
Default-Regel: wenn der Look einem freigegebenen Still entsprechen muss, nutzen Sie Image to Video. Wenn Story und Kamera den Look erfinden, nutzen Sie Text to Video. Beide laufen auf FLUX 3 Video; Stills bei Bedarf auf FLUX 3 Image craften.
Key Takeaways
- Offizieller Dual-Pfad: FLUX 3 Video umfasst Text-to-Video und Image-to-Video (Startbild-Animation oder Bilder als visuelle Referenzen), mit nativem Audio auf den Outputs (BFL-Blog).
- ~20s Single-Generation-Ceiling ist die öffentliche Längen-Narrative—keine Pflicht für jeden Draft (The Decoder-Zusammenfassung von BFL-Materialien; BFL-Blog).
- Multi-Shot aus einem Prompt ist in frühen Notizen eine First-Class-Creator-Skill—nummerieren Sie Ihre Shots in beiden Pfaden (Justine Moore / a16z).
- Image-to-Video-Prompt-Shift: beschreiben Sie Motion + Kamera + Audio, kein zweites Outfit und keine neue Produktform (BFL: Startbild als „Animation“-Framing).
- Einstiegsseiten hier: Video für beide Modi; optionales Still-Crafting auf Image.
Head-to-Head: Text vs Still-Start
Lesen Sie zuerst diese Tabelle—etwa 30 Sekunden, um einen Pfad zu wählen.
| Dimension | Text to Video | Image to Video |
|---|---|---|
| Was Sie liefern | Nur geschriebene Szene | Still + Motion-Prompt |
| Was das Modell erfindet | Look, Wardrobe, Set, Licht | Motion, Kamera, Zeit, oft Audio-Energy |
| Beste Jobs | Story-Beats, UGC-Personas, Style-Exploration, Multi-Shot-Experimente | Product Spin, Brand-Packshots, freigegebener Character-Lock, Poster-to-Motion |
| Continuity-Stärke | Kommt aus Prompt-Locks (Wardrobe-/Location-Zeilen) | Kommt zuerst aus den Pixeln des Stills |
| Failure Mode | Logo / Gesicht / Produkt driftet durch Invention | Still zu unruhig; Prompt beschreibt ein anderes Objekt neu |
| Prep-Zeit | Am schnellsten | Braucht ein sauberes Still (Foto oder Image-Generator) |
| Öffentliche Quellen der öffentlichen Fähigkeiten | BFL FLUX 3 Video-Liste | Derselbe Post: Startbild-Animation + Bildreferenzen |

Prompt-first Motion Language · Showcase-Keyframe auf FLUX 3 · Planungs-Still, kein farbkorrigiertes Master
Wann reines Text to Video gewinnt
Wählen Sie Text to Video, wenn das Still noch nicht existiert—oder wenn das Erfinden des Stills den Sinn des Experiments verschwendet.
1. Multi-Shot Story-Tests
Ihnen geht es um die Lesbarkeit Shot 1 → Shot 2 → Shot 3 mehr als um pixelperfektes Packaging. Öffentliche Early-Access-Kommentare heben Multi-Shot-Kontrolle aus einem Prompt hervor (venturetwins). Starten Sie auf Video mit nummerierten Shots (volle Rezepte im Multi-Shot How-To).
2. UGC / Persona-Invention
Kein freigegebenes Talent-Foto. Sie wollen einen glaubwürdigen Handheld-Creator, keinen Brand-Kit-Match. Schreiben Sie Wardrobe + Raum + Speech-Energy in einem Block—dann iterieren Sie Zeilen, nicht Stills.
3. Style-Range-Exploration
BFL betont breite Style-Range—von candid Camcorder-Energy bis Animation und Cinematics (BFL-Blog). Text ist schneller für „drei Looks ausprobieren“ als drei Masters zuerst zu fixieren.
4. Reine Concept-Pitches
Stakeholder brauchen nur ein First-Pass Motion Board. Text bringt Sie dorthin ohne Art-Direction-Schleife an Stills.
Reinen Text überspringen, wenn: Legal, Brand oder Ecommerce exakte Label-Art, SKU-Farbe oder einen Charakter braucht, der bereits als Bild freigegeben ist.
Wann Image to Video gewinnt
Wählen Sie Image to Video, wenn der Look bereits entschieden ist und Motion der restliche Job ist.
1. Echtes Produkt / Packaging
Wenn Box, Flasche oder UI-Screenshot schon existieren, halluzinieren Sie sie nicht neu. Still pinnen, dann nur Rotation, Hände, Licht, SFX prompten. Siehe auch das Product-Demo Prompt-Pack.
2. Character-Identity-Lock
Freigegebenes Hero-Bild (oder ein Still, das Sie auf Image erzeugt haben) → mit Continuity animieren. BFLs eigenes Framing umfasst Fortsetzung ab einem Startbild als Animation (BFL-Blog).
3. Poster / Key Art zu Motion
Campaign-Art ist fix; Sie brauchen einen 6–12s Social Push-in. Image-to-Video hält die Komposition; Text-to-Video riskiert einen „ähnlich, aber nicht dasselbe“-Keyframe.
4. Nachdem Text schon ein Winner-Still gefunden hat
Hybrid-Pfad unten: bestes Bild einfrieren (oder sauberes Still neu generieren), dann Motion von diesem Lock neu laufen lassen.
Image-to-Video überspringen, wenn: das Still cluttered, low-res oder mit mehreren konkurrierenden Subjects ist—zuerst das Still säubern.

Still-first Lock-Language · Showcase-Bild auf FLUX 3 · Planungs-Still, kein farbkorrigiertes Filmstill
Hybrid-Pfad: Image-Page → Video-Page
Das ist die Production-Schleife, die die meisten Brand-Teams tatsächlich brauchen:
- Still craften oder verfeinern auf FLUX 3 Image (oder echtes Foto nutzen).
- Öffnen FLUX 3 Video → Image to Video.
- Nur Motion + Kamera + Audio + „exakte Farben, Logo und Outfit beibehalten“ prompten.
- Einmal Fullscreen-Review; wenn das Logo zweimal scheitert, aufhören zu erfinden—das Still fixen, nicht die Adjektive.
Öffentliche Materialien nennen Bildreferenzen auch als visuelle Anchors (nicht nur Startbild-Animation) (BFL-Blog). Behandeln Sie das Still als den Vertrag; der Text ist die Regie.
Beide Pfade auf FLUX 3 fahren (Evaluierungs-Schleife)
- Öffnen Sie FLUX 3 Video (House-Modell bleibt FLUX 3).
- Pfad wählen aus der Tabelle oben.
- Einfügen Prompt A (Text) oder Prompt B (Image-to-Video) mit Ihrem echten Produkt-Nomen.
- Bewerten mit der Checkliste unten → einen Gewinner behalten.
- Optional: Still auf Image polieren, dann neu animieren.
Zielen Sie First Drafts auf etwa 8–12 Sekunden, auch wenn öffentliche Materialien Clips bis etwa 20 Sekunden diskutieren (The Decoder; BFL-Blog). Kürzere Beats sind auf dem Phone leichter lesbar.
Prompt A — Text to Video Multi-Shot (Copy-Paste)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — Image to Video von einem fixierten Still (Copy-Paste)
Nutzen Sie das, nachdem Sie ein sauberes Product- oder Character-Still auf Video angehängt haben.
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — Still craften, dann animieren (Hybrid-Text für die Image-Page)
Erzeugen Sie einen sauberen Lock auf Image, dann Prompt B nutzen:
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
Pass/Fail-Checkliste (für beide Pfade)
Einmal ohne Scrubben schauen, dann scrubben:
- Path Fit — haben Sie erfunden, wo Sie fixieren sollten, oder fixiert, wo Sie Freiheit brauchten?
- Identity / Product — dasselbe Gesicht, dieselbe Wardrobe oder dasselbe Logo über den Clip?
- Hände / Kanten — schmelzende Box, Extra-Finger, rutschende Labels?
- Audio — passt zu den Events, oder haben Sie Stille angefordert? Natives Audio ist Teil der offiziellen multimodalen Story (@bfl_ai; The Decoder).
- Crop — Subject sicher für 9:16 Reels/TikTok-artige Placements (Zentren für Feed-Ads lesbar halten—siehe Meta Ads Overview und TikTok Ads Help).
- Text Pollution — random Glyphen oder Watermarks?
Zwei Fails → Pfad oder Still ändern, nicht nur Adjektive anhäufen.
Häufige Fehler
| Fehler | Warum es wehtut | Fix |
|---|---|---|
| Text-to-Video für legales Packaging | Logo wird erfunden | Echtes Still + Image-to-Video |
| Image-to-Video-Prompt schreibt das Produkt um | Kämpft gegen das Still | Nur Motion/Kamera/Audio |
| Unruhiges Still (viele Objekte) | Motion latch scheitert | Auf ein Hero-Subject croppen |
| Keine Shot-Liste in keinem Pfad | Durchgehender Brei | Shot 1/2/3 nummerieren |
| Max-Dauer beim ersten Versuch | Unlesbare Beats | Bei ~8–12s starten |
| Musik + Dialog + SFX auf einmal | Schlammiges Audio | Eine Audio-Priority-Zeile |
Scenario-Winner (wenn / dann)
| Wenn… | Dann starten mit… | Warum |
|---|---|---|
| Sie haben nur eine One-Line-Idee | Text to Video | Schnellste Schleife |
| Brand hat ein Packshot-PNG geschickt | Image to Video | Geometrie ist schon Wahrheit |
| Charakter sieht nur in einem Still gut aus | Hybrid | Look einfrieren, Kamera variieren |
| Multi-Shot Dialog-Test | Zuerst Text to Video | Grammatik vor Locks |
| Logo ist im Text zweimal gescheitert | Stop → Still + i2v | Keine weiteren Invent-Runs verbrennen |
| Camcorder vs Animation Style erkunden | Text to Video | Style ist das Experiment (BFL Style Range) |
Was wir wissen vs. was wir nicht wissen
| Wir wissen (sourced) | Wir wissen nicht / behaupten nicht |
|---|---|
| Öffentlicher FLUX-3-Launch 23. Juli 2026 mit multimodaler Video- + Audio-Framing (@bfl_ai; BFL-Blog; Wire-Summary) | Dass jeder Host identische Startbild-Controls oder Dauern exponiert |
| Offizielle Video-Liste enthält Text-to-Video und Image-to-Video (Startbild oder Bildreferenzen) (BFL-Blog) | Garantierte First-Take-Logo-Perfektion für jedes SKU |
| Clips bis etwa 20 Sekunden mit nativem Audio erscheinen in öffentlichen Materialien (BFL-Blog; The Decoder) | Dass länger für Social Ads immer besser ist |
| Multi-Shot-Chaining erscheint in frühen Creator-Notizen (venturetwins) | Unabhängige Film-Industrie-Zertifizierungen, die einen Pfad dauerhaft „besser“ ranken |
FAQ
Was ist der Unterschied zwischen FLUX 3 Text-to-Video und Image-to-Video?
Text-to-Video baut den Clip allein aus einem geschriebenen Prompt. Image-to-Video conditioniert auf ein Still—entweder als Startbild zum Animieren oder als visuelle Referenz—und folgt dann Ihren Motion- und Audio-Anweisungen (BFL-Blog).
Welchen Pfad sollte ich zuerst auf flux3.video nutzen?
Wenn Sie kein freigegebenes Still haben, starten Sie mit Text to Video. Wenn der Brand-Look schon feststeht, starten Sie mit Image to Video im selben Video-Generator.
Kann ich beide in einem Projekt nutzen?
Ja. Viele Teams entdecken mit Text, fixieren ein Still auf Image oder aus einem Foto, und abschließen mit Image-to-Video.
Enthält Image-to-Video Audio?
Öffentliche FLUX-3-Video-Capabilities listen native Audio-Generation mit den Outputs, einschließlich image-conditionierter Pfade im selben Capability-Set (BFL-Blog; The Decoder). Trotzdem jeden Take anhören.
Wie lang sollte mein erster Clip sein?
Die öffentliche Ceiling-Narrative liegt bei etwa 20 Sekunden (BFL-Blog). Für Entscheidungen starten Sie mit 8–12 Sekunden, damit die Pfad-Qualität klar ist.
Warum bricht mein Produktlogo in Text-to-Video?
Das Modell erfindet Pixel. Wechseln Sie zu einem echten Still + Image to Video, und verbieten Sie neuen Text im Prompt.
Warum ignoriert Image-to-Video mein Still?
Meist ist das Still cluttered oder der Prompt beschreibt ein anderes Produkt neu. Auf ein Subject croppen; nur Motion + Kamera + Audio schreiben.
Brauche ich den Image-Generator?
Nur für Hybrid-Locks. Reiner Text und reines Foto→Video können ihn überspringen. Stills liegen unter Image, wenn Sie sie brauchen.
Wo passen Multi-Shot-Prompts rein?
In beide Pfade. Shots explizit nummerieren—siehe Multi-Shot & natives Audio.
Ist das dasselbe wie ein Peer-Model-Ranking-Artikel?
Nein. Diese Seite ist Pfadwahl innerhalb von FLUX 3. Für Kriterien vs. andere Systeme lesen Sie FLUX 3 vs Peer AI Video Models.
Wo probiere ich es kostenlos?
Öffnen Sie FLUX 3 Video auf flux3.video und starten Sie kostenlos—keine Karte nötig zum Beginnen.
Über Reese Okada
Reese Okada ist eine AI-Video-Workflow-Autorin, die Multi-Shot-Prompts in wiederholbare Browser-Workflows auf FLUX 3 übersetzt. Dieser Guide fokussiert die Wahl Text vs Still-first, damit freie Runs dem Pfad gehören, der zum Job passt.