Black Forest Labs ustawia FLUX 3 jako jeden multimodalny system, który potrafi generować wideo + natywny dźwięk z czystego tekstu albo z referencji obrazu — w tym ożywianie z klatki startowej (blog BFL FLUX 3, 23 lipca 2026; strona modeli BFL; notatki premierowe przez @bfl_ai).
Na FLUX 3 (tym produkcie) obie ścieżki żyją w tym samym generatorze wideo. Drogi błąd to nie „wybór słabszego modelu” — to start w złą stronę pod zadanie: wymyślanie opakowania, które musi pasować do legalnej grafiki, albo zbyt ciasne ograniczenie sceny, która potrzebowała tylko spisanej listy ujęć.
To przewodnik decyzji: kiedy startować od tekstu, kiedy najpierw zamknąć kadr i jak odpalić uczciwą pętlę oceny za darmo na flux3.video. Gramatyka wielu ujęć: przewodnik wielu ujęć i natywnego dźwięku. Mapa premiery: Czym jest FLUX 3?.
W skrócie
| Zacznij od | Najlepiej gdy | Pomiń gdy | | --- | --- | --- | | Z tekstu na wideo | Wymyślasz świat, testujesz gramatykę wielu ujęć albo eksplorujesz style | Marka potrzebuje dokładnej geometrii logo/opakowania | | Ze zdjęcia na wideo | Masz już kadr produktu, tablicę postaci albo zatwierdzony kadr | Nie masz kadru i nie masz czasu go zrobić — po prostu napisz tekst | | Hybryda (kadr → ruch) | Tożsamość albo opakowanie musi przetrwać cięcia | Potrzebujesz tylko testu nastroju |
Domyślna zasada: jeśli wygląd musi pasować do zatwierdzonego kadru, użyj ze zdjęcia na wideo. Jeśli historia i kamera wymyślają wygląd, użyj z tekstu na wideo. Oba działają na wideo FLUX 3; kadry rzemieślnicze na obrazie FLUX 3, gdy potrzeba.
Kluczowe wnioski
- Oficjalna podwójna ścieżka: wideo FLUX 3 obejmuje z tekstu na wideo i ze zdjęcia na wideo (animacja z klatki startowej albo obrazy jako referencje wizualne), z natywnym dźwiękiem na wyjściach (blog BFL).
- Sufit ~20 s jednej generacji to publiczna narracja długości — nie wymóg każdego szkicu (The Decoder, podsumowanie materiałów BFL; blog BFL).
- Wiele ujęć z jednego promptu to umiejętność pierwszej klasy we wczesnych notatkach — numeruj ujęcia na obu ścieżkach (Justine Moore / a16z).
- Przesunięcie promptu ze zdjęcia na wideo: opisuj ruch + kamerę + dźwięk, nie drugi strój ani nowy kształt produktu (BFL: ramy „animacji” z klatki startowej).
- Strony, na których wydajesz Credits: wideo dla obu trybów; opcjonalne rzemiosło kadru na obrazie.
Zestawienie: start od tekstu vs od kadru
Najpierw przeczytaj tę tabelę — ok. 30 sekund na wybór ścieżki.
| Wymiar | Z tekstu na wideo | Ze zdjęcia na wideo | | --- | --- | --- | | Co dostarczasz | Tylko napisaną scenę | Kadr + prompt ruchu | | Co model wymyśla | Wygląd, garderobę, plan, światło | Ruch, kamerę, czas, często energię dźwięku | | Najlepsze zadania | Momenty historii, persony UGC, eksploracja stylu, eksperymenty wielu ujęć | Obrót produktu, packshoty marki, zatwierdzona postać, plakat→ruch | | Siła ciągłości | Z linii ciągłości w prompcie (garderoba/lokalizacja) | Najpierw z pikseli kadru | | Tryb porażki | Logo / twarz / produkt dryfuje przez wymyślanie | Kadr zbyt zatłoczony; prompt opisuje inny obiekt | | Czas przygotowania | Najszybszy | Potrzebuje czystego kadru (zdjęcie albo generator obrazów) | | Skąd wiemy (materiały publiczne) | lista wideo BFL FLUX 3 | Ten sam post: animacja z klatki startowej + referencje obrazu |

Język ruchu od promptu · klatka kluczowa showcase na FLUX 3 · kadr planistyczny, nie oceniony master
Kiedy wygrywa czyste z tekstu na wideo
Wybierz z tekstu na wideo, gdy kadr jeszcze nie istnieje — albo gdy wymyślanie kadru zabiłoby sens eksperymentu.
1. Testy historii wielu ujęć
Zależy Ci na czytelności Shot 1 → Shot 2 → Shot 3 bardziej niż na pixel-perfect opakowaniu. Publiczne komentarze z wczesnego dostępu podkreślają kontrolę wielu ujęć z jednego promptu (venturetwins). Zacznij na wideo z ponumerowanymi ujęciami (pełne przepisy w przewodniku wielu ujęć).
2. Wymyślanie UGC / persony
Brak zatwierdzonego zdjęcia talentu. Chcesz wiarygodnego handheld twórcę, nie dopasowanie do kitu marki. Napisz garderobę + pokój + energię mowy w jednym bloku — potem iteruj linie, nie kadry.
3. Eksploracja zakresu stylu
BFL podkreśla szeroki zakres stylów — od energii candid camcorder po animację i kino (blog BFL). Tekst jest szybszy na „spróbuj trzy looksy” niż zamykanie trzech masterów najpierw.
4. Pitch samej koncepcji
Stakeholderom wystarczy pierwsza tablica ruchu. Tekst dowiezie to bez pętli art direction na kadrach.
Pomiń czysty tekst gdy: legal, marka albo ecommerce potrzebuje dokładnej grafiki etykiety, koloru SKU albo postaci już podpisanej jako kadr.
Kiedy wygrywa ze zdjęcia na wideo
Wybierz ze zdjęcia na wideo, gdy wygląd jest już zdecydowany, a ruch to pozostałe zadanie.
1. Prawdziwy produkt / opakowanie
Jeśli pudełko, butelka albo screenshot UI już istnieje, nie halucynuj go od nowa. Przypnij kadr, potem promptuj tylko obrót, dłonie, światło, SFX. Zobacz też pakiet promptów dem produktu.
2. Zamknięcie tożsamości postaci
Zatwierdzony kadr hero (albo kadr wygenerowany na obrazie) → ożyw z ciągłością. Własne ramy BFL obejmują kontynuację z klatki startowej jako animację (blog BFL).
3. Plakat / key art do ruchu
Grafika kampanii jest stała; potrzebujesz 6–12 s social najazdu. Ze zdjęcia na wideo trzyma kompozycję; z tekstu na wideo ryzykuje klatkę „podobną, ale nie tę samą”.
4. Po tym, jak tekst już znalazł zwycięski kadr
Hybryda poniżej: zamroź najlepszą klatkę (albo wygeneruj czysty kadr od nowa), potem ponów ruch z tego kadru.
Pomiń ze zdjęcia na wideo gdy: kadr jest zatłoczony, niskiej rozdzielczości albo ma kilka konkurujących tematów — najpierw wyczyść kadr.

Język kadru od stilla · kadr showcase na FLUX 3 · kadr planistyczny, nie oceniony kadr filmowy
Ścieżka hybrydowa: strona obrazu → strona wideo
To produkcyjna pętla, której naprawdę potrzebuje większość zespołów marki:
- Zrób albo dopracuj kadr na obrazie FLUX 3 (albo użyj prawdziwego zdjęcia).
- Otwórz wideo FLUX 3 → ze zdjęcia na wideo.
- Promptuj tylko ruch + kamerę + dźwięk + „zachowaj dokładne kolory, logo i strój”.
- Pełny ekran raz; jeśli logo odpada dwa razy, przestań wymyślać — napraw kadr, nie przymiotniki.
Materiały publiczne wspominają też referencje obrazu jako kotwice wizualne (nie tylko animację z klatki startowej) (blog BFL). Traktuj kadr jako kontrakt; tekst to reżyseria.
Jak odpalić obie ścieżki na FLUX 3 (pętla oceny)
- Otwórz wideo FLUX 3 (domyślny model strony zostaje FLUX 3).
- Wybierz ścieżkę z tabeli powyżej.
- Wklej Prompt A (tekst) albo Prompt B (ze zdjęcia na wideo) z prawdziwym rzeczownikiem produktu.
- Oceń checklistą poniżej → zachowaj jednego zwycięzcę.
- Opcjonalnie: dopracuj kadr na obrazie, potem ożyw ponownie.
Pierwsze szkice celuj w ok. 8–12 sekund, nawet jeśli materiały publiczne mówią o klipach do ok. 20 sekund (The Decoder; blog BFL). Krótsze ujęcia łatwiej czyta się na telefonie.
Prompt A — z tekstu na wideo, wiele ujęć (do skopiowania)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — ze zdjęcia na wideo z zamkniętego kadru (do skopiowania)
Użyj po dołączeniu czystego kadru produktu albo postaci na wideo.
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — rzemiosło kadru, potem ożywienie (hybrydowy tekst na stronę obrazu)
Wygeneruj czysty, zatwierdzony kadr na obrazie, potem użyj Prompt B:
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
Checklista zaliczenia/odrzucenia (działa na obu ścieżkach)
Obejrzyj raz bez scrubowania, potem scrubuj:
- Dopasowanie ścieżki — wymyślałeś, gdy trzeba było zamykać, albo zamykałeś, gdy potrzebowałeś swobody?
- Tożsamość / produkt — ta sama twarz, garderoba albo logo przez cały klip?
- Dłonie / krawędzie — topiące się pudełko, dodatkowe palce, ślizgające etykiety?
- Dźwięk — pasuje do zdarzeń, czy prosiłeś o ciszę? Natywny dźwięk jest częścią oficjalnej historii multimodalnej (@bfl_ai; The Decoder).
- Kadr — temat bezpieczny dla 9:16 Reels/TikTok (trzymaj środki czytelne pod reklamy w feedzie — zobacz przegląd Meta Ads i TikTok Ads Help).
- Śmieci tekstu — losowe glify albo znaki wodne?
Dwa odpady → zmień ścieżkę albo kadr, nie dokładaj samych przymiotników.
Typowe błędy
| Błąd | Czemu boli | Naprawa | | --- | --- | --- | | Z tekstu na wideo przy legalnym opakowaniu | Logo się wymyśla | Prawdziwy kadr + ze zdjęcia na wideo | | Prompt ze zdjęcia na wideo przepisuje produkt | Walczy z kadrem | Tylko ruch/kamera/dźwięk | | Zatłoczony kadr (wiele obiektów) | Ruch nie łapie tematu | Przytnij do jednego hero | | Brak listy ujęć na obu ścieżkach | Ciągła papka | Numeruj Shot 1/2/3 | | Max długość za pierwszym razem | Nieczytelne ujęcia | Zacznij od ~8–12 s | | Muzyka + dialog + SFX naraz | Mętny dźwięk | Jedna linia priorytetu dźwięku |
Zwycięzcy scenariuszy (jeśli / to)
| Jeśli… | To zacznij od… | Dlaczego | | --- | --- | --- | | Masz tylko pomysł w jednej linii | Z tekstu na wideo | Najszybsza pętla | | Marka przysłała packshot PNG | Ze zdjęcia na wideo | Geometria już jest prawdą | | Postać wygląda dobrze tylko w jednym kadrze | Hybryda | Zamroź wygląd, zmieniaj kamerę | | Test dialogu wielu ujęć | Najpierw z tekstu na wideo | Gramatyka przed zatwierdzonymi kadrami | | Logo odpadło dwa razy w tekście | Stop → kadr + i2v | Nie pal więcej przebiegów wymyślania | | Eksplorujesz camcorder vs styl animacji | Z tekstu na wideo | Styl jest eksperymentem (zakres stylu BFL) |
Co wiemy, a czego nie twierdzimy
| Wiemy (ze źródeł) | Nie wiemy / nie twierdzimy | | --- | --- | | Publiczna premiera FLUX 3 23 lipca 2026 z ramami multimodalnego wideo + dźwięku (@bfl_ai; blog BFL; podsumowanie agencyjne) | Że każdy host udostępnia identyczne sterowanie klatką startową albo czasami trwania | | Oficjalna lista wideo obejmuje z tekstu na wideo i ze zdjęcia na wideo (klatka startowa albo referencje obrazu) (blog BFL) | Gwarantowanej perfekcji logo za pierwszym razem dla każdego SKU | | Klipy do ok. 20 sekund z natywnym dźwiękiem pojawiają się w materiałach publicznych (blog BFL; The Decoder) | Że dłużej zawsze jest lepiej do reklam social | | Łączenie wielu ujęć pojawia się we wczesnych notatkach twórców (venturetwins) | Niezależnych certyfikatów branży filmowej, które na stałe uznają jedną ścieżkę za „lepszą” |
FAQ
Jaka jest różnica między FLUX 3 z tekstu na wideo a ze zdjęcia na wideo?
Z tekstu na wideo buduje klip z samego promptu. Ze zdjęcia na wideo opiera klip na kadrze — albo jako klatkę startową do animacji, albo jako referencję wizualną — potem idzie za Twoimi wskazówkami ruchu i dźwięku (blog BFL).
Którą ścieżkę wybrać najpierw na flux3.video?
Jeśli nie masz zatwierdzonego kadru, zacznij z tekstu na wideo. Jeśli wygląd marki jest już ustalony, zacznij ze zdjęcia na wideo w tym samym generatorze wideo.
Czy mogę użyć obu w jednym projekcie?
Tak. Wiele zespołów odkrywa tekstem, zamyka kadr na obrazie albo ze zdjęcia, potem kończy ze zdjęcia na wideo.
Czy ze zdjęcia na wideo obejmuje dźwięk?
Publiczna lista możliwości wideo FLUX 3 wymienia natywną generację dźwięku na wyjściach, w tym ścieżki kondycjonowane obrazem w tym samym zestawie (blog BFL; The Decoder). I tak posłuchaj każdego take’u.
Jak długi powinien być pierwszy klip?
Publiczna narracja sufitu to ok. 20 sekund (blog BFL). Do decyzji zacznij od 8–12 sekund, żeby jakość ścieżki była oczywista.
Dlaczego logo produktu pęka, gdy startujesz z tekstu na wideo?
Model wymyśla piksele. Przełącz na prawdziwy kadr + ze zdjęcia na wideo i zabroń nowego tekstu w prompcie.
Dlaczego ze zdjęcia na wideo ignoruje mój kadr?
Zwykle kadr jest zatłoczony albo prompt opisuje od nowa inny produkt. Przytnij do jednego tematu; pisz tylko ruch + kamerę + dźwięk.
Czy potrzebuję generatora obrazów?
Tylko do hybrydowych kadrów. Czysty tekst i czyste zdjęcie→wideo mogą go pominąć. Kadry żyją na obrazie, gdy ich potrzebujesz.
Gdzie pasują prompty wielu ujęć?
Na obu ścieżkach. Numeruj ujęcia wprost — zobacz wiele ujęć i natywny dźwięk.
Czy to to samo co artykuł rankingowy konkurencyjnych modeli?
Nie. Ta strona to wybór ścieżki wewnątrz FLUX 3. Kryteria vs inne systemy: FLUX 3 vs konkurencyjne modele wideo AI.
Gdzie wypróbować za darmo?
Otwórz wideo FLUX 3 na flux3.video i zacznij za darmo — karta nie jest potrzebna na początek.
O Reese Okada
Reese Okada jest autorem workflow wideo AI. Zamienia prompty wielu ujęć w powtarzalne workflow przeglądarkowe na FLUX 3. Ten przewodnik skupia się na wyborze tekst vs najpierw kadr, żeby darmowe przebiegi szły na ścieżkę, która pasuje do zadania.
