Limitowana oferta 30% taniej!Odbierz ofertę

FLUX 3 Video: wiele ujęć, klipy ~20 s i natywny dźwięk

Autor Reese Okada · Opublikowano 2026-07-24 flux-3flux3multi-shottext-to-videoimage-to-videonative-audiohow-to
FLUX 3 Video: wiele ujęć, klipy ~20 s i natywny dźwięk

Większość promptów wideo AI wciąż brzmi jak jeden ciągły ruch kamery: „cinematic drone over a forest, epic, 8k.” FLUX 3 jest publicznie ustawiony ostrzej — kilka ujęć z jednego promptu, klipy do ok. 20 sekund i natywny dźwięk, który jedzie z obrazem (premiera Black Forest Labs; blog BFL; wczesne notatki o wielu ujęciach Justine Moore; relacje o czasie trwania/dźwięku w The Decoder).

To przewodnik, nie kolejna recenzja premiery. Mapę wydania znajdziesz w Czym jest FLUX 3?. Tu nauczysz się pisać prompty wielu ujęć, kiedy startować od kadru, jak sterować dźwiękiem i jak zaliczyć/odrzucić take w generatorze wideo FLUX 3 na flux3.video.

W skrócie

  1. Otwórz wideo FLUX 3.
  2. Napisz Shot 1 / Shot 2 / Shot 3 (kto, kamera, akcja) zamiast jednego mgławicowego klimatu.
  3. Ogranicz ambicję: w pierwszych szkicach celuj w czytelność ~8–12 s, zanim maxujesz długość.
  4. Dodaj intencję dźwięku (atmosfera / SFX / bez muzyki) w jednej linii.
  5. Pełny ekran: twarze, logika cięć, dłonie, ruch warg przy mowie, kadr pod Reels.
  6. Opcjonalnie: zamknij kadr hero na obrazie, potem ze zdjęcia na wideo.

Kluczowe wnioski

  • Wiele ujęć to umiejętność pierwszej klasy: twórcy z wczesnym dostępem podkreślają kilka kątów w jednej generacji (venturetwins).
  • ~20 s to publiczna narracja sufitu — nie wymóg każdego take’u (The Decoder).
  • Natywny dźwięk znaczy, że możesz podać atmosferę/SFX/energię dialogu zamiast zawsze dokładać post-sync później (premiera BFL; The Decoder).
  • Struktura promptu bije przymiotniki: numeruj ujęcia, nazywaj kamerę, zamrażaj ciągłość garderoby.
  • Strona, na której wydajesz Credits: wszystko poniżej działa na generatorze wideo (z tekstu na wideo i ze zdjęcia na wideo).

Zanim zaczniesz (checklista 60 sekund)

| Sprawdź | Po co | | --- | --- | | Masz prawdziwe zadanie (reklama UGC, obrót produktu, scena dialogu) | Losowe „epic” prompty marnują darmowe przebiegi | | Potrafisz wypisać 2–4 ujęcia na papierze | Modele wielu ujęć nagradzają wyraźne cięcia | | Garderoba / temat to jedna czytelna linia | Dryf tożsamości często zaczyna się od mgławicowych postaci | | Znasz proporcje (9:16, 16:9, 1:1) | Przycięcie pod social obcina ważne elementy ze środka kadru | | Obejrzysz raz na pełnym ekranie | Miniatury kłamią o twarzach i dłoniach |

Krok 1 — Otwórz generator wideo FLUX 3

Wejdź na wideo FLUX 3. Zostaw FLUX 3 jako domyślny model wideo strony. Zostań na tej stronie zarówno przy z tekstu na wideo, jak i ze zdjęcia na wideo — do podstawowej pętli nie potrzebujesz drugiego produktu.

Najpierw kadry? Wygeneruj albo dopracuj kadr hero na obrazie FLUX 3, pobierz/zapisz, potem ożyw na wideo.

Krok 2 — Pisz prompty wielu ujęć (rdzeń umiejętności)

Używaj tego szkieletu za każdym razem:

  1. Linia formatu — zamierzony czas, proporcje, gatunek.
  2. Lista ujęć — Shot 1 wide / Shot 2 medium / Shot 3 close (czasowniki akcji).
  3. Linia ciągłości — te same osoby, te same ubrania, to samo miejsce.
  4. Linia dźwięku — atmosfera, SFX, dialog albo cisza.
  5. Negatywy — bez znaku wodnego, bez dodatkowych logotypów, bez losowego tekstu.

Prompt 1 — unbox produktu w wielu ujęciach (do skopiowania)

Vertical 9:16 product ad, about 10 seconds, clean desk daylight.
Shot 1 wide: sealed matte white product box on oak table, soft window light.
Shot 2 medium: hands open the box lid smoothly, tissue paper folds clearly.
Shot 3 close-up: wireless earbuds lift toward camera, subtle specular highlight.
Same hands, same box branding color, continuous desk environment.
Soft paper rustle and light whoosh SFX, no music bed, no on-screen text, no watermark.

Prompt 2 — dialog w wielu ujęciach

Horizontal short scene, about 12 seconds, warm kitchen night.
Shot 1 medium two-shot: two friends at a small table, tea cups, fairy lights bokeh.
Shot 2 over-shoulder: person A speaks with natural lip motion, soft smile.
Shot 3 reaction close-up: person B laughs, eyes crinkle, steam rises from cup.
Same wardrobe and hairstyles across all shots, consistent table props.
Quiet room tone plus light cup clink SFX; dialogue energy, no loud score, no subtitles, no watermark.

Prompt 3 — prosta akcja na zewnątrz w wielu ujęciach

Horizontal action clip, about 8 seconds, golden hour park path.
Shot 1 wide tracking: runner in red jacket jogs toward camera on gravel path.
Shot 2 side medium: arms and jacket fabric motion, trees streak softly.
Shot 3 low angle hero: runner passes, dust motes in sunbeams.
Same red jacket and black shorts throughout.
Footsteps and light wind ambience, no music, no text, no watermark.

Klatka kluczowa stylu z tekstu na wideo — storytelling od ruchu · showcase na FLUX 3

Język ruchu od promptu · klatka kluczowa showcase na FLUX 3 · kadr w stylu generacji do planowania, nie oceniony kadr filmowy

Krok 3 — Dodawaj natywny dźwięk celowo

Publiczna historia FLUX 3 obejmuje natywny dźwięk razem z wideo (BFL; The Decoder). Traktuj dźwięk jak linię reżyserii, nie dopisek na końcu:

| Intencja | Przykładowa linia | | --- | --- | | Tylko atmosfera | „city night ambience and light rain, no music, no dialogue” | | Uderzenie SFX | „soft whoosh on logo settle, no voiceover” | | Energia dialogu | „natural conversational speech, quiet room tone, no score” | | Cisza | „no music, no SFX, no dialogue—picture only” |

Wskazówka lipsync: mówiącą twarz dawaj w ujęciu zbliżonym lub średnim i napisz wprost „natural lip motion” (Prompt 2). Ekstremalne szerokie ujęcia całego ciała utrudniają ocenę ust.

Krok 4 — Z tekstu na wideo kontra ze zdjęcia na wideo

| Start od | Kiedy użyć | Ścieżka | | --- | --- | --- | | Z tekstu na wideo | Wymyślasz całą scenę | Generator wideo | | Ze zdjęcia na wideo | Masz już zdjęcie produktu, kadr postaci albo plakat | Ta sama strona wideo; opcjonalny kadr z obrazu |

Przepis ze zdjęcia na wideo: trzymaj kadr prosty (jeden temat, czytelne krawędzie), potem promptuj tylko ruch + kamerę + dźwięk — nie opisuj ponownie innego stroju.

Image-to-video, 6 seconds, gentle push-in.
Preserve the exact product, colors, and logo from the reference still.
Soft studio light consistency, subtle rotation of the product, clean background.
Soft whoosh SFX, no new text, no watermark.

Krok 5 — Checklista zaliczenia/odrzucenia (pełny ekran)

Obejrzyj raz bez scrubowania, potem scrubuj:

  1. Logika cięć — czy Shot 1→2→3 czyta się jako zamierzone?
  2. Tożsamość — ta sama twarz, włosy, garderoba między cięciami?
  3. Dłonie / rekwizyty — dodatkowe palce, topiące się pudełka, ślizgające etykiety?
  4. Dopasowanie dźwięku — czy dźwięk pasuje do zdarzeń (albo czy prosiłeś o ciszę)?
  5. Kadr — twarze i produkt bezpieczne dla 9:16?
  6. Śmieci tekstu — losowe glify albo znaki wodne?

Jeśli dwa punkty odpadają, przepisz listę ujęć zanim spalasz kolejne przebiegi. Zwykle naprawa to krótsze, czytelniejsze ujęcia, nie więcej przymiotników.

Typowe tryby porażki (i naprawy)

| Objaw | Prawdopodobna przyczyna | Naprawa | | --- | --- | --- | | Jeden długi ciągły take | Brak ponumerowanych ujęć | Dodaj wyraźne Shot 1/2/3 | | Postać morphuje między cięciami | Mgławicowa garderoba | Jedno zdanie blokujące ubrania/włosy | | Zatłoczony dźwięk | Konflikt muzyki + dialogu + SFX | Wybierz jeden priorytet dźwięku | | Świetna twarz, słabe logo produktu | Za dużo chaosu kamery | Wolny najazd; mniej cięć | | Dobry 16:9, zepsuty 9:16 | Brak proporcji w prompcie | Podaj pion 9:16 + temat na środku |

Jak odpalić pętlę oceny w 3 krokach na FLUX 3

  1. Otwórz wideo FLUX 3.
  2. Wklej Prompt 1 (albo swój prawdziwy opis w szkielecie).
  3. Oceń listą zaliczenia/odrzucenia → zapisz udany klip → opcjonalnie dopracuj ze zdjęcia na wideo z kadru na obrazie.

FAQ

Czym wideo FLUX 3 różni się przy promptowaniu?

Publiczne notatki twórców podkreślają kontrolę wielu ujęć z jednego promptu i mocniejszy mikro-detail (venturetwins; premiera BFL). Pisz cięcia, nie tylko nastroje.

Jak długi powinien być mój pierwszy klip FLUX 3?

Materiały publiczne mówią o generacjach do ok. 20 sekund (The Decoder). Żeby uczyć się wielu ujęć, zacznij od ok. 8–12 sekund, żeby każde ujęcie zostało czytelne.

Ile ujęć prosić?

Dwa do czterech w pierwszych szkicach. Więcej ujęć podnosi ryzyko ciągłości, zanim masz stabilną linię postaci.

Czy FLUX 3 robi natywny dźwięk i lipsync?

Natywny dźwięk jest częścią oficjalnej historii multimodalnej (BFL; The Decoder). Dema społeczności podkreślają też ruch warg — zawsze posłuchaj i przybliż własne take’y.

Z tekstu na wideo czy ze zdjęcia na wideo?

Z tekstu na wideo do wymyślonych scen; ze zdjęcia na wideo, gdy kadry marki już istnieją. Oba są na generatorze wideo.

Czy potrzebuję strony obrazu?

Tylko jeśli chcesz najpierw kontrolowany kadr. Generuj na obrazie, potem ożyw na wideo.

Dlaczego moje wiele ujęć zapada się w jeden ciągły take?

Promptowi pewnie brakuje ponumerowanych ujęć i rozmiarów kamery. Użyj szkieletu z Kroku 2.

Czy mogę zakazać muzyki?

Tak — w linii dźwięku napisz „no music bed” albo „picture only, no SFX”.

Gdzie wypróbować to za darmo?

Otwórz wideo FLUX 3 na flux3.video i zacznij za darmo — karta nie jest potrzebna na początek.

Co czytać dalej?

Przegląd premiery: Czym jest FLUX 3?.

O Reese Okada

Reese Okada jest autorem workflow wideo AI. Zamienia prompty wielu ujęć w powtarzalne workflow przeglądarkowe na FLUX 3.

More Posts