23 lipca 2026 Black Forest Labs przedstawiło FLUX 3 — multimodalny model z czołówki, ustawiony jako jeden system do obrazu, wideo, dźwięku i predykcji akcji, a nie zestaw osobnych narzędzi zszytych wspólnym interfejsem (oficjalny wątek zapowiedzi; blog BFL; strona modeli BFL).
Publiczna opowieść jest prosta: wspólne trenowanie wielu modalności, żeby generacje były bliższe życiu w różnych stylach — także codziennych, niekinematograficznych (post premierowy BFL; Business Wire / Markets Insider).
Ten artykuł to mapa premiery dla twórców: co naprawdę twierdzą materiały oficjalne, które możliwości wideo liczą się najpierw (długość, wiele ujęć, natywny dźwięk) i jak wypróbować FLUX 3 za darmo w przeglądarce na flux3.video. Praktyczny workflow wielu ujęć znajdziesz w przewodniku: FLUX 3 Video: wiele ujęć, klipy ~20 s i natywny dźwięk.
W skrócie
FLUX 3 to multimodalny model bazowy Black Forest Labs z 23 lipca 2026. Oficjalne ustawienie: jedna architektura, która uczy się wspólnie z obrazów, wideo i dźwięku, plus ścieżka predykcji akcji dla partnerów robotycznych (blog BFL; modele BFL). Publiczne atuty wideo: klipy do ok. 20 sekund, sekwencje wielu ujęć z jednego promptu i natywny dźwięk (efekty, atmosfera, dialog) (The Decoder, podsumowanie materiałów BFL; notatki z wczesnego dostępu Justine Moore / a16z). Na FLUX 3 (tej stronie) otwórz generator wideo albo generator obrazów i zacznij za darmo — karta nie jest potrzebna do próby.
Kluczowe wnioski
- Data premiery: 23 lipca 2026 — publiczny start FLUX 3 (@bfl_ai; bfl.ai/blog/flux-3).
- Zakres: obraz + wideo + dźwięk + predykcja akcji w jednym multimodalnym projekcie (modele BFL; komunikat agencyjny).
- Główne atuty wideo: generacja do ~20 s, wiele ujęć z jednego promptu, natywny dźwięk (The Decoder; wczesne notatki venturetwins).
- Kontekst serii: FLUX.1 (era obrazu 2024) → FLUX.2 obraz/edycja (listopad 2025) → FLUX 3 multimodalne modele świata rzeczywistego (post BFL o FLUX.2; post BFL o FLUX 3).
- Ścieżka próby tutaj: wideo FLUX 3 (domyślnie do krótkich klipów) i obraz FLUX 3 w tej samej przestrzeni produktu.
Co faktycznie wyszło
1. Jedna multimodalna obietnica — nie „wideo doklejone do obrazu”
Black Forest Labs opisuje FLUX 3 jako wspólne uczenie się z obrazów, wideo i dźwięku w jednej architekturze, bo żadna pojedyncza modalność nie oddaje świata sama (blog BFL; The Decoder). Firma ustawia to jako krok ku wizualnej inteligencji świata rzeczywistego — modele, które postrzegają, przewidują i (przez partnerów) działają (wątek zapowiedzi BFL).

Język kadru od codzienności do kina · kadr showcase na FLUX 3
2. Wideo: długość, wiele ujęć, natywny dźwięk
Materiały publiczne i relacje z tygodnia premiery podkreślają:
| Możliwość | Publiczna deklaracja | Główne źródła | | --- | --- | --- | | Czas trwania | Klipy wideo do ok. 20 sekund | The Decoder; CryptoBriefing | | Wiele ujęć | Kilka ujęć / kątów z jednego promptu | Justine Moore (a16z) | | Natywny dźwięk | Dźwięk zsynchronizowany z klipem (SFX, atmosfera, ścieżki dialogu) | ramy premiery BFL; The Decoder | | Interfejsy | Z tekstu na wideo, ze zdjęcia na wideo i pokrewne workflow wideo w publicznej narracji | The Decoder; ścieżka produktu na generatorze wideo tej strony |
Wczesne tabele preferencji z relacji premierowych (np. krótkie porównania 720p z innymi systemami wideo) to wstępne sygnały raportowane przez dostawcę, nie niezależne certyfikaty branży filmowej (podsumowanie wykresu The Decoder). Traktuj je jako kontekst, a potem oceń własne prompty.

Język ruchu od promptu · klatka kluczowa showcase na FLUX 3
3. Ścieżka obrazu w tej samej rodzinie
Oficjalne posty pokazują próbki FLUX 3 Image i opisują syntezę oraz edycję w różnych stylach, proporcjach i rozdzielczościach jako część multimodalnego systemu (próbki PS w wątku BFL; blog BFL). Na tym produkcie kadry żyją w generatorze obrazów z FLUX 3 jako domyślnym modelem obrazu strony.
4. Akcja / robotyka (kontekst, nie główne CTA dla twórców)
BFL ogłosiło też pracę FLUX-mimic z Mimic Robotics, w tym narracje testów przemysłowych z Audi (post o akcji w wątku premierowym BFL; komunikat agencyjny). To ważne dla historii „modelu świata”. Do reklam social, dem produktu i krótkich filmów praktyczna powierzchnia to nadal generacja wideo + obrazu.
5. Oś czasu serii (FLUX → FLUX.2 → FLUX 3)
| Generacja | Publiczny motyw | Kotwica | | --- | --- | --- | | Era FLUX.1 | Fala otwartej/generacji obrazu, która uczyniła FLUX domyślnym wyborem twórców | Historia serii na BFL / przegląd Wikipedia | | FLUX.2 | Produkcyjna generacja i edycja obrazu (wiele referencji, wyższa wierność) | blog FLUX.2, 25 listopada 2025 | | FLUX 3 | Multimodalny rdzeń wideo + dźwięk + obraz | blog FLUX 3, 23 lipca 2026 |
Dokładniej: dla kogo jest FLUX 3
Marketerzy social i UGC
Krótkie klipy, które trzymają twarze, ruch i codzienne światło — bez wynajmowania całego dnia zdjęciowego — to zadania, które odblokowują wiele ujęć + natywny dźwięk. Zacznij od z tekstu na wideo.
Zespoły produktowe i growth
Ze zdjęcia na wideo zamienia kadr opakowania albo hero produktu w pierwszy ruch reklamy. Weź czysty kadr, potem ożyw go w tej samej przestrzeni wideo.
Filmowcy AI i storyboarderzy
Wiele ujęć z jednego promptu to wyróżnik, o którym twórcy z tygodnia premiery wciąż piszą (venturetwins). Traktuj wczesne wyniki jako edytowalne pierwsze przebiegi, potem dopracuj prompty ujęcie po ujęciu.
Designerzy kadrów, którzy już żyją we FLUX
Jeśli znasz FLUX ze stilli, publiczna opowieść FLUX 3 brzmi: „ta sama rodzina, teraz czas + dźwięk”. Kadry zostaw na obrazie, ruch na wideo.
Co wiemy, a czego nie twierdzimy
| Wiemy (ze źródeł) | Nie wiemy / nie twierdzimy | | --- | --- | | Publiczna premiera 23 lipca 2026 z pozycjonowaniem multimodalnym (@bfl_ai; blog BFL) | Że każdy host, rozdzielczość albo przełącznik czasu trwania jest identyczny we wszystkich produktach na świecie | | Narracja wideo obejmuje ~20 s, wiele ujęć, natywny dźwięk (The Decoder) | Gwarantowanej perfekcji za pierwszym razem dla każdej twarzy, dłoni i obrotu całego ciała | | Wczesne wyniki preferencji w relacjach premierowych są wstępne (The Decoder) | Niezależnych, recenzowanych rankingów, które koronują stałego „#1 modelu wideo” | | FLUX.2 ustalił mocny rozdział obrazu (BFL FLUX.2) | Że kadry i wideo zawsze dzielą dokładnie ten sam odcisk estetyczny na każdym seedzie | | Ta strona udostępnia przeglądarkowe generatory wideo i obrazu do workflow FLUX 3 | Tabel cen dolar-za-sekundę między dostawcami (tu ich nie porównujemy) |
Dlaczego to ma znaczenie dla twórców narzędzi
- Wideo + dźwięk w jednej generacji ogranicza skakanie między narzędziami przy pierwszych reklamach i explainerach.
- Promptowanie wielu ujęć zmienia sposób pisania zlecenia — zapisujesz cięcia, nie tylko klimat (wczesne notatki o wielu ujęciach).
- Ciągłość marki FLUX pomaga zespołom, które już promptują językiem stilli FLUX, przenieść pracę ruchową bez nowego modelu myślenia.
- Ścieżka próby w przeglądarce wygrywa z czekaniem na idealną lokalną instalację, gdy chcesz tylko wiedzieć, czy Twój kadr produktu utrzyma się w ruchu.
Jak samodzielnie ocenić FLUX 3 na tej stronie
- Otwórz generator wideo FLUX 3.
- Wklej Prompt A poniżej (wiele ujęć).
- Obejrzyj raz na pełnym ekranie: twarze, czytelność cięć, dopasowanie dźwięku (jeśli jest) i czy kadr 9:16 nie obcina motywu.
- Zapisz udane klipy; opcjonalnie drugi przebieg ze zdjęcia na wideo z kadru, który już Ci się podoba, na obrazie.
Prompt A — wiele ujęć: walka w ogrodzie
Multi-shot short film, 12 seconds, playful daylight backyard.
Shot 1 wide: two kids jousting with bright pool noodles, green grass, summer sun.
Shot 2 medium: slow motion near-miss as noodles clash, fabric and hair motion clear.
Shot 3 close-up: both kids laughing, natural faces, soft bokeh fence in background.
Natural ambient audio feel, no music bed, no text overlays, no watermark.
Prompt B — obrót hero produktu
Product commercial, 8 seconds, clean studio.
Shot 1: matte black wireless earbuds case on white seamless, soft key light.
Shot 2: lid opens smoothly, earbuds catch a specular highlight.
Shot 3: earbud floats closer to camera, macro detail on mesh.
Subtle whoosh SFX energy, no logos other than the product shape, no watermark.
Prompt C — deszczowa neonowa ulica (nastrój)
Cinematic street clip, 10 seconds, night rain, neon reflections.
Single continuous push-in toward a woman laughing under a translucent umbrella,
wet asphalt, cyan and magenta signs, handheld micro-motion, natural skin texture.
City ambience and light rain SFX, no dialogue, no on-screen text, no watermark.
Co oglądać dalej
- Przepisy twórców na wiele ujęć (listy ujęć jako prompty) — zobacz nasz przewodnik po wielu ujęciach.
- Workflow obrazu dla kadrów, które karmią ze zdjęcia na wideo (generator obrazów).
- Oficjalne notatki badawcze BFL o Self-Flow / multimodalnym rdzeniu, gdy publikują więcej (hub badań BFL przez podsumowanie architektury The Decoder).
FAQ
Czym jest FLUX 3?
FLUX 3 to multimodalny model bazowy Black Forest Labs z 23 lipca 2026 do obrazu, wideo, dźwięku i predykcji akcji, trenowany wspólnie, a nie jako osobne modele jednozadaniowe (blog BFL; wątek premierowy).
Czy FLUX 3 to tylko model wideo?
Nie. Materiały publiczne opisują ścieżki wideo, obrazu, dźwięku i akcji w jednym multimodalnym projekcie (modele BFL). Na tej stronie możesz zacząć od wideo albo obrazu.
Jak długie mogą być wideo FLUX 3?
Relacje z premiery podają klipy do ok. 20 sekund w publicznej narracji BFL (The Decoder). Zawsze potwierdź sterowanie czasem trwania dostępne w interfejsie generatora przy Twoim przebiegu.
Czy FLUX 3 obsługuje wiele ujęć w jednym prompcie?
Tak — to wyróżnik tygodnia premiery wśród twórców: kilka ujęć z jednego promptu (venturetwins). Dla lepszej kontroli pisz wyraźne linie Shot 1 / Shot 2 / Shot 3.
Czym jest natywny dźwięk w FLUX 3?
Natywny dźwięk oznacza, że model może wygenerować dźwięk razem z wideo — w relacjach publicznych pojawiają się atmosfera, SFX i dema zorientowane na dialog (The Decoder; premiera BFL).
Czym FLUX 3 różni się od FLUX.2?
FLUX.2 (listopad 2025) to produkcyjny rozdział generacji i edycji obrazu (BFL FLUX.2). FLUX 3 rozszerza rodzinę o multimodalny system z pełnoprawnym storytellingiem wideo + dźwięk (BFL FLUX 3).
Czy mogę wypróbować FLUX 3 za darmo online?
Tak. Otwórz generator wideo FLUX 3 na flux3.video, żeby zacząć za darmo — karta nie jest potrzebna na start. Kadry: generator obrazów.
Z tekstu na wideo czy ze zdjęcia na wideo — co pierwsze?
Użyj z tekstu na wideo, gdy wymyślasz scenę od zera. Użyj ze zdjęcia na wideo, gdy masz już zdjęcie produktu albo kadr postaci, który chcesz ożywić — oba tryby są pod wideo.
Czy opublikowane porównania wskaźników wygranych są ostateczne?
Nie. Wczesne wskaźniki preferencji w artykułach premierowych to wstępne sygnały raportowane przez dostawcę w określonych warunkach testu (The Decoder). Do decyzji, które mają znaczenie, odpal własne prompty.
Od czego zacząć teraz?
Wklej Prompt A do generatora wideo, obejrzyj raz na pełnym ekranie, potem iteruj opisy ujęć — nie same przymiotniki.
O Avery Lin
Avery Lin jest analitykiem premier modeli AI. Śledzi starty rodziny FLUX i zamienia publiczne fakty o modelach w jasne ścieżki próby dla twórców na FLUX 3.
