TLDR
FLUX 3 是 Black Forest Labs 在 2026 年 7 月 23 日發布的多模態基礎模型。官方定位:一套架構同時從圖像、影片與音訊學習,並可延伸到機器人夥伴的動作預測路徑(BFL 博客;BFL 模型頁)。公開影片亮點包括:約 20 秒量級片段、單 prompt 多鏡頭,以及 native audio(音效、環境聲、對話向)(The Decoder 對 BFL 材料的摘要;Justine Moore / a16z 早期筆記)。在本站 FLUX 3,打開 影片生成器 或 圖像生成器 即可免費開試——無需先綁卡。
核心要點
- 發布日: 公開啓動為 2026 年 7 月 23 日(@bfl_ai;bfl.ai/blog/flux-3)。
- 範圍: 圖像 + 影片 + 音訊 + 動作預測,統一多模態設計(BFL 模型頁;通稿)。
- 影片賣點: 約 ~20s 生成、單 prompt 多鏡頭、原生音訊(The Decoder;venturetwins)。
- 系列脈絡: FLUX.1(2024 圖像時代)→ FLUX.2 圖像/編輯(2025-11)→ FLUX 3 多模態「真實世界」模型(BFL FLUX.2;BFL FLUX 3)。
- 本站試用: FLUX 3 影片(短片預設)與 FLUX 3 圖像 同一工作區。
實際發布了什麼
1. 統一多模態敘事——不是「影片硬掛在圖像上」
Black Forest Labs 將 FLUX 3 描述為在統一架構內從圖像、影片與音訊聯合學習,因為單一模態無法完整刻畫世界(BFL 博客;The Decoder)。公司將其框定為邁向 real-world visual intelligence——能夠感知、預測,並經夥伴路徑行動的模型(BFL 宣布串文)。

從日常到電影感的畫面語言 · FLUX 3 showcase 風格靜幀
2. 影片:時長、多鏡頭、原生音訊
公開材料與首周報道強調:
| 能力 | 公開表述 | 主要來源 | | --- | --- | --- | | 時長 | 影片片段約 20 秒量級 | The Decoder;CryptoBriefing | | 多鏡頭 | 一條 prompt 出多機位 / 多鏡頭 | Justine Moore (a16z) | | 原生音訊 | 與畫面對齊的聲音(SFX、環境、對話向) | BFL 發布框架;The Decoder | | 接口敘事 | 文生影片、圖生影片及相關工作流 | The Decoder;本站 影片生成器 |
發布報道中的早期偏好對照(例如短 720p 對比)屬於廠商側早期信號,不是電影工業級獨立認證(The Decoder 圖表摘要)。把它當背景資訊,最終以你自己的 prompt 成片為準。

Prompt-first 的運動語言 · FLUX 3 showcase 關鍵幀
3. 同一家族的圖像路徑
官方帖展示了 FLUX 3 Image 樣張,並將多種風格、畫幅與分辨率的合成/編輯納入多模態棧(BFL 串文 PS 樣張;BFL 博客)。在本站,靜幀走 圖像生成器,預設房屋圖像能力為 FLUX 3。
4. 動作 / 機器人(背景,不是創作者主 CTA)
BFL 還公布了與 Mimic Robotics 的 FLUX-mimic 合作,以及涉及 Audi 的工業測試敘事(BFL 動作帖;通稿)。這對「世界模型」故事重要;對社媒廣告、產品演示與短片,實用面仍是 影片 + 圖像生成。
5. 系列時間線(FLUX → FLUX.2 → FLUX 3)
| 代際 | 公開主題 | 錨點 | | --- | --- | --- | | FLUX.1 時代 | 開放/圖像生成浪潮,讓 FLUX 成為創作者預設項之一 | BFL 系列史 / Wikipedia 概覽 | | FLUX.2 | 生產級圖像生成與編輯 | FLUX.2 博客,2025-11-25 | | FLUX 3 | 多模態 影片 + 音訊 + 圖像 骨幹 | FLUX 3 博客,2026-07-23 |
深挖:誰最適合用 FLUX 3
社媒與 UGC 營銷
需要短片穩住臉、動作與日常光線,又不想請整天製作班底——多鏡頭 + 原生音訊正是這類工作。從 文生影片 開始。
產品與增長團隊
圖生影片把包裝靜幀或英雄產品圖變成可動的一版廣告草稿。先備好乾淨靜幀,再在同一 影片工作區 加運動。
AI 電影與分鏡創作者
單 prompt 多鏡頭是發布周創作者反覆強調的差異點(venturetwins)。把早期輸出當可改第一遍,再按鏡頭改寫 prompt。
已在用 FLUX 做靜幀的設計者
若你熟悉 FLUX 靜幀,FLUX 3 的公開故事是「同一家族,現在有時間軸與聲音」。靜幀繼續用 圖像,運動用 影片。
我們確認什麼 vs 暫不宣稱什麼
| 我們確認(有來源) | 暫不宣稱 | | --- | --- | | 公開啓動 2026-07-23 與多模態定位(@bfl_ai;BFL 博客) | 全球所有託管端、分辨率與時長控件完全一致 | | 影片敘事包含約 20s、多鏡頭、原生音訊(The Decoder) | 每次臉、手、全身轉場都一次過完美 | | 發布報道中有早期偏好分數,且為初步(The Decoder) | 存在一錘定音的獨立「永久 #1 影片模型」榜 | | FLUX.2 已奠定強 圖像 篇章(BFL FLUX.2) | 靜幀與影片在每個 seed 上審美完全一致 | | 本站提供瀏覽器 影片 與 圖像 的 FLUX 3 工作流 | 跨廠商按秒計價對照表(本文不做) |
對創作者意味著什麼
- 影片 + 音訊一次生成,廣告與講解片第一遍少跳工具。
- 多鏡頭 prompting 改變 brief 寫法——寫分鏡,不只寫氛圍(多鏡頭早期筆記)。
- FLUX 品牌連續性 讓已會寫 FLUX 靜幀的團隊遷移到運動側更自然。
- 瀏覽器試用 往往比等完美本地安裝更適合回答:你的產品鏡頭動起來是否成立。
如何在本站自己驗收 FLUX 3
- 打開 FLUX 3 影片生成器。
- 粘貼下方 Prompt A(多鏡頭)。
- 全屏看一遍:臉、分鏡是否清楚、音訊是否貼合(若有)、9:16 裁切是否安全。
- 保存 keepers;可選從 圖像 靜幀再跑圖生影片。
Prompt A — 多鏡頭後院對決
Multi-shot short film, 12 seconds, playful daylight backyard.
Shot 1 wide: two kids jousting with bright pool noodles, green grass, summer sun.
Shot 2 medium: slow motion near-miss as noodles clash, fabric and hair motion clear.
Shot 3 close-up: both kids laughing, natural faces, soft bokeh fence in background.
Natural ambient audio feel, no music bed, no text overlays, no watermark.
Prompt B — 產品英雄旋轉
Product commercial, 8 seconds, clean studio.
Shot 1: matte black wireless earbuds case on white seamless, soft key light.
Shot 2: lid opens smoothly, earbuds catch a specular highlight.
Shot 3: earbud floats closer to camera, macro detail on mesh.
Subtle whoosh SFX energy, no logos other than the product shape, no watermark.
Prompt C — 雨夜霓虹街(情緒)
Cinematic street clip, 10 seconds, night rain, neon reflections.
Single continuous push-in toward a woman laughing under a translucent umbrella,
wet asphalt, cyan and magenta signs, handheld micro-motion, natural skin texture.
City ambience and light rain SFX, no dialogue, no on-screen text, no watermark.
接下來關注
- 創作者多鏡頭配方(把 shot list 寫成 prompt)——見 FLUX 3 影片:多鏡頭、約 20 秒與原生音訊。
- 圖像工作流,為圖生影片準備靜幀(圖像生成器)。
- BFL 關於 Self-Flow / 多模態骨幹的後續研究公開(經 The Decoder 架構摘要 指向的 BFL research)。
FAQ
什麼是 FLUX 3?
FLUX 3 是 Black Forest Labs 於 2026 年 7 月 23 日發布的多模態基礎模型,面向 圖像、影片、音訊與動作預測,聯合訓練而非多個單用途模型硬拼(BFL 博客;發布串文)。
FLUX 3 只是影片模型嗎?
不是。公開材料描述了 影片、圖像、音訊與動作 路徑的統一多模態設計(BFL 模型頁)。本站可從 影片 或 圖像 開始。
FLUX 3 影片能多長?
發布報道引用約 20 秒量級(The Decoder)。以生成器 UI 上你當次可選的時長控件為準。
能否一條 prompt 多鏡頭?
可以——這是發布周創作者高光點:單 prompt 多鏡頭(venturetwins)。建議顯式寫 Shot 1 / Shot 2 / Shot 3。
FLUX 3 的 native audio 是什麼?
指模型可隨影片生成聲音——環境聲、SFX、對話向 demo 均出現在公開報道中(The Decoder;BFL 發布)。
FLUX 3 和 FLUX.2 有何不同?
FLUX.2(2025-11)是生產級 圖像生成與編輯 篇章(BFL FLUX.2)。FLUX 3 把家族擴展到以 影片 + 音訊 為核心的多模態敘事(BFL FLUX 3)。
可以線上免費試用嗎?
可以。打開 flux3.video 的 FLUX 3 影片生成器 免費開始——無需先綁卡。靜幀: 圖像生成器。
先文生影片還是圖生影片?
從零編場景用 文生影片;已有產品圖或角色靜幀用 圖生影片——都在 影片。
公開的勝率對比是最終結論嗎?
不是。發布文章中的早期偏好率是特定測試條件下的初步廠商側信號(The Decoder)。重要決策請用你自己的 prompt 驗收。
現在該從哪開始?
把 Prompt A 貼進 影片生成器,全屏看一遍,再迭代鏡頭描述——而不是只堆形容詞。
關於 Avery Lin
Avery Lin 是 AI 模型發布分析寫作者,追蹤 FLUX 家族發布,並把公開模型事實整理成創作者在 FLUX 3 上可執行的試用路徑。
