TLDR
FLUX 3 是 Black Forest Labs 在 2026 年 7 月 23 日发布的多模态基础模型。官方定位:一套架构同时从图像、视频与音频学习,并可延伸到机器人伙伴的动作预测路径(BFL 博客;BFL 模型页)。公开视频亮点包括:约 20 秒量级片段、单 prompt 多镜头,以及 native audio(音效、环境声、对话向)(The Decoder 对 BFL 材料的摘要;Justine Moore / a16z 早期笔记)。在本站 FLUX 3,打开 视频生成器 或 图像生成器 即可免费开试——无需先绑卡。
核心要点
- 发布日: 公开启动为 2026 年 7 月 23 日(@bfl_ai;bfl.ai/blog/flux-3)。
- 范围: 图像 + 视频 + 音频 + 动作预测,统一多模态设计(BFL 模型页;通稿)。
- 视频卖点: 约 ~20s 生成、单 prompt 多镜头、原生音频(The Decoder;venturetwins)。
- 系列脉络: FLUX.1(2024 图像时代)→ FLUX.2 图像/编辑(2025-11)→ FLUX 3 多模态「真实世界」模型(BFL FLUX.2;BFL FLUX 3)。
- 本站试用: FLUX 3 视频(短片默认)与 FLUX 3 图像 同一工作区。
实际发布了什么
1. 统一多模态叙事——不是「视频硬挂在图像上」
Black Forest Labs 将 FLUX 3 描述为在统一架构内从图像、视频与音频联合学习,因为单一模态无法完整刻画世界(BFL 博客;The Decoder)。公司将其框定为迈向 real-world visual intelligence——能够感知、预测,并经伙伴路径行动的模型(BFL 宣布线程)。

从日常到电影感的画面语言 · FLUX 3 showcase 风格静帧
2. 视频:时长、多镜头、原生音频
公开材料与首周报道强调:
| 能力 | 公开表述 | 主要来源 | | --- | --- | --- | | 时长 | 视频片段约 20 秒量级 | The Decoder;CryptoBriefing | | 多镜头 | 一条 prompt 出多机位 / 多镜头 | Justine Moore (a16z) | | 原生音频 | 与画面对齐的声音(SFX、环境、对话向) | BFL 发布框架;The Decoder | | 接口叙事 | 文生视频、图生视频及相关工作流 | The Decoder;本站 视频生成器 |
发布报道中的早期偏好对照(例如短 720p 对比)属于厂商侧早期信号,不是电影工业级独立认证(The Decoder 图表摘要)。把它当背景信息,最终以你自己的 prompt 成片为准。

Prompt-first 的运动语言 · FLUX 3 showcase 关键帧
3. 同一家族的图像路径
官方帖展示了 FLUX 3 Image 样张,并将多种风格、画幅与分辨率的合成/编辑纳入多模态栈(BFL 线程 PS 样张;BFL 博客)。在本站,静帧走 图像生成器,默认房屋图像能力为 FLUX 3。
4. 动作 / 机器人(背景,不是创作者主 CTA)
BFL 还公布了与 Mimic Robotics 的 FLUX-mimic 合作,以及涉及 Audi 的工业测试叙事(BFL 动作帖;通稿)。这对「世界模型」故事重要;对社媒广告、产品演示与短片,实用面仍是 视频 + 图像生成。
5. 系列时间线(FLUX → FLUX.2 → FLUX 3)
| 代际 | 公开主题 | 锚点 | | --- | --- | --- | | FLUX.1 时代 | 开放/图像生成浪潮,让 FLUX 成为创作者默认项之一 | BFL 系列史 / Wikipedia 概览 | | FLUX.2 | 生产级图像生成与编辑 | FLUX.2 博客,2025-11-25 | | FLUX 3 | 多模态 视频 + 音频 + 图像 骨干 | FLUX 3 博客,2026-07-23 |
深挖:谁最适合用 FLUX 3
社媒与 UGC 营销
需要短片稳住脸、动作与日常光线,又不想请整天制作班底——多镜头 + 原生音频正是这类工作。从 文生视频 开始。
产品与增长团队
图生视频把包装静帧或英雄产品图变成可动的一版广告草稿。先备好干净静帧,再在同一 视频工作区 加运动。
AI 电影与分镜创作者
单 prompt 多镜头是发布周创作者反复强调的差异点(venturetwins)。把早期输出当可改第一遍,再按镜头改写 prompt。
已在用 FLUX 做静帧的设计者
若你熟悉 FLUX 静帧,FLUX 3 的公开故事是「同一家族,现在有时间轴与声音」。静帧继续用 图像,运动用 视频。
我们确认什么 vs 暂不宣称什么
| 我们确认(有来源) | 暂不宣称 | | --- | --- | | 公开启动 2026-07-23 与多模态定位(@bfl_ai;BFL 博客) | 全球所有托管端、分辨率与时长控件完全一致 | | 视频叙事包含约 20s、多镜头、原生音频(The Decoder) | 每次脸、手、全身转场都一次过完美 | | 发布报道中有早期偏好分数,且为初步(The Decoder) | 存在一锤定音的独立「永久 #1 视频模型」榜 | | FLUX.2 已奠定强 图像 篇章(BFL FLUX.2) | 静帧与视频在每个 seed 上审美完全一致 | | 本站提供浏览器 视频 与 图像 的 FLUX 3 工作流 | 跨厂商按秒计价对照表(本文不做) |
对创作者意味着什么
- 视频 + 音频一次生成,广告与讲解片第一遍少跳工具。
- 多镜头 prompting 改变 brief 写法——写分镜,不只写氛围(多镜头早期笔记)。
- FLUX 品牌连续性 让已会写 FLUX 静帧的团队迁移到运动侧更自然。
- 浏览器试用 往往比等完美本地安装更适合回答:你的产品镜头动起来是否成立。
如何在本站自己验收 FLUX 3
- 打开 FLUX 3 视频生成器。
- 粘贴下方 Prompt A(多镜头)。
- 全屏看一遍:脸、分镜是否清楚、音频是否贴合(若有)、9:16 裁切是否安全。
- 保存 keepers;可选从 图像 静帧再跑图生视频。
Prompt A — 多镜头后院对决
Multi-shot short film, 12 seconds, playful daylight backyard.
Shot 1 wide: two kids jousting with bright pool noodles, green grass, summer sun.
Shot 2 medium: slow motion near-miss as noodles clash, fabric and hair motion clear.
Shot 3 close-up: both kids laughing, natural faces, soft bokeh fence in background.
Natural ambient audio feel, no music bed, no text overlays, no watermark.
Prompt B — 产品英雄旋转
Product commercial, 8 seconds, clean studio.
Shot 1: matte black wireless earbuds case on white seamless, soft key light.
Shot 2: lid opens smoothly, earbuds catch a specular highlight.
Shot 3: earbud floats closer to camera, macro detail on mesh.
Subtle whoosh SFX energy, no logos other than the product shape, no watermark.
Prompt C — 雨夜霓虹街(情绪)
Cinematic street clip, 10 seconds, night rain, neon reflections.
Single continuous push-in toward a woman laughing under a translucent umbrella,
wet asphalt, cyan and magenta signs, handheld micro-motion, natural skin texture.
City ambience and light rain SFX, no dialogue, no on-screen text, no watermark.
接下来关注
- 创作者多镜头配方(把 shot list 写成 prompt)——见 FLUX 3 视频:多镜头、约 20 秒与原生音频。
- 图像工作流,为图生视频准备静帧(图像生成器)。
- BFL 关于 Self-Flow / 多模态骨干的后续研究公开(经 The Decoder 架构摘要 指向的 BFL research)。
FAQ
什么是 FLUX 3?
FLUX 3 是 Black Forest Labs 于 2026 年 7 月 23 日发布的多模态基础模型,面向 图像、视频、音频与动作预测,联合训练而非多个单用途模型硬拼(BFL 博客;发布线程)。
FLUX 3 只是视频模型吗?
不是。公开材料描述了 视频、图像、音频与动作 路径的统一多模态设计(BFL 模型页)。本站可从 视频 或 图像 开始。
FLUX 3 视频能多长?
发布报道引用约 20 秒量级(The Decoder)。以生成器 UI 上你当次可选的时长控件为准。
能否一条 prompt 多镜头?
可以——这是发布周创作者高光点:单 prompt 多镜头(venturetwins)。建议显式写 Shot 1 / Shot 2 / Shot 3。
FLUX 3 的 native audio 是什么?
指模型可随视频生成声音——环境声、SFX、对话向 demo 均出现在公开报道中(The Decoder;BFL 发布)。
FLUX 3 和 FLUX.2 有何不同?
FLUX.2(2025-11)是生产级 图像生成与编辑 篇章(BFL FLUX.2)。FLUX 3 把家族扩展到以 视频 + 音频 为核心的多模态叙事(BFL FLUX 3)。
可以在线免费试用吗?
可以。打开 flux3.video 的 FLUX 3 视频生成器 免费开始——无需先绑卡。静帧: 图像生成器。
先文生视频还是图生视频?
从零编场景用 文生视频;已有产品图或角色静帧用 图生视频——都在 视频。
公开的胜率对比是最终结论吗?
不是。发布文章中的早期偏好率是特定测试条件下的初步厂商侧信号(The Decoder)。重要决策请用你自己的 prompt 验收。
现在该从哪开始?
把 Prompt A 贴进 视频生成器,全屏看一遍,再迭代镜头描述——而不是只堆形容词。
关于 Avery Lin
Avery Lin 是 AI 模型发布分析写作者,追踪 FLUX 家族发布,并把公开模型事实整理成创作者在 FLUX 3 上可执行的试用路径。
