Black Forest Labs 将 FLUX 3 定位为同一套多模态系统:既可从 纯文字 生成 视频 + 原生音频,也可借助 图像参考——包括从 起始帧 做动画(BFL FLUX 3 博客,2026 年 7 月 23 日;BFL 模型页;发布说明见 @bfl_ai)。
在 FLUX 3(本产品)里,两条路径都在同一个 视频生成器 中。真正昂贵的错误不是「选了较弱的模型」,而是 开局方向不对:本该严格贴合法务定稿包装,却让模型凭空发明;或本只需文字分镜节拍,却过早锁死画面。
这是一份 决策指南:何时从 文字 起步、何时 先锁静图,以及如何在 flux3.video 上免费跑一轮公平评估。多镜头语法请看配套 多镜头与原生音频指南。发布地图见 什么是 FLUX 3?。
TLDR
| 起步方式 | 最适合 | 应跳过 |
|---|---|---|
| 文生视频 | 在发明世界、测多镜头语法,或探索风格 | 品牌需要 精确 的 logo/包装几何 |
| 图生视频 | 已有产品静图、角色板或已定稿画面 | 没有静图、也没时间做——直接写文字 |
| 混合(静图 → 运动) | 身份或包装必须跨镜头存活 | 你只需要情绪试片 |
默认规则: 若 外观必须贴合已定静图,用 图生视频。若 故事与机位负责发明外观,用 文生视频。两条路径都在 FLUX 3 视频;需要时在 FLUX 3 图像 打磨静图。
核心要点
- 官方双路径: FLUX 3 视频包含 文生视频 与 图生视频(起始帧动画,或以图像作视觉参考),输出带 原生音频(BFL 博客)。
- 约 20 秒单次生成上限 是公开材料里的时长说法——不是每条草稿都必须顶满(The Decoder 对 BFL 材料的摘要;BFL 博客)。
- 单 prompt 多镜头 在早期笔记里是创作者要掌握的核心技能——无论哪条路径都给镜头编号(Justine Moore / a16z)。
- 图生视频的 prompt 重心: 写 运动 + 机位 + 音频,不要再写第二套服装或新产品外形(BFL:起始帧「动画」框架)。
- 本站相关入口: 两种模式都在 视频;可选静图打磨在 图像。
对照:文字起步 vs 静图起步
先读这张表——大约 30 秒就能定路线。
| 维度 | 文生视频 | 图生视频 |
|---|---|---|
| 你提供什么 | 仅文字场景 | 静图 + 运动 prompt |
| 模型发明什么 | 外观、服装、布景、光线 | 运动、机位、时间推进,以及常见的音频能量 |
| 最适合的任务 | 故事节拍、UGC 人设、风格探索、多镜头实验 | 产品旋转、品牌 packshot、已定角色锁定、海报运动化 |
| 连续性从哪来 | 靠 prompt 锁定(服装/地点句) | 先靠 静图像素 |
| 失败模式 | logo / 脸 / 产品外形漂移 | 静图过杂;prompt 又描述成另一件物体 |
| 准备时间 | 最快 | 需要干净静图(照片或 图像生成器) |
| 公开能力出处 | BFL FLUX 3 视频能力列表 | 同一文:起始帧动画 + 图像参考 |

Prompt 优先的运动语言 · FLUX 3 展示关键帧 · 规划用静图,不是成片调色母版
何时纯文生视频更占优
当静图还不存在——或先发明静图会浪费实验本意时——选 文生视频。
1. 多镜头故事试跑
你更在意 Shot 1 → Shot 2 → Shot 3 是否好读,而不是包装像素级完美。公开早期体验强调单 prompt 多镜头控制(venturetwins)。在 视频 用编号镜头起步(完整配方见 多镜头 how-to)。
2. UGC / 人设发明
没有已批的达人照片。你要的是可信的手持创作者感,而不是品牌套件像素对齐。把服装 + 房间 + 说话能量写进同一段——然后改台词,不要改静图。
3. 风格范围探索
BFL 强调宽风格跨度——从随手 DV 感,到动画与电影感(BFL 博客)。「试三种观感」用文字更快,不必先锁三张母版。
4. 纯概念提案
干系人只要 第一版运动板。文字就能到,不必先做静图艺术指导循环。
跳过纯文字,若: 法务、品牌或电商需要 精确 的标签美术、SKU 颜色,或角色已有定稿画面。
何时图生视频更占优
当 外观已经定了、剩下只是运动时,选 图生视频。
1. 真实产品 / 包装
盒子、瓶子或 UI 截图已经存在,就不要再幻觉一遍。钉住静图,prompt 只写 旋转、手部、光线、SFX。另见 产品演示 prompt 包。
2. 角色身份锁定
已定主视觉静图(或在 图像 生成的静图)→ 带动画保持连续。BFL 自身表述包括从 起始帧 继续作为动画(BFL 博客)。
3. 海报 / 主视觉运动化
战役美术已定,你需要 6–12 秒社媒推进。图生视频保住构图;文生视频容易变成「像但不一样」的关键帧。
4. 文字已经找到表现最好的静图之后
见下方混合路径:冻结最佳帧(或重生成一张干净静图),再从该锁定重跑运动。
跳过图生视频,若: 静图杂乱、分辨率低,或多个主体抢戏——先清理静图。

先静后锁的语言 · FLUX 3 展示帧 · 规划用静图,不是成片电影静帧
混合路径:图像页 → 视频页
这是多数品牌团队真正需要的制作循环:
- 制作或精修静图,在 FLUX 3 图像(或使用实拍)。
- 打开 FLUX 3 视频 → 图生视频。
- 只写 运动 + 机位 + 音频 +「保留精确颜色/logo/服装」。
- 全屏复盘 一次;若 logo 连续失败两次,停止发明——修静图,不要堆形容词。
公开材料也提到图像参考可作为视觉锚点(不只是起始帧动画)(BFL 博客)。把静图当 合约;文字是 导演说明。
如何在 FLUX 3 上跑两条路径(评估循环)
- 打开 FLUX 3 视频(站内默认视频模型保持 FLUX 3)。
- 按上表选路径。
- 粘贴 Prompt A(文字)或 Prompt B(图生视频),把产品名词换成你的真实品。
- 用下方清单评判 → 只留一条赢家。
- 可选:在 图像 精修静图,再重新动画。
初稿目标 约 8–12 秒,即便公开材料讨论约 20 秒 片段(The Decoder;BFL 博客)。更短的节拍在手机上更好读。
Prompt A — 文生视频多镜头(可复制)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — 从锁定静图做图生视频(可复制)
在 视频 附上干净的产品或角色静图之后使用。
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — 先做静图再动画(混合:图像页用文字)
在 图像 生成干净锁定图,再接 Prompt B:
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
通过/不通过清单(两条路径通用)
先不拖进度条完整看一遍,再细看:
- 路径是否匹配 — 本该锁定却在发明,或本该自由却锁死了?
- 身份 / 产品 — 整条片里脸、服装或 logo 是否一致?
- 手 / 边缘 — 盒子融化、多余手指、标签滑动?
- 音频 — 是否贴合事件,还是你要求了安静?原生音频是官方多模态叙事的一部分(@bfl_ai;The Decoder)。
- 裁切 — 主体是否适合 9:16 Reels/TikTok 类投放(信息流广告请保持中心可读——见 Meta ads 概览 与 TikTok Ads Help)。
- 文字污染 — 乱字或水印?
两次失败 → 换路径或换静图,不要只堆形容词。
常见错误
| 错误 | 代价 | 修复 |
|---|---|---|
| 法务包装却用文生视频 | logo 被发明 | 真实静图 + 图生视频 |
| 图生视频 prompt 重写产品 | 与静图打架 | 只写运动/机位/音频 |
| 静图过杂(多物体) | 运动贴不住主体 | 裁到单一主角 |
| 两条路径都没有镜头表 | 糊成一长镜 | 编号 Shot 1/2/3 |
| 首试就顶满时长 | 节拍难读 | 从约 8–12 秒开始 |
| 配乐 + 对白 + SFX 一次全上 | 音频糊成一团 | 只留一条音频优先行 |
场景赢家(如果 / 那么)
| 如果… | 那么从…起步 | 为什么 |
|---|---|---|
| 只有一句话想法 | 文生视频 | 循环最快 |
| 品牌给了 packshot PNG | 图生视频 | 外形尺寸已经定死 |
| 角色只在一张静图里好看 | 混合 | 冻结外观,变化机位 |
| 多镜头对白试跑 | 先 文生视频 | 语法先于锁定 |
| 文字路径 logo 连续失败两次 | 停 → 静图 + 图生视频 | 别再烧发明次数 |
| 探索 DV 感 vs 动画风格 | 文生视频 | 风格本身就是实验(BFL 风格范围) |
我们知道 vs 我们不知道
| 我们知道(有来源) | 我们不知道 / 不会宣称 |
|---|---|
| FLUX 3 公开启动 2026 年 7 月 23 日,多模态视频 + 音频叙事(@bfl_ai;BFL 博客;通稿摘要) | 每个托管方都提供完全相同的起始帧控件或时长 |
| 官方视频能力列表含 文生视频 与 图生视频(起始帧或图像参考)(BFL 博客) | 保证每个 SKU 首取 logo 就完美 |
| 公开材料出现约 20 秒、带原生音频的片段(BFL 博客;The Decoder) | 更长一定更适合社媒广告 |
| 多镜头串联出现在早期创作者笔记中(venturetwins) | 独立影视行业认证永久裁定某条路径「更好」 |
FAQ
FLUX 3 文生视频与图生视频有什么区别?
文生视频 仅凭文字 prompt 构建片段。图生视频 以静图为条件——作为 起始帧 做动画,或作为 视觉参考——再跟随你的运动与音频指示(BFL 博客)。
在 flux3.video 上我该先走哪条路径?
若 没有已批静图,先 文生视频。若品牌外观已定,在同一 视频生成器 上走 图生视频。
一个项目里可以两条都用吗?
可以。很多团队用文字 发现,在 图像 或实拍上 锁定 静图,再用图生视频 收尾。
图生视频包含音频吗?
公开的 FLUX 3 视频能力将原生音频生成与输出并列,图像条件路径也在同一能力集(BFL 博客;The Decoder)。每条都要 听。
第一条片该多长?
公开上限叙事约 20 秒(BFL 博客)。做决策时从 8–12 秒 开始,路径质量更容易看清。
为什么文生视频里产品 logo 会坏?
模型在发明像素。改用 真实静图 + 图生视频,并在 prompt 中禁止新文字。
为什么图生视频不理我的静图?
通常是静图过杂,或 prompt 重新描述 成另一产品。裁到单一主体;只写运动 + 机位 + 音频。
我需要图像生成器吗?
只在混合锁定时需要。纯文字,以及纯照片→视频,可以跳过。需要时静图在 图像。
多镜头 prompt 放在哪?
两条路径都可以。显式给镜头编号——见 多镜头与原生音频。
这和同行模型排名文是同一篇吗?
不是。本页是 FLUX 3 内部的路径选择。相对其他系统的评判标准,请读 FLUX 3 vs 同行 AI 视频模型。
在哪里免费试用?
在 flux3.video 打开 FLUX 3 视频 免费开始——起步无需绑卡。
关于 Reese Okada
Reese Okada 是 AI 视频工作流作者,把多镜头 prompt 落成 FLUX 3 上可复用的浏览器流程。本指南聚焦 文字 vs 先静图 的选择,让免费次数用在匹配任务的路径上。