限时 7 折优惠!领取优惠

FLUX 3 视频:多镜头、约 20 秒与原生音频

作者 Reese Okada · 发布于 2026-07-24 flux-3flux3multi-shottext-to-videoimage-to-videonative-audiohow-to
FLUX 3 视频:多镜头、约 20 秒与原生音频

TLDR

  1. 打开 FLUX 3 视频
  2. Shot 1 / Shot 2 / Shot 3(人物、机位、动作),而不是一句含糊氛围。
  3. 控制野心:初稿先求 约 8–12 秒 清楚,再冲最长。
  4. 用一行写清 音频意图(环境 / SFX / 不要配乐)。
  5. 全屏复盘:脸、分镜逻辑、手、说话时的口型、Reels 裁切。
  6. 可选:在 图像 锁定英雄静帧,再 图生视频

核心要点

  • 多镜头是一等技能: 早期体验创作者强调一次生成里多个角度(venturetwins)。
  • ~20s 是公开叙事的上限量级——不是每次都必须顶满(The Decoder)。
  • 原生音频 让你可以指定环境/SFX/对话能量,而不总是后期硬配(BFL 发布The Decoder)。
  • 结构胜过形容词: 给镜头编号、写清机位、锁服装连续性。
  • 在这里试: 把下面的 prompt 贴进 视频生成器(文生视频 + 图生视频)。

开始前(60 秒清单)

| 检查 | 为什么 | | --- | --- | | 你有一个 真实任务(UGC 广告、产品旋转、对话节拍) | 空洞「史诗」prompt 浪费免费次数 | | 能在纸上列出 2–4 个镜头 | 多镜头模型奖励明确切镜 | | 服装 / 主体用 一句说清 | 身份漂移常从角色描写含糊开始 | | 你知道 画幅(9:16、16:9、1:1) | 社媒裁切会毁掉好构图 | | 你会 全屏看一遍 | 缩略图会骗你关于脸和手 |

步骤 1 — 打开 FLUX 3 视频生成器

进入 FLUX 3 视频。保持 FLUX 3 为房屋视频模型。文生视频图生视频 都在本页完成——基础循环不需要第二个产品。

需要先静帧?在 FLUX 3 图像 生成或微调英雄帧,保存后再到视频侧加运动。

步骤 2 — 写多镜头 prompt(核心技能)

每次用这套骨架:

  1. 格式行 — 时长意图、画幅、类型。
  2. 镜头表 — Shot 1 全景 / Shot 2 中景 / Shot 3 特写(动词写动作)。
  3. 连续性行 — 同一人物、服装、地点。
  4. 音频行 — 环境、SFX、对话或静音。
  5. 负向 — 无水印、无多余 logo、无乱字。

Prompt 1 — 多镜头产品开箱(可复制)

Vertical 9:16 product ad, about 10 seconds, clean desk daylight.
Shot 1 wide: sealed matte white product box on oak table, soft window light.
Shot 2 medium: hands open the box lid smoothly, tissue paper folds clearly.
Shot 3 close-up: wireless earbuds lift toward camera, subtle specular highlight.
Same hands, same box branding color, continuous desk environment.
Soft paper rustle and light whoosh SFX, no music bed, no on-screen text, no watermark.

Prompt 2 — 多镜头对话节拍

Horizontal short scene, about 12 seconds, warm kitchen night.
Shot 1 medium two-shot: two friends at a small table, tea cups, fairy lights bokeh.
Shot 2 over-shoulder: person A speaks with natural lip motion, soft smile.
Shot 3 reaction close-up: person B laughs, eyes crinkle, steam rises from cup.
Same wardrobe and hairstyles across all shots, consistent table props.
Quiet room tone plus light cup clink SFX; dialogue energy, no loud score, no subtitles, no watermark.

Prompt 3 — 多镜头户外动作(简单)

Horizontal action clip, about 8 seconds, golden hour park path.
Shot 1 wide tracking: runner in red jacket jogs toward camera on gravel path.
Shot 2 side medium: arms and jacket fabric motion, trees streak softly.
Shot 3 low angle hero: runner passes, dust motes in sunbeams.
Same red jacket and black shorts throughout.
Footsteps and light wind ambience, no music, no text, no watermark.

文生视频风格关键帧 · FLUX 3 showcase

Prompt-first 运动语言 · FLUX 3 showcase 关键帧 · 规划用示意静帧,非成片调色照

步骤 3 — 有意加入原生音频

FLUX 3 的公开故事包含视频上的 native audioBFLThe Decoder)。把音频当成 导演指令,而不是事后补丁:

| 意图 | 示例行 | | --- | --- | | 只要环境 | “city night ambience and light rain, no music, no dialogue” | | SFX 点题 | “soft whoosh on logo settle, no voiceover” | | 对话能量 | “natural conversational speech, quiet room tone, no score” | | 静音 | “no music, no SFX, no dialogue—picture only” |

口型提示: 说话脸放在 中近景或特写,并显式写 “natural lip motion”(见 Prompt 2)。极端全身远景很难判断嘴型。

步骤 4 — 文生视频 vs 图生视频

| 从哪起步 | 何时用 | 路径 | | --- | --- | --- | | 文生视频 | 从零发明场景 | 视频生成器 | | 图生视频 | 已有产品照、角色帧或海报 | 同一 视频页;静帧可选自 图像 |

图生视频配方: 静帧尽量简单(单一主体、边缘清晰),prompt 只写 运动 + 机位 + 音频——不要重写一套不同服装。

Image-to-video, 6 seconds, gentle push-in.
Preserve the exact product, colors, and logo from the reference still.
Soft studio light consistency, subtle rotation of the product, clean background.
Soft whoosh SFX, no new text, no watermark.

步骤 5 — 通过/不通过清单(全屏)

先不拖进度条看一遍,再精查:

  1. 分镜逻辑 — Shot 1→2→3 是否像有意的剪辑?
  2. 身份 — 脸、发型、服装跨镜头一致吗?
  3. 手 / 道具 — 多手指、融化盒子、滑动标签?
  4. 音频贴合 — 声画是否对应(或你是否要求静音)?
  5. 裁切 — 脸与产品在 9:16 是否安全?
  6. 乱字 — 随机字符或水印?

若有两项失败,先改 shot list 再烧次数。通常修的是更短、更清楚的镜头,不是更多形容词。

常见失败与修法

| 症状 | 可能原因 | 修法 | | --- | --- | --- | | 变成一条长连续镜头 | 没有编号镜头 | 加显式 Shot 1/2/3 | | 角色跨镜变形 | 服装含糊 | 用一句锁死衣服/发型 | | 音频杂乱 | 配乐 + 对话 + SFX 抢戏 | 只保留 一个 音频优先级 | | 脸好看但产品 logo 糊 | 运镜太乱 | 慢推近;少切镜 | | 16:9 好、9:16 崩 | prompt 未写画幅 | 写明 vertical 9:16 + 主体居中 |

在 FLUX 3 上跑 3 步验收环

  1. 打开 FLUX 3 视频
  2. 粘贴 Prompt 1(或用骨架写的真实 brief)。
  3. 用清单判断 → 保存 keeper → 可选从 图像 静帧再图生视频。

FAQ

FLUX 3 视频在 prompting 上有何不同?

公开创作者笔记强调 单 prompt 多镜头控制 与更强的微细节(venturetwinsBFL 发布)。写 切镜,不要只写情绪。

第一支片建议多长?

公开材料讨论约 20 秒量级(The Decoder)。学多镜头时从 约 8–12 秒 开始,每个节拍才读得清。

建议写几个镜头?

初稿 2–4 个。镜头更多会在角色线稳定前抬高连续性风险。

FLUX 3 能做原生音频与口型吗?

原生音频是官方多模态故事的一部分(BFLThe Decoder)。社区 demo 也强调嘴型——务必 放大 验收自己的成片。

该文生视频还是图生视频?

编造场景用 文生视频;已有品牌静帧用 图生视频。都在 视频生成器

需要图像页吗?

只有当你想先控静帧时需要。先在 图像 生成,再到视频加运动。

为什么多镜头塌成一条长镜头?

多半缺少编号镜头与机位尺寸。用步骤 2 的骨架。

能禁止配乐吗?

可以——在音频行写 “no music bed”“picture only, no SFX”

在哪里免费试用?

打开 FLUX 3 视频,无需先绑卡即可开始。

下一步读什么?

发布总览:什么是 FLUX 3?

关于 Reese Okada

Reese Okada 是 AI 视频工作流写作者,把多镜头 prompt 整理成可在 FLUX 3 浏览器端重复执行的流程。

更多文章