TLDR
- FLUX 3(2026 年 7 月 23 日):マルチモーダル基盤;公開の動画ストーリー = マルチショット + 約20秒 + ネイティブ音声(BFL ブログ;The Decoder)。
- 同世代はクローンではない: Runway Gen-4.5 は モーション品質/prompt 追従(Runway research);Kling VIDEO 3.0 はプロダクト資料で マルチショット + ネイティブ音声(Kling VIDEO 3.0 guide);Sora 2 は 物理 + マルチショット + 同期サウンド(OpenAI);Veo 3.1 は 動画とネイティブ音声(DeepMind Veo);Luma Ray3.x は 方向付け可能な連続性/modify(Luma Ray);Grok Imagine Video は image-to-video + 音声 + 速度(xAI);Seedance 2.0 は 豊富な参照付きマルチモーダル音動画(ByteDance Seed)。
- 決定ルール: 単一 Elo やベンダー選好表ではなく、仕事軸(ストーリーボードのカット、リップシンク対話、製品スチル→モーション、物理ギャグ、長い制御ループ)で選ぶ。
- 本サイト: 同じ prompt を FLUX 3 動画(スチルは 画像)で走らせ、キーパーを自分で採点する。
キーテイクアウェイ
- マルチショットは 2026 年の第一級軸——FLUX 3 の早期メモは 1 prompt からの多アングル連写を強調(Justine Moore / a16z);Kling はマルチショット物語を文書化(VIDEO 3.0 guide);Sora 2 は世界状態の持続付きマルチショット指示追従を主張(OpenAI)。
- ネイティブ音声は今やボーナスではなくテーブルステークスの言葉:FLUX 3(The Decoder)、Sora 2(OpenAI)、Veo(DeepMind)、Kling(VIDEO 3.0)、Grok Imagine Video(xAI)、Seedance 2.0(Seed)。
- ベンダー選好チャートは早期シグナルであり、査読付きの王冠ではない——BFL 関連のローンチ報道には他システムとの予備的な選好風数字が含まれる;文脈のみとして扱う(The Decoder chart summary)。
- 制御面は異なる: あるスタックは純粋な生成品質を売り、別のスタックはキーフレーム modify、マルチ参照、アプリ生態系を売る(例:Luma Ray3 Modify;Runway Gen-4.5 positioning)。
- FLUX ブランド連続性は、スチル言語がすでに FLUX にあるなら重要——スチルは 画像、モーションは 動画(シリーズ文脈:BFL FLUX.2 → FLUX 3)。
- 1 つのブラウザ面での同一 prompt 評価は、広告や短編を出すうえで抽象ランキングより強い——FLUX 3 動画 で無料開始。
ヘッドツーヘッド:公開軸(ランキングではない)
この表は 30 秒で読む。セルは 公開ポジション/文書化された機能 であり、独立ラボのスコアではない。空欄や「製品で確認」は、リンクした一次資料で見出し主張が見当たらなかったという意味——何もできないという意味ではない。
| 軸(あなたの仕事) | FLUX 3 (BFL) | Runway Gen-4.5 | Kling VIDEO 3.0 | OpenAI Sora 2 | Google Veo 3.x | Luma Ray3.x | Grok Imagine Video | Seedance 2.0 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | | 主な公開ピッチ | マルチモーダル視覚知能;動画 + 音声 + 画像ファミリー(BFL) | モーション品質、prompt 追従、視覚忠実度(Runway) | マルチショット物語 + ネイティブ音声 + 一貫性(Kling) | 物理的に正確な動画 + 同期対話/SFX(OpenAI) | ネイティブ音声付きの先行動画生成(DeepMind Veo) | 方向付け可能・連続・シネマティック制御(Luma Ray) | ネイティブ音声付きの高速画像/動画(xAI) | マルチモーダル音動画の合同生成 + 豊富な参照(Seed) | | マルチショット/マルチカット | 強いローンチナラティブ(venturetwins;The Decoder) | 制御と構図を強調;唯一の「マルチショット製品ストーリー」ではない(Runway) | 文書化されたマルチショット作成(Kling) | マルチショット指示 + 世界状態(OpenAI) | シネマティック言語/制御;Studio では製品尺が短クリップになりがち(AI Studio Veo) | すべてのカット/フレーム方向を仕上げる(Luma Ray) | スチルと prompt からのモーション;マルチカットはコアブランドラインではない(xAI) | Seedance 系のマルチショット遺産 + 2.0 のマルチモーダル制御(Seedance 1.0;2.0) | | ネイティブ/同期音声 | 公開主張(BFL;The Decoder) | Gen-4.5 研究ポストでは視覚ファーストの生成フォーカスが多い(Runway) | VIDEO 3.0 でのネイティブ音声アップグレード(Kling) | 対話 + SFX + サウンドスケープ(OpenAI) | 動画と音声の出会い(DeepMind) | 製品ページ FAQ に音声関連の質問面がある(Luma Ray) | ネイティブ音声と発話の改善(xAI) | 合同音動画アーキテクチャ(Seed) | | 物理/素材リアリズム | 日常の「より実物に近い」マルチモーダル枠組み(BFL;wire) | 重さ・液体・髪・素材が言及される(Runway;CNBC) | 製品コピーでの一貫性 + ナラティブの磨き込み(Kling) | 前代 Sora に対する明示的な物理の飛躍(OpenAI) | 高忠実度ストーリーテリングのピッチ(DeepMind) | modify ワークフローでの物理ロジック(Luma news) | 1.5 でのより良いモーションと物理(xAI) | モーション安定性 + 没入 AV(Seed) | | スチル → モーション/参照 | ファミリー内の画像パス + 本サイトのブラウザ i2v(BFL;動画ツール) | 生成 + 編集モードの強い生態系(Runway) | 3.0 マトリクスの開始フレーム + 要素参照(Kling guide) | テキストおよび/または画像(生態系ドキュメントの remix パス)(OpenAI) | 最近の Veo カードでのテキスト・画像・動画入力(AI Studio) | キーフレーム/キャラクター参照 modify(Luma) | image-to-video がフラッグシップ経路(xAI) | テキスト・画像・音声・動画入力(Seed) | | 尺の公開ナラティブ | 最大約 20s がよく引用(The Decoder) | HD クリップ生成;プランの製品制限を確認(Runway) | ショットごとの製品マルチショット尺(Kling guide) | 制御可能なマルチショット列;製品尺は面により異なる(OpenAI) | Studio カードは短い固定尺(例:4/6/8s 帯)(AI Studio) | ワークフロー志向の尺;製品 FAQ で確認(Luma) | API 例の短いクリップ帯(例:最大 10s サンプル)(xAI API) | シネマティック・マルチショット出力;製品ティアは様々(Seed) | | 本プロダクトでの試用パス | FLUX 3 動画 + 画像 | N/A(他ベンダー) | N/A | N/A | N/A | N/A | N/A | N/A |
表の使い方: ブリーフが「3 カット、1 キャラクター、部屋の環境音」なら マルチショット + 音声 列を重く見る。「液体を注ぐ、重量感のある製品」なら 物理。「この正確なパッケージング・スチルを動かしたい」なら スチル→モーション/参照。

王冠ではなく基準 · 本比較のエディトリアル・カバーフレーム · FLUX 3 で生成
ファミリー文脈(まず FLUX のみ——その後に同世代)
| 世代 | 公開テーマ | アンカー | | --- | --- | --- | | FLUX.2 | プロダクション・スチルと編集 | BFL FLUX.2 ブログ | | FLUX 3 | マルチモーダル動画 + 音声 + 画像の基盤 | BFL FLUX 3 ブログ | | 同世代クラス(2025–2026) | 競合する制御ストーリーを持つ専門動画システム | Runway Gen-4.5 · Kling VIDEO 3.0 · Sora 2 · Veo 3.x · Luma Ray3.x · Grok Imagine Video · Seedance 2.0(リンクは上表) |
同世代は FLUX ファミリーの一員ではない。すべてがテキスト prompt を受け付けるからといって、美観・安全フィルタ・尺ノブが同一だと仮定しないでください。
シナリオ別の勝ち筋(if / then)
1. 2 カットと部屋の環境音があるソーシャル UGC 広告
もし 1 回の生成で wide → close の物語が必要で、アンビエンスがシーンに張り付いていることが大事なら、そのとき 公開資料が マルチショット + ネイティブ音声 を強調するモデルを優先する(FLUX 3 ローンチナラティブ;Kling VIDEO 3.0 ドキュメント;Sora 2 の音声+マルチショット主張)。
本サイト: 別スタックを物色する前に 動画 で Shot 1 / Shot 2 を1段落で書く。
2. 確定スチルからの製品ヒーロー
もし パッケージング・ロゴクロップ・素材仕上げがすでにスチルとして承認済みなら、そのとき image-to-video(またはスチル先行)ワークフローから始める——Grok Imagine Video の公開ストーリーは強く i2v(xAI);Seedance 2.0 と Kling 3.0 は参照/開始フレーム経路を文書化;FLUX 3 ファミリーには先に固められる画像面がある(BFL)。
本サイト: 画像 でスチルを固定し、動画 でアニメート。
3. 物理ギャグまたは素材デモ
もし ジョークや証明が重さ・液体・布・衝突なら、そのとき 物理精度 をマーケするシステムを重く見る(Sora 2;Runway Gen-4.5 の研究言語)。それでも自分の正確なオブジェクトで検証する——マーケデモはあなたの SKU ではない。
本サイト: 下の Prompt C を使い、手・エッジ・接点をフルスクリーン確認。
4. 対話/リップシンク解説
もし キャラクターがカメラに向かって話さなければならないなら、そのとき 公式ストーリーに ネイティブ音声 + 発話 があるスタックを好む(Sora 2;Kling ネイティブ音声;FLUX 3 対話/SFX ナラティブ;Grok Imagine の発話改善)。リトライを想定;リップシンクは合格/不合格チェックリストであり、初回保証ではない。
本サイト: Prompt B + ヘッドホンで一度聞く。
5. 長い制御ループ(modify、延長、ボード)
もし チームが反復キーフレーム・modify-video・マルチアセットボードで生きているなら、そのとき 制御の重い製品ストーリー(Luma Ray3 Modify;Seedance マルチモーダル参照;Google Veo 制御面)を 一次生成に加えて 見る。
本サイト: 一次生成が CTA——動画 でキーパークリップを得てから、勝ち手を編集スタックへ。
分かっていること vs 分からないこと
| 分かっていること(出典あり) | 分からない/主張しないこと | | --- | --- | | FLUX 3 公開ローンチ 2026 年 7 月 23 日、マルチモーダル定位(@bfl_ai;BFL ブログ) | あらゆる仕事とスタイルを横断する永久グローバル #1 動画モデル | | マルチショット + 約20s + ネイティブ音声が FLUX 3 のローンチ報道に登場(The Decoder;venturetwins) | すべてのホストが同一の尺/解像度トグルを出すこと | | 同世代ベンダーは異なる見出しを出す(物理、マルチショット製品マトリクス、modify ワークフロー、マルチモーダル参照)——表のリンク参照 | 全軸を決着させる独立・査読付きクロスラボ・リーダーボード | | ローンチ報道の早期選好風数字は 予備的/ベンダー文脈(The Decoder) | クロスチャネルの秒あたりドル価格表(ここでは比較しない) | | 本プロダクトはブラウザ FLUX 3 動画 と 画像 を公開 | 1 回の無料ランがあらゆるブランド安全基準のプロダクション準備を証明すること |
FLUX 3 での評価方法(同一 prompt プロトコル)
- FLUX 3 動画 を開く。
- 下の Prompt A、B、C を 変更せず 走らせる(本当に必要な製品名・衣装連続行だけ変えてもよい)。
- 各テイクを5次元で採点(各 0–2):カット明瞭さ、被写体同一性、モーションリアリズム、音声適合、クロップ耐性(9:16)。
- 合計 ≥7/10 を候補としてキープ;失敗したショット行だけ書き直す。
- 任意:画像 でスチルを固定し、同じブリーフを image-to-video。
Prompt A — マルチショット・ソーシャル UGC
Vertical 9:16 UGC ad, about 10 seconds, daylight kitchen.
Shot 1 wide: young adult in a blue hoodie pours iced coffee into a clear glass, casual phone-tripod energy.
Shot 2 medium: glass fills, ice clinks, condensation visible, same hoodie and kitchen tiles.
Shot 3 close-up: satisfied sip, natural smile, soft window light, no logos.
Natural kitchen ambience and ice clink SFX, no music bed, no captions, no watermark.
Prompt B — 対話解説ビート
Horizontal 16:9 product explainer, about 8 seconds, clean home office.
Medium shot: friendly presenter in a charcoal sweater speaks to camera,
holds a small white wireless earbud case, clear enunciation, natural hand gestures.
Background: blurred bookshelf, soft daylight.
Native dialogue energy: short line about "all-day battery," ambient room tone only, no music, no on-screen text, no watermark.
Prompt C — 製品物理/素材
Product commercial, 8 seconds, studio softbox, 16:9.
Macro to medium: matte black aluminum water bottle on slate table.
Slow push-in as a bead of water rolls down the side, realistic weight and reflection,
then a hand lifts the bottle smoothly—fingers and metal contact stay solid.
Subtle studio ambience only, no music, no logos beyond the bottle, no watermark.

Prompt-first のモーション言語 · FLUX 3 上の showcase キーフレーム · 上の Prompt A–C と併用

日常からシネマティックまでのスチル言語 · FLUX 3 上の showcase スタイルフレーム · Prompt C と組み合わせ
決定ルール(一文)
次のときにまず FLUX 3 を選ぶ: FLUX マルチモーダル・ファミリー内で ブラウザネイティブのマルチショット + 音声の試用パス が欲しく、実際の prompt で キーパーを自分で判断する とき——ベンダーチャートや SNS スレッドが永久勝者を冠したときではない。
次のときに他の同世代スタックの制御面へ: ボトルネックが modify-video、マルチアセット参照ボード、または専門アプリ・ワークフロー で、それらベンダーがコア製品として文書化しているとき——ただし、上の軸で自分の prompt が失敗することがすでに分かってから。
FAQ
FLUX 3 は Sora、Runway、Kling より「優れている」か?
万能順位としては違う。公開資料は 重なりつつも異なる強み を示す(表参照)。優れている = 同一 prompt テスト後に 自分の仕事軸に合う こと——単一 Elo や早期選好チャートではない(The Decoder context)。
AI 動画モデルを比較する最も公正な方法は?
prompt・アスペクト比・レビュー・チェックリスト を固定し、モデル/ホストだけを変え、カット・同一性・物理・音声・クロップ を採点する。それが上のプロトコルであり、FLUX 3 動画 上で実行する。
FLUX 3 は 1 本の prompt からマルチショットできるか?
ローンチ週のクリエイターと報道メモはマルチショットを見出し能力として扱う(venturetwins;The Decoder)。Shot 1 / Shot 2 / Shot 3 を明示的に書く——FLUX 3 動画:マルチショット・約20秒・ネイティブ音声 参照。
同世代モデルもネイティブ音声を主張するか?
はい——例として Sora 2(OpenAI)、Veo(DeepMind)、Kling VIDEO 3.0(guide)、Grok Imagine Video(xAI)、Seedance 2.0(Seed)。音声品質は毎回リスニングパスが必要。
いつ純粋テキストではなくスチルから始めるべきか?
ブランド・パッケージング、顔の類似、レイアウト がすでに承認済みのとき。スチルの生成/調整は FLUX 3 画像、アニメートは 動画。
FLUX 3 クリップはどれくらい長くできるか?
公開報道ではしばしば約 20 秒 がナラティブ上限として引用される(The Decoder)。初稿では多くのクリエイターが尺を最大にする前に 約 8–12 秒 を狙うと明瞭になりやすい。
Artificial Analysis / Elo / ベンダー選好チャートを信頼すべきか?
文脈 としてははい;購入の福音 としてはいいえ。Gen-4.5 公開研究はリーダーボード Elo を引用(Runway);FLUX ローンチ報道には予備的な選好風数字が含まれる(The Decoder)。キーパーを決めるのはあなたの SKU とクロップ。
このサイトは Black Forest Labs 公式か?
いいえ。flux3.video は FLUX 3 ブランドのブラウザ生成を提供する独立プロダクト。公式モデル研究は bfl.ai と BFL チャネルにある。
ローカルツールを入れずに FLUX 3 を試せるか?
はい——ブラウザで FLUX 3 動画 または 画像 を開く。
手や顔がチェックリストに落ちたら?
よりタイトな medium/close ショットと固定した衣装言語で一度再生成;形容詞を積み上げない。同一性がまだドリフトするなら、先にスチルを固定してから image-to-video。
マルチショット prompt の形式はどこで学べるか?
FLUX 3 動画:マルチショット・約20秒・ネイティブ音声 を読み、上の Prompt A をジェネレーターに貼る。
Avery Lin について
Avery Lin は FLUX Model Release Analyst。Avery は FLUX ファミリーのローンチを追い、公開のモデル事実を FLUX 3 上の明確な試用パスへ——基準が先、誇大が後——に翻訳する。
