FLUX 3 テキストから動画 vs 画像から動画:スチルから始めるべきとき

著者: Reese Okada · 公開日: 2026-08-02 flux-3flux3text-to-videoimage-to-videohow-todecision-guide
FLUX 3 テキストから動画 vs 画像から動画:スチルから始めるべきとき

Black Forest Labs は FLUX 3 を、純テキストからも 画像参照からも——開始フレームからのアニメーションを含め——動画 + ネイティブ音声を生成できる 一つのマルチモーダルシステムとして位置づけています(BFL FLUX 3 ブログ、2026年7月23日BFL モデルページ;ローンチメモは @bfl_ai)。

本プロダクトの FLUX 3 では、両方のパスが同じ 動画ジェネレーター にあります。高くつく失敗は「弱いモデルを選ぶこと」ではなく、仕事に対してスタートの仕方が違うことです。法的アートと一致すべきパッケージを発明したり、文章のビートシートだけで足りるシーンを過剰に縛ったり。

本稿は 判断 How-To です。テキストから始めるとき、先にスチルを固定するとき、そして flux3.video 上で公正な評価ループを無料で回す方法。マルチショット文法は姉妹の マルチショット&ネイティブ音声ガイド。ローンチマップは FLUX 3 とは?

TLDR

開始向いているとき避けるとき
テキストから動画世界を発明する、マルチショット文法を試す、スタイルを探るブランドがロゴ/パッケージ形状の 厳密一致 を求める
画像から動画製品スチル、キャラクターボード、承認済みフレームがあるスチルがなく、作る時間もない——テキストを書くだけ
ハイブリッド(スチル → モーション)アイデンティティやパッケージがカットをまたいで生き残る必要があるムードテストだけでよい

既定ルール: 見た目が承認済みスチルと一致しなければならないなら 画像から動画物語とカメラがルックを発明するなら テキストから動画。どちらも FLUX 3 動画 で動き、必要ならスチルは FLUX 3 画像 で作る。

要点

  • 公式の二経路: FLUX 3 動画は テキストから動画画像から動画(開始フレームのアニメーション、または視覚参照としての画像)を含み、出力に ネイティブ音声BFL ブログ)。
  • 約20秒の単一生成上限は公開資料で語られる尺の目安であり、すべての初稿の必須条件ではない(The Decoder による BFL 資料の要約BFL ブログ)。
  • 1本の prompt からのマルチショットは初期メモで第一級のクリエイタースキル——どちらのパスでもショットに番号を付ける(Justine Moore / a16z)。
  • 画像から動画の prompt のシフト: 二着目の服や新しい製品形状ではなく、モーション + カメラ + 音声を書く(BFL:開始フレームの「アニメーション」フレーミング)。
  • ここで使うページ: 両モードは 動画;任意のスチル作りは 画像

直接比較:テキスト開始 vs スチル開始

まずこの表を読む——約30秒でパスを選ぶ。

観点テキストから動画画像から動画
渡すもの書かれたシーンのみスチル + モーション prompt
モデルが発明するものルック、衣装、セット、照明モーション、カメラ、時間、しばしば音声のエネルギー
向く仕事ストーリービート、UGC ペルソナ、スタイル探索、マルチショット実験製品スピン、ブランドパックショット、承認キャラロック、ポスターからモーション
連続性の強みprompt ロック(衣装/場所の行)から来るまずスチルの ピクセルから来る
失敗モードロゴ/顔/製品の発明ドリフトスチルが忙しすぎる;prompt が別の物体を再記述する
準備時間最速きれいなスチルが必要(写真または 画像ジェネレーター
公開能力の根拠BFL FLUX 3 動画リスト同記事:開始フレームアニメーション + 画像参照

テキスト先行のモーション言語 — FLUX 3 上の計画キーフレーム

Prompt-first のモーション言語 · FLUX 3 上の showcase キーフレーム · 計画用スチルであり、グレーディング済みマスターではない

純テキストから動画が勝つとき

スチルがまだ存在しない——またはスチルを発明することが実験の意味を無駄にする——ときは テキストから動画を選ぶ。

1. マルチショットのストーリー試験

ピクセル完璧なパッケージより、Shot 1 → Shot 2 → Shot 3 の読みやすさを重視する。公開の早期アクセス論評は、単一 prompt からのマルチショット制御を強調する(venturetwins)。動画 で番号付きショットから始める(フルレシピは マルチショット How-To)。

2. UGC/ペルソナの発明

承認済みタレント写真がない。ブランドキット一致ではなく、信じられるハンドヘルドクリエイターが欲しい。衣装 + 部屋 + 発話エネルギーを1ブロックに書き、スチルではなく行を反復する。

3. スタイル幅の探索

BFL は、率直なカムコーダーエネルギーからアニメーションやシネマティックまで、広いスタイル範囲を強調する(BFL ブログ)。「3つのルックを試す」なら、先に3枚のマスターを固定するよりテキストの方が速い。

4. 純コンセプトのピッチ

ステークホルダーに必要なのは 初稿モーションボードだけ。スチルのアートディレクションループなしでテキストが届く。

純テキストを避けるとき: 法務、ブランド、EC がラベルアート、SKU 色、またはすでにフレームとしてサインオフされたキャラの 厳密一致を求める。

画像から動画が勝つとき

見た目がすでに決まっていて、残る仕事がモーションのときは 画像から動画を選ぶ。

1. 実製品/パッケージ

箱、ボトル、UI スクリーンショットがすでにあるなら、再幻覚させない。スチルをピンし、prompt は 回転、手、光、SFX だけ。あわせて 製品デモ prompt パック

2. キャラクター・アイデンティティのロック

承認済みヒーローフレーム(または 画像 で生成したスチル)→ 連続性を保ってアニメート。BFL 自身のフレーミングにも、開始フレームからの継続をアニメーションとして含む(BFL ブログ)。

3. ポスター/キーアートからモーションへ

キャンペーンアートは固定;6–12秒のソーシャル push-in が必要。画像から動画は構図を保ち、テキストから動画は「似ているが同じではない」キーフレームになりやすい。

4. テキストで勝者スチルがすでに見つかったあと

下記のハイブリッドパス:最良フレームを固定(またはきれいなスチルを再生成)し、そのロックからモーションを再実行。

画像から動画を避けるとき: スチルが散らかり、低解像度、または競合する被写体が複数——まずスチルをきれいにする。

ロックフレーム向け・日常からシネマティックまでのスチル言語 — FLUX 3

スチル先行のロック言語 · FLUX 3 上の showcase フレーム · 計画用スチルであり、グレーディング済みフィルムスチルではない

ハイブリッドパス:画像ページ → 動画ページ

ブランドチームが実際に必要とする本番ループはこれだ:

  1. FLUX 3 画像 でスチルを作る/整える(または実写真を使う)。
  2. FLUX 3 動画 を開き → 画像から動画
  3. prompt は モーション + カメラ + 音声 と「正確な色/ロゴ/衣装を保持」だけ。
  4. フルスクリーン確認を一度;ロゴが2回失敗したら、形容詞ではなくスチルを直す——発明をやめる。

公開資料は、開始フレームアニメーションだけでなく、視覚アンカーとしての画像参照にも触れる(BFL ブログ)。スチルを 契約、テキストを 演出として扱う。

FLUX 3 で両パスを回す方法(評価ループ)

  1. FLUX 3 動画 を開く(既定の動画モデルは FLUX 3 のまま)。
  2. 上の表から パスを選ぶ
  3. Prompt A(テキスト)または Prompt B(画像から動画)を、実製品の名詞で 貼る
  4. 下記チェックリストで 判定 → 勝者を1本残す。
  5. 任意:画像 でスチルを磨き、再アニメート。

公開資料は約 20秒 までのクリップを語るが、初稿は 8–12秒 前後を狙う(The DecoderBFL ブログ)。短いビートの方がスマホで読みやすい。

Prompt A — テキストから動画マルチショット(コピペ)

Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.

Prompt B — ロックしたスチルからの画像から動画(コピペ)

きれいな製品またはキャラクタースチルを 動画 に添付したあとで使う。

Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.

Prompt C — スチル作成後にアニメート(画像ページ用ハイブリッド text)

画像 できれいなロックを生成し、その後 Prompt B を使う:

Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.

合格/不合格チェックリスト(両パス共通)

スクラブせず一度見、その後スクラブ:

  1. パス適合 — ロックすべきところで発明したか、自由が必要なところでロックしたか?
  2. アイデンティティ/製品 — クリップ全体で同じ顔、衣装、またはロゴか?
  3. 手/エッジ — 溶ける箱、余分な指、ずれるラベル?
  4. 音声 — 出来事に合うか、無音を要求したか? ネイティブ音声は公式マルチモーダルストーリーの一部(@bfl_aiThe Decoder)。
  5. クロップ — 9:16 の Reels/TikTok 系配置で被写体が安全か(フィード広告向けにセンター可読を保つ——Meta ads overviewTikTok Ads Help)。
  6. テキスト汚染 — ランダムな字形や透かし?

2回失敗 → 形容詞を足すのではなく、パスまたはスチルを変える。

よくあるミス

ミスなぜ痛いか修正
法的パッケージにテキストから動画ロゴが発明される実スチル + 画像から動画
画像から動画の prompt が製品を書き換えるスチルと戦うモーション/カメラ/音声のみ
忙しいスチル(物体が多い)動きが主体に乗らないヒーロー被写体1つにクロップ
どちらのパスでもショットリストなし連続したどろどろShot 1/2/3 に番号
初回で最大尺読めないビート約8–12秒から
音楽 + 対話 + SFX を同時濁った音声音声優先を1行

シナリオ勝者(if / then)

もし…では開始は…なぜ
一行のアイデアだけあるテキストから動画最速ループ
ブランドがパックショット PNG を送ってきた画像から動画形状がすでに確定している
キャラが一枚のスチルだけ良いハイブリッドルックを固定し、カメラを変える
マルチショット対話テストまず テキストから動画ロック前に文法
テキストでロゴが2回失敗停止 → スチル + i2v発明ランをこれ以上燃やさない
カムコーダー vs アニメーションスタイルを探るテキストから動画スタイル自体が実験(BFL スタイル範囲

分かっていること vs 分かっていないこと

分かっていること(出典あり)分からない/主張しないこと
FLUX 3 公開ローンチ 2026年7月23日、マルチモーダル動画 + 音声のフレーミング(@bfl_aiBFL ブログwire 要約すべてのホストが同一の開始フレーム制御や尺を公開していること
公式動画リストに テキストから動画画像から動画(開始フレームまたは画像参照)が含まれる(BFL ブログすべての SKU で初回テイクのロゴ完全保証
ネイティブ音声付きで約 20秒 までのクリップが公開資料に現れる(BFL ブログThe Decoder長いほど常にソーシャル広告に良いこと
マルチショット連結が初期クリエイターメモに現れる(venturetwins一方のパスを恒久的に「より良い」とする独立映画業界認定

FAQ

FLUX 3 のテキストから動画と画像から動画の違いは?

テキストから動画は書かれた prompt だけからクリップを作る。画像から動画はスチルを条件にし——開始フレームとしてアニメートするか 視覚参照として——その後モーションと音声の指示に従う(BFL ブログ)。

flux3.video ではどちらを先に使うべき?

承認済みスチルがないなら テキストから動画から。ブランドの見た目がすでに固定なら、同じ 動画ジェネレーター画像から動画から。

1プロジェクトで両方使える?

はい。多くのチームはテキストで 発見し、画像 または写真でスチルを ロックし、画像から動画で 仕上げる。

画像から動画に音声は含まれる?

公開の FLUX 3 動画能力リストは、画像条件付きパスを含む同一能力セットで、出力とともにネイティブ音声生成を挙げる(BFL ブログThe Decoder)。それでも 毎回聞く

最初のクリップはどのくらいの長さ?

公開資料で語られる上限の目安は約 20秒BFL ブログ)。判断用には 8–12秒 から始め、パス品質がはっきり分かるようにする。

テキストから動画で製品ロゴが崩れるのはなぜ?

モデルがピクセルを発明している。本物のスチル + 画像から動画に切り替え、prompt で新しいテキストを禁止する。

画像から動画がスチルを無視するのはなぜ?

多くの場合、スチルが散らかっているか、prompt が 別の製品を再記述している。被写体1つにクロップし、モーション + カメラ + 音声だけ書く。

画像ジェネレーターは必要?

ハイブリッドロックのときだけ。純テキストと純写真→動画はスキップ可。必要なときスチルは 画像

マルチショット prompt はどこに当てはまる?

どちらのパスでも。ショットに明示的に番号——マルチショット&ネイティブ音声

これはピアモデル比較記事と同じ?

いいえ。本ページは FLUX 3 内部のパス選択。他システムとの基準は FLUX 3 vs ピア AI 動画モデル

無料で試す場所は?

flux3.video の FLUX 3 動画 を開き、無料で開始——開始にカードは不要。

Reese Okada について

Reese Okada は、マルチショット prompt を FLUX 3 上の繰り返し可能なブラウザワークフローに変える AI 動画ワークフローライターです。本ガイドは、無料ランが仕事に合うパスに向かうよう テキスト vs スチル先行の選択に焦点を当てます。

More Posts