Black Forest Labs memosisikan FLUX 3 sebagai satu sistem multimodal yang bisa generate video + audio native dari teks murni atau dari referensi gambar—termasuk menganimasikan dari frame awal (blog BFL FLUX 3, 23 Juli 2026; halaman model BFL; catatan peluncuran lewat @bfl_ai).
Di FLUX 3 (produk ini), kedua jalur ada di generator video yang sama. Kesalahan mahal bukan “memilih model yang lebih lemah”—melainkan memulai dengan cara yang salah untuk pekerjaan: menciptakan kemasan yang harus cocok dengan artwork legal, atau terlalu mengunci adegan yang hanya butuh daftar shot tertulis.
Ini panduan keputusan: kapan mulai dari teks, kapan kunci still dulu, dan cara menjalankan loop evaluasi yang adil secara gratis di flux3.video. Untuk tata bahasa multi-shot, pakai panduan pendamping multi-shot & audio native. Untuk peta peluncuran, lihat Apa Itu FLUX 3?.
Ringkasan
| Mulai dengan | Paling pas saat | Lewati saat | | --- | --- | --- | | Teks ke video | Kamu menciptakan dunia, menguji tata bahasa multi-shot, atau menjelajah gaya | Merek butuh geometri logo/kemasan yang persis | | Gambar ke video | Kamu sudah punya still produk, papan karakter, atau frame yang disetujui | Kamu tidak punya still dan tidak punya waktu membuatnya—tulis teks saja | | Hibrida (still → gerak) | Identitas atau kemasan harus bertahan lintas potongan | Kamu hanya butuh tes suasana |
Aturan default: jika tampilan harus cocok dengan still yang disetujui, pakai gambar ke video. Jika cerita dan kamera yang menciptakan tampilan, pakai teks ke video. Keduanya berjalan di video FLUX 3; kerjakan still di gambar FLUX 3 saat perlu.
Poin utama
- Jalur ganda resmi: video FLUX 3 mencakup teks ke video dan gambar ke video (animasi frame awal atau gambar sebagai referensi visual), dengan audio native pada output (blog BFL).
- Batas ~20 dtk per generate adalah narasi durasi publik—bukan syarat untuk setiap draf (ringkasan The Decoder atas materi BFL; blog BFL).
- Multi-shot dari satu prompt adalah kemampuan inti kreator di catatan awal—beri nomor shot di kedua jalur (Justine Moore / a16z).
- Pergeseran prompt gambar ke video: deskripsikan gerak + kamera + audio, bukan pakaian kedua atau bentuk produk baru (BFL: pembingkaian “animasi” frame awal).
- Halaman generate di sini: video untuk kedua mode; kerajinan still opsional di gambar.
Perbandingan langsung: teks vs mulai dari still
Baca tabel ini dulu—sekitar 30 detik untuk memilih jalur.
| Dimensi | Teks ke video | Gambar ke video | | --- | --- | --- | | Apa yang kamu berikan | Adegan tertulis saja | Still + prompt gerak | | Apa yang dikarang model | Tampilan, pakaian, set, pencahayaan | Gerak, kamera, waktu, sering juga energi audio | | Pekerjaan terbaik | Beat cerita, persona UGC, eksplorasi gaya, eksperimen multi-shot | Putaran produk, packshot merek, kunci karakter yang disetujui, poster ke gerak | | Kekuatan kontinuitas | Datang dari kunci prompt (baris pakaian/lokasi) | Datang dari piksel still lebih dulu | | Mode gagal | Logo / wajah / produk berubah karena di-generate ulang | Still terlalu ramai; prompt mendeskripsikan objek lain | | Waktu persiapan | Paling cepat | Butuh still bersih (foto atau generator gambar) | | Akar kapabilitas publik | Daftar video BFL FLUX 3 | Posting yang sama: animasi frame awal + referensi gambar |

Bahasa gerak yang berangkat dari prompt · keyframe showcase di FLUX 3 · still perencanaan, bukan master yang dinilai
Kapan teks ke video murni menang
Pilih teks ke video saat still belum ada—atau saat menciptakan still justru menghabiskan poin eksperimen.
1. Tes cerita multi-shot
Kamu peduli keterbacaan Shot 1 → Shot 2 → Shot 3 lebih dari kemasan yang presisi piksel. Komentar akses awal publik menyoroti kontrol multi-shot dari satu prompt (venturetwins). Mulai di video dengan shot bernomor (resep lengkap di panduan multi-shot).
2. Penciptaan UGC / persona
Tidak ada foto talent yang disetujui. Kamu ingin kreator handheld yang meyakinkan, bukan kecocokan kit merek. Tulis pakaian + ruangan + energi ucapan dalam satu blok—lalu iterasi baris, bukan still.
3. Eksplorasi rentang gaya
BFL menekankan rentang gaya yang luas—dari energi camcorder candid sampai animasi dan sinematik (blog BFL). Teks lebih cepat untuk “coba tiga tampilan” daripada mengunci tiga master dulu.
4. Pitch konsep murni
Stakeholder hanya butuh papan gerak putaran pertama. Teks membawamu ke sana tanpa loop arah seni pada still.
Lewati teks murni saat: hukum, merek, atau ecommerce butuh seni label yang persis, warna SKU, atau karakter yang sudah disetujui sebagai frame.
Kapan gambar ke video menang
Pilih gambar ke video saat tampilan sudah diputuskan dan gerak adalah pekerjaan yang tersisa.
1. Produk / kemasan nyata
Jika kotak, botol, atau screenshot UI sudah ada, jangan halusinasi ulang. Sematkan still, lalu prompt rotasi, tangan, cahaya, SFX saja. Lihat juga paket prompt demo produk.
2. Kunci identitas karakter
Frame hero yang disetujui (atau still yang kamu generate di gambar) → animasikan dengan kontinuitas. Pembingkaian BFL sendiri mencakup melanjutkan dari frame awal sebagai animasi (blog BFL).
3. Poster / key art ke gerak
Seni kampanye sudah tetap; kamu butuh push-in sosial 6–12 dtk. Gambar ke video menjaga komposisi; teks ke video berisiko keyframe “mirip tapi tidak sama.”
4. Setelah teks sudah menemukan still pemenang
Jalur hibrida di bawah: bekukan frame terbaik (atau generate ulang still yang bersih), lalu jalankan ulang gerak dari kunci itu.
Lewati gambar ke video saat: still berantakan, resolusi rendah, atau punya beberapa subjek yang bersaing—bersihkan still dulu.

Bahasa kunci still-dulu · frame showcase di FLUX 3 · still perencanaan, bukan still film yang dinilai
Jalur hibrida: halaman gambar → halaman video
Ini loop produksi yang sebenarnya dibutuhkan sebagian besar tim merek:
- Kerjakan atau rapikan still di gambar FLUX 3 (atau pakai foto nyata).
- Buka video FLUX 3 → gambar ke video.
- Prompt hanya gerak + kamera + audio + “preserve exact colors/logo/outfit.”
- Review layar penuh sekali; jika logo gagal dua kali, berhenti mengarang—perbaiki still, bukan kata sifat.
Materi publik juga mencatat referensi gambar sebagai jangkar visual (bukan hanya animasi frame awal) (blog BFL). Perlakukan still sebagai kontrak; teks adalah arahan.
Cara menjalankan kedua jalur di FLUX 3 (loop evaluasi)
- Buka video FLUX 3 (model situs tetap FLUX 3).
- Pilih jalur dari tabel di atas.
- Tempel Prompt A (teks) atau Prompt B (gambar ke video) dengan kata benda produkmu yang nyata.
- Nilai dengan checklist di bawah → simpan satu pemenang.
- Opsional: poles still di gambar, lalu animasikan ulang.
Bidik draf pertama sekitar 8–12 detik meskipun materi publik membahas klip hingga sekitar 20 detik (The Decoder; blog BFL). Beat yang lebih pendek lebih mudah dibaca di ponsel.
Prompt A — teks ke video multi-shot (salin-tempel)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — gambar ke video dari still terkunci (salin-tempel)
Pakai setelah kamu lampirkan still produk atau karakter yang bersih di video.
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — kerjakan still lalu animasikan (teks hibrida untuk halaman gambar)
Generate kunci yang bersih di gambar, lalu pakai Prompt B:
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
Checklist lolos/gagal (berlaku untuk kedua jalur)
Tonton sekali tanpa menggeser, lalu geser:
- Kecocokan jalur — apakah kamu mengarang saat seharusnya mengunci, atau mengunci saat butuh kebebasan?
- Identitas / produk — wajah, pakaian, atau logo sama di seluruh klip?
- Tangan / tepi — kotak meleleh, jari ekstra, label bergeser?
- Audio — cocok dengan peristiwa, atau kamu minta hening? Audio native adalah bagian dari cerita multimodal resmi (@bfl_ai; The Decoder).
- Crop — subjek aman untuk penempatan 9:16 gaya Reels/TikTok (jaga pusat tetap terbaca untuk iklan feed—lihat ikhtisar iklan Meta dan TikTok Ads Help).
- Polusi teks — glif acak atau watermark?
Dua gagal → ganti jalur atau still, bukan hanya menambah kata sifat.
Kesalahan umum
| Kesalahan | Mengapa merugikan | Perbaikan | | --- | --- | --- | | Teks ke video untuk kemasan legal | Logo dikarang | Still nyata + gambar ke video | | Prompt gambar ke video menulis ulang produk | Melawan still | Gerak/kamera/audio saja | | Still ramai (banyak objek) | Kaitan gerak gagal | Crop ke satu subjek hero | | Tidak ada daftar shot di kedua jalur | Bubur berkelanjutan | Beri nomor Shot 1/2/3 | | Durasi maksimal di percobaan pertama | Beat tidak terbaca | Mulai ~8–12 dtk | | Musik + dialog + SFX sekaligus | Audio keruh | Satu baris prioritas audio |
Pemenang skenario (jika / maka)
| Jika… | Maka mulai dengan… | Mengapa | | --- | --- | --- | | Kamu hanya punya ide satu baris | Teks ke video | Loop tercepat | | Merek mengirim PNG packshot | Gambar ke video | Geometri sudah kebenaran | | Karakter bagus hanya di satu still | Hibrida | Bekukan tampilan, variasikan kamera | | Tes dialog multi-shot | Teks ke video dulu | Tata bahasa sebelum kunci | | Logo gagal dua kali di teks | Berhenti → still + gambar ke video | Jangan bakar jalankan mengarang lagi | | Menjelajah gaya camcorder vs animasi | Teks ke video | Gaya adalah eksperimennya (rentang gaya BFL) |
Yang kita tahu vs. yang tidak kita klaim
| Kita tahu (bersumber) | Kita tidak tahu / tidak akan klaim | | --- | --- | | Peluncuran publik FLUX 3 23 Juli 2026 dengan pembingkaian multimodal video + audio (@bfl_ai; blog BFL; ringkasan wire) | Bahwa setiap host menampilkan kontrol frame awal atau durasi yang identik | | Daftar video resmi mencakup teks ke video dan gambar ke video (frame awal atau referensi gambar) (blog BFL) | Kesempurnaan logo take pertama yang dijamin untuk setiap SKU | | Klip hingga sekitar 20 detik dengan audio native muncul di materi publik (blog BFL; The Decoder) | Bahwa lebih panjang selalu lebih baik untuk iklan sosial | | Rangkaian multi-shot muncul di catatan kreator awal (venturetwins) | Sertifikasi industri film independen yang menempatkan satu jalur secara permanen “lebih baik” |
FAQ
Apa bedanya teks ke video dan gambar ke video FLUX 3?
Teks ke video membangun klip dari prompt tertulis saja. Gambar ke video dikondisikan pada still—baik sebagai frame awal untuk dianimasikan atau sebagai referensi visual—lalu mengikuti arahan gerak dan audiomu (blog BFL).
Jalur mana yang harus saya pakai dulu di flux3.video?
Jika kamu tidak punya still yang disetujui, mulai teks ke video. Jika tampilan merek sudah tetap, mulai gambar ke video di generator video yang sama.
Bisa pakai keduanya dalam satu proyek?
Ya. Banyak tim menemukan dengan teks, mengunci still di gambar atau dari foto, lalu menyelesaikan dengan gambar ke video.
Apakah gambar ke video termasuk audio?
Daftar kapabilitas video publik FLUX 3 mencantumkan generate audio native bersama output, termasuk jalur yang dikondisikan gambar dalam set kapabilitas yang sama (blog BFL; The Decoder). Tetap dengarkan setiap take.
Berapa lama klip pertama saya seharusnya?
Batas durasi yang disebut publik sekitar 20 detik (blog BFL). Untuk keputusan, mulai 8–12 detik agar kualitas jalur jelas.
Mengapa logo produk saya rusak di teks ke video?
Model sedang mengarang piksel. Beralih ke still yang benar + gambar ke video, dan larang teks baru di prompt.
Mengapa gambar ke video mengabaikan still saya?
Biasanya still berantakan atau prompt mendeskripsikan ulang produk yang berbeda. Crop ke satu subjek; tulis hanya gerak + kamera + audio.
Perlu generator gambar?
Hanya untuk kunci hibrida. Teks murni dan foto→video murni bisa melewatinya. Still ada di gambar saat kamu membutuhkannya.
Di mana prompt multi-shot masuk?
Kedua jalur. Beri nomor shot secara eksplisit—lihat multi-shot & audio native.
Apakah ini sama dengan artikel peringkat model sejawat?
Tidak. Halaman ini adalah pemilihan jalur di dalam FLUX 3. Untuk kriteria vs sistem lain, baca FLUX 3 vs model video AI sejawat.
Di mana saya coba gratis?
Buka video FLUX 3 di flux3.video dan mulai gratis—tanpa kartu untuk memulai.
Tentang Reese Okada
Reese Okada adalah penulis alur kerja video AI yang mengubah prompt multi-shot menjadi alur browser yang bisa diulang di FLUX 3. Panduan ini berfokus pada memilih teks vs still-dulu agar jalankan gratis masuk ke jalur yang cocok dengan pekerjaan.
