Black Forest Labs позиционирует FLUX 3 как одну multimodal-систему, которая может генерировать video + native audio из чистого текста или из image references — включая анимацию от стартового кадра (блог BFL о FLUX 3, 23 июля 2026; страница моделей BFL; заметки о запуске через @bfl_ai).
На FLUX 3 (этот продукт) оба пути живут в одном видеогенераторе. Дорогая ошибка — не «выбрать более слабую модель», а стартовать не тем способом для задачи: изобретать упаковку, которая должна совпасть с legal artwork, или избыточно жёстко фиксировать сцену, которой хватило бы письменного beat sheet.
Это decision how-to: когда стартовать с текста, когда сначала зафиксировать still, и как бесплатно прогнать честный evaluate loop на flux3.video. Для multi-shot грамматики — companion-гайд multi-shot и native audio. Карта запуска: Что такое FLUX 3?.
TLDR
| Стартовать с | Лучше всего, когда | Пропустить, когда |
|---|---|---|
| Text to video | Вы изобретаете мир, тестируете multi-shot грамматику или исследуете стили | Бренду нужна точная геометрия лого/упаковки |
| Image to video | Уже есть product still, character board или approved frame | Нет still и нет времени сделать его — просто пишите текст |
| Hybrid (still → motion) | Identity или packaging должны пережить cuts | Нужен только mood test |
Правило по умолчанию: если look должен совпасть с approved still, используйте image to video. Если история и камера изобретают look, используйте text to video. Оба пути — на FLUX 3 video; stills при необходимости крафтите на FLUX 3 image.
Ключевые выводы
- Официальный dual path: FLUX 3 video включает text-to-video и image-to-video (анимация start-frame или images как visual references), с native audio на outputs (блог BFL).
- ~20 с ceiling одной генерации — публичный length narrative, а не требование для каждого draft (сводка The Decoder по материалам BFL; блог BFL).
- Multi-shot из одного промпта — first-class skill в early notes: нумеруйте shots на любом пути (Justine Moore / a16z).
- Сдвиг промпта в image-to-video: описывайте motion + camera + audio, а не второй outfit или новую форму продукта (BFL: framing «анимации» от starting frame).
- Money pages здесь: video для обоих режимов; optional still craft на image.
Head-to-head: text vs still start
Сначала прочитайте эту таблицу — около 30 секунд, чтобы выбрать путь.
| Измерение | Text to video | Image to video |
|---|---|---|
| Что вы даёте | Только written scene | Still + motion prompt |
| Что изобретает модель | Look, wardrobe, set, lighting | Motion, camera, time, часто audio energy |
| Лучшие задачи | Story beats, UGC personas, style exploration, multi-shot experiments | Product spin, brand packshots, approved character lock, poster-to-motion |
| Сила continuity | Из prompt locks (строки wardrobe/location) | Сначала из пикселей still |
| Failure mode | Logo / face / product invents drift | Still слишком busy; промпт переописывает другой object |
| Prep time | Самый быстрый | Нужен clean still (фото или image generator) |
| Публичный capability root | Список FLUX 3 video у BFL | Тот же пост: start-frame animation + image references |

Prompt-first motion language · showcase keyframe на FLUX 3 · planning still, не graded master
Когда выигрывает pure text to video
Выбирайте text to video, когда still ещё не существует — или когда invent still обесценило бы сам эксперимент.
1. Multi-shot story tests
Вам важнее читаемость Shot 1 → Shot 2 → Shot 3, чем pixel-perfect packaging. Публичные early-access комментарии выделяют multi-shot control из одного промпта (venturetwins). Стартуйте на video с numbered shots (полные рецепты — в multi-shot how-to).
2. UGC / persona invention
Нет approved talent photo. Нужен believable handheld creator, а не match brand kit. Напишите wardrobe + room + speech energy одним блоком — затем итерируйте строки, а не stills.
3. Style range exploration
BFL подчёркивает широкий style range — от candid camcorder energy до animation и cinematics (блог BFL). Текст быстрее для «попробовать три look», чем сначала lock трёх masters.
4. Pure concept pitches
Стейкхолдерам нужен только first-pass motion board. Текст даёт это без art-direction loop по stills.
Пропускайте pure text, когда: legal, brand или ecommerce требуют точного label art, цвета SKU или character, уже подписанного как frame.
Когда выигрывает image to video
Выбирайте image to video, когда look уже решён, а motion — оставшаяся работа.
1. Real product / packaging
Если box, bottle или UI screenshot уже существуют, не re-hallucinate их. Закрепите still, затем промпьте только rotation, hands, light, SFX. См. также product demo prompt pack.
2. Character identity lock
Approved hero frame (или still, сгенерированный на image) → animate с continuity. Framing BFL включает продолжение от starting frame как animation (блог BFL).
3. Poster / key art to motion
Campaign art зафиксирован; нужен 6–12s social push-in. Image-to-video сохраняет composition; text-to-video рискует «похожим, но не тем» keyframe.
4. После того как text уже нашёл winner still
Hybrid path ниже: freeze лучший frame (или regenerate clean still), затем re-run motion из этого lock.
Пропускайте image-to-video, когда: still cluttered, low-res или с несколькими competing subjects — сначала почистите still.

Still-first lock language · showcase frame на FLUX 3 · planning still, не graded film still
Hybrid path: image page → video page
Это production loop, который большинству brand teams реально нужен:
- Скрафтите или доведите still на FLUX 3 image (или используйте реальное фото).
- Откройте FLUX 3 video → image to video.
- Промпьте только motion + camera + audio + «preserve exact colors/logo/outfit».
- Один full-screen review; если logo fails дважды — перестаньте invent: чините still, а не adjectives.
Публичные материалы также отмечают image references как visual anchors (не только start-frame animation) (блог BFL). Относитесь к still как к контракту; текст — это direction.
Как прогнать оба пути на FLUX 3 (evaluate loop)
- Откройте FLUX 3 video (house model остаётся FLUX 3).
- Выберите path по таблице выше.
- Вставьте Prompt A (text) или Prompt B (image-to-video) с вашим real product noun.
- Оцените по checklist ниже → оставьте одного winner.
- Optional: polish still на image, затем re-animate.
First drafts целите около 8–12 секунд, даже если публичные материалы обсуждают клипы до примерно 20 секунд (The Decoder; блог BFL). Более короткие beats проще читать на phone.
Prompt A — text to video multi-shot (copy-paste)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — image to video from a locked still (copy-paste)
Используйте после того, как прикрепили clean product или character still на video.
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — still craft then animate (hybrid text for image page)
Сгенерируйте clean lock на image, затем используйте Prompt B:
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
Pass/fail checklist (работает для обоих paths)
Посмотрите один раз без scrubbing, затем scrub:
- Path fit — invent, когда нужно было lock, или lock, когда нужна была freedom?
- Identity / product — same face, wardrobe или logo across the clip?
- Hands / edges — melting box, extra fingers, sliding labels?
- Audio — совпадает с events, или вы просили silence? Native audio — часть официальной multimodal story (@bfl_ai; The Decoder).
- Crop — subject safe для 9:16 Reels/TikTok-style placements (держите centers readable для feed ads — см. Meta ads overview и TikTok Ads Help).
- Text pollution — random glyphs или watermarks?
Два fail → меняйте path или still, а не только добавляйте adjectives.
Частые ошибки
| Ошибка | Почему больно | Fix |
|---|---|---|
| Text-to-video для legal packaging | Logo invents | Real still + image-to-video |
| Image-to-video промпт переписывает product | Бьётся со still | Только motion/camera/audio |
| Busy still (много objects) | Motion latch fails | Crop до one hero subject |
| Нет shot list на любом path | Continuous mush | Number Shot 1/2/3 |
| Max duration с первого try | Unreadable beats | Start ~8–12s |
| Music + dialogue + SFX сразу | Muddy audio | Одна audio priority line |
Scenario winners (if / then)
| Если… | Тогда стартуйте с… | Почему |
|---|---|---|
| Есть только one-line idea | Text to video | Fastest loop |
| Brand прислал packshot PNG | Image to video | Geometry уже truth |
| Character looks good только в one still | Hybrid | Freeze look, vary camera |
| Multi-shot dialogue test | Сначала Text to video | Grammar before locks |
| Logo failed дважды в text | Stop → still + i2v | Не сжигайте больше invent runs |
| Exploring camcorder vs animation style | Text to video | Style и есть experiment (BFL style range) |
Что мы знаем vs. чего не знаем
| Знаем (sourced) | Не знаем / не утверждаем |
|---|---|
| Публичный запуск FLUX 3 23 июля 2026 с multimodal video + audio framing (@bfl_ai; блог BFL; wire summary) | Что каждый host отдаёт identical start-frame controls или durations |
| Официальный video list включает text-to-video и image-to-video (start frame или image references) (блог BFL) | Guaranteed first-take logo perfection для каждого SKU |
| Клипы до примерно 20 секунд с native audio появляются в публичных материалах (блог BFL; The Decoder) | Что longer всегда better для social ads |
| Multi-shot chaining появляется в early creator notes (venturetwins) | Independent film-industry certifications, ranking one path permanently «better» |
FAQ
В чём разница между FLUX 3 text-to-video и image-to-video?
Text-to-video собирает clip только из written prompt. Image-to-video опирается на still — как starting frame для animation или как visual reference — затем следует вашим motion и audio directions (блог BFL).
Какой path использовать первым на flux3.video?
Если нет approved still, стартуйте text to video. Если brand look уже fixed, стартуйте image to video в том же видеогенераторе.
Можно ли использовать оба в одном проекте?
Да. Многие команды discover через text, lock still на image или из фото, затем finish через image-to-video.
Включает ли image-to-video audio?
Публичные capability list FLUX 3 video включают native audio generation на outputs, в том числе image-conditioned paths в том же capability set (блог BFL; The Decoder). Всё равно слушайте каждый take.
Какой длины делать первый clip?
Публичный ceiling narrative — около 20 секунд (блог BFL). Для decisions стартуйте 8–12 секунд, чтобы path quality была очевидна.
Почему product logo ломается в text-to-video?
Модель invents pixels. Переключитесь на true still + image to video и запретите new text в промпте.
Почему image-to-video игнорирует мой still?
Обычно still cluttered или промпт redescribes другой product. Crop до one subject; пишите только motion + camera + audio.
Нужен ли image generator?
Только для hybrid locks. Pure text и pure photo→video могут его пропустить. Stills живут на image, когда они нужны.
Куда вписываются multi-shot промпты?
В любой path. Нумеруйте shots явно — см. multi-shot и native audio.
Это то же самое, что peer-model ranking article?
Нет. Эта страница — path selection внутри FLUX 3. Критерии vs other systems: FLUX 3 vs peer AI video models.
Где попробовать бесплатно?
Откройте FLUX 3 video на flux3.video и начните бесплатно — карта не нужна, чтобы стартовать.
Об Reese Okada
Reese Okada — AI video workflow writer, который превращает multi-shot промпты в повторяемые browser workflows на FLUX 3. Этот гайд фокусируется на выборе text vs still-first, чтобы free runs уходили в path, который соответствует задаче.