A Black Forest Labs posiciona o FLUX 3 como um sistema multimodal que pode gerar vídeo + áudio nativo a partir de texto puro ou de referências de imagem—incluindo animar a partir de um frame inicial (blog da BFL FLUX 3, 23 de julho de 2026; página de modelos da BFL; notas de lançamento via @bfl_ai).
No FLUX 3 (este produto), os dois caminhos moram no mesmo gerador de vídeo. O erro caro não é “escolher o modelo mais fraco”—é começar do jeito errado para o trabalho: inventar um packaging que precisa bater com arte legal, ou super-restringir uma cena que só precisava de um beat sheet escrito.
Isto é um how-to de decisão: quando partir de texto, quando travar um still primeiro, e como rodar um loop de avaliação justo e grátis em flux3.video. Para a gramática multi-shot, use o guia companheiro multi-shot e áudio nativo. Para o mapa de lançamento, veja O que é o FLUX 3?.
TLDR
| Comece com | Melhor quando | Pule quando |
|---|---|---|
| Text to video | Você está inventando o mundo, testando gramática multi-shot ou explorando estilos | A marca precisa de geometria exata de logo/packaging |
| Image to video | Você já tem um still de produto, character board ou frame aprovado | Você não tem still nem tempo para fazer um—só escreva texto |
| Híbrido (still → motion) | Identidade ou packaging precisa sobreviver aos cortes | Você só precisa de um teste de mood |
Regra padrão: se o look precisa bater com um still aprovado, use image to video. Se a história e a câmera inventam o look, use text to video. Os dois rodam no FLUX 3 vídeo; faça stills no FLUX 3 imagem quando precisar.
Pontos principais
- Caminho dual oficial: o vídeo do FLUX 3 inclui text-to-video e image-to-video (animação a partir de frame inicial ou imagens como referências visuais), com áudio nativo nas saídas (blog da BFL).
- Teto de ~20 s por geração única é a narrativa pública de duração—não um requisito em cada rascunho (resumo do The Decoder sobre materiais da BFL; blog da BFL).
- Multi-shot a partir de um único prompt é skill de criador de primeira classe nas notas iniciais—numere seus planos em qualquer um dos caminhos (Justine Moore / a16z).
- Mudança de prompt no image-to-video: descreva motion + câmera + áudio, não um segundo outfit nem um novo formato de produto (BFL: framing de “animação” a partir de frame inicial).
- Money pages aqui: vídeo para os dois modos; craft opcional de stills em imagem.
Cara a cara: texto vs partida a partir de still
Leia esta tabela primeiro—cerca de 30 segundos para escolher um caminho.
| Dimensão | Text to video | Image to video |
|---|---|---|
| O que você entrega | Só a cena escrita | Still + prompt de motion |
| O que o modelo inventa | Look, figurino, set, iluminação | Motion, câmera, tempo, muitas vezes energia de áudio |
| Melhores trabalhos | Beats de história, personas UGC, exploração de estilo, experimentos multi-shot | Product spin, packshots de marca, lock de personagem aprovado, poster-to-motion |
| Força de continuidade | Vem de locks no prompt (linhas de figurino/local) | Vem primeiro dos pixels do still |
| Modo de falha | Logo / rosto / produto inventa e desvia | Still lotado demais; o prompt redescreve outro objeto |
| Tempo de prep | O mais rápido | Precisa de um still limpo (foto ou gerador de imagem) |
| Raiz pública de capacidade | Lista de vídeo FLUX 3 da BFL | O mesmo post: animação a partir de frame inicial + referências de imagem |

Linguagem de motion prompt-first · keyframe showcase no FLUX 3 · still de planejamento, não um master aprovado
Quando text to video puro vence
Escolha text to video quando o still ainda não existe—ou quando inventar o still desperdiçaria o ponto do experimento.
1. Testes de história multi-shot
Você se importa com a legibilidade de Shot 1 → Shot 2 → Shot 3 mais do que com packaging perfeito em pixel. O comentário público de early access destaca o controle multi-shot a partir de um único prompt (venturetwins). Comece em vídeo com planos numerados (receitas completas no how-to multi-shot).
2. Invenção de UGC / persona
Sem foto de talento aprovada. Você quer um creator handheld crível, não um match de brand kit. Escreva figurino + quarto + energia de fala em um bloco—depois itere linhas, não stills.
3. Exploração de faixa de estilo
A BFL enfatiza uma faixa ampla de estilos—da energia de camcorder candid a animação e cinemática (blog da BFL). Texto é mais rápido para “testar três looks” do que travar três masters primeiro.
4. Pitches de conceito puro
Stakeholders só precisam de um motion board de primeira passada. O texto te leva lá sem um loop de art direction em stills.
Pule texto puro quando: legal, marca ou ecommerce precisa de arte de rótulo exata, cor de SKU ou um personagem já assinado como frame.
Quando image to video vence
Escolha image to video quando o look já está decidido e o motion é o trabalho que resta.
1. Produto real / packaging
Se a caixa, garrafa ou print de UI já existe, não re-alucine. Fixe o still e depois prompt só rotação, mãos, luz, SFX. Veja também o pack de prompts de product demo.
2. Lock de identidade de personagem
Frame hero aprovado (ou um still que você gerou em imagem) → anime com continuidade. O próprio framing da BFL inclui continuar a partir de um frame inicial como animação (blog da BFL).
3. Poster / key art para motion
A arte de campanha está fixa; você precisa de um push-in social de 6–12 s. Image-to-video mantém a composição; text-to-video arrisca um keyframe “parecido, mas não o mesmo”.
4. Depois que o texto já achou um still vencedor
Caminho híbrido abaixo: congele o melhor frame (ou regenere um still limpo) e rode o motion de novo a partir desse lock.
Pule image-to-video quando: o still está poluído, em baixa resolução ou tem vários sujeitos competindo—limpe o still primeiro.

Linguagem de lock still-first · frame showcase no FLUX 3 · still de planejamento, não um fotograma de cinema aprovado
Caminho híbrido: página de imagem → página de vídeo
Este é o loop de produção que a maioria das equipes de marca realmente precisa:
- Crie ou refine um still em FLUX 3 imagem (ou use uma foto real).
- Abra FLUX 3 vídeo → image to video.
- Prompt só motion + câmera + áudio + “preserve exact colors/logo/outfit.”
- Revisão em tela cheia uma vez; se o logo falhar duas vezes, pare de inventar—conserte o still, não os adjetivos.
Os materiais públicos também notam referências de imagem como âncoras visuais (não só animação a partir de frame inicial) (blog da BFL). Trate o still como o contrato; o texto é a direção.
Como rodar os dois caminhos no FLUX 3 (loop de avaliação)
- Abra FLUX 3 vídeo (o modelo da casa permanece FLUX 3).
- Escolha o caminho pela tabela acima.
- Cole o Prompt A (texto) ou o Prompt B (image-to-video) com o substantivo real do seu produto.
- Julgue com o checklist abaixo → fique com um vencedor.
- Opcional: polir um still em imagem e depois reanimar.
Mire primeiros rascunhos em cerca de 8–12 segundos, mesmo que os materiais públicos falem de clips de até cerca de 20 segundos (The Decoder; blog da BFL). Beats mais curtos são mais fáceis de ler no celular.
Prompt A — text to video multi-shot (copy-paste)
Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.
Prompt B — image to video a partir de um still travado (copy-paste)
Use depois de anexar um still limpo de produto ou personagem em vídeo.
Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.
Prompt C — craft de still e depois animar (texto híbrido para a página de imagem)
Gere um lock limpo em imagem e depois use o Prompt B:
Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.
Checklist de pass/fail (vale para os dois caminhos)
Assista uma vez sem scrubbing e depois faça scrub:
- Encaixe do caminho — você inventou quando deveria ter travado, ou travou quando precisava de liberdade?
- Identidade / produto — mesmo rosto, figurino ou logo ao longo do clip?
- Mãos / bordas — caixa derretendo, dedos a mais, rótulos escorregando?
- Áudio — combina com os eventos, ou você pediu silêncio? Áudio nativo faz parte da história multimodal oficial (@bfl_ai; The Decoder).
- Crop — sujeito seguro para placements 9:16 no estilo Reels/TikTok (mantenha centros legíveis para ads de feed—veja visão geral de Meta ads e TikTok Ads Help)?
- Poluição de texto — glifos aleatórios ou watermarks?
Duas falhas → mude o caminho ou o still, não só adicione adjetivos.
Erros comuns
| Erro | Por que dói | Correção |
|---|---|---|
| Text-to-video para packaging legal | O logo inventa | Still real + image-to-video |
| Prompt de image-to-video reescreve o produto | Briga com o still | Só motion/câmera/áudio |
| Still lotado (muitos objetos) | Latch de motion falha | Recorte para um sujeito hero |
| Sem shot list em nenhum caminho | Mingau contínuo | Numere Shot 1/2/3 |
| Duração máxima na primeira tentativa | Beats ilegíveis | Comece ~8–12 s |
| Música + diálogo + SFX ao mesmo tempo | Áudio sujo | Uma linha de prioridade de áudio |
Vencedores por cenário (se / então)
| Se… | Então comece com… | Por quê |
|---|---|---|
| Você só tem uma ideia de uma linha | Text to video | Loop mais rápido |
| A marca mandou um packshot PNG | Image to video | A geometria já é a verdade |
| O personagem só fica bom em um still | Híbrido | Congele o look, varie a câmera |
| Teste de diálogo multi-shot | Text to video primeiro | Gramática antes dos locks |
| O logo falhou duas vezes em texto | Pare → still + i2v | Não queime mais runs de invenção |
| Explorando estilo camcorder vs animação | Text to video | O estilo é o experimento (faixa de estilo BFL) |
O que sabemos vs. o que não sabemos
| Sabemos (com fonte) | Não sabemos / não afirmamos |
|---|---|
| Lançamento público do FLUX 3 em 23 de julho de 2026 com framing multimodal de vídeo + áudio (@bfl_ai; blog da BFL; resumo wire) | Que todo host exponha controles ou durações idênticos de frame inicial |
| A lista oficial de vídeo inclui text-to-video e image-to-video (frame inicial ou referências de imagem) (blog da BFL) | Perfeição de logo garantida no primeiro take para cada SKU |
| Clips de até cerca de 20 segundos com áudio nativo aparecem em materiais públicos (blog da BFL; The Decoder) | Que mais longo seja sempre melhor para ads sociais |
| Encadeamento multi-shot aparece em notas iniciais de criadores (venturetwins) | Certificações independentes da indústria que ranqueiem um caminho permanentemente “melhor” |
FAQ
Qual é a diferença entre FLUX 3 text-to-video e image-to-video?
Text-to-video monta o clip só a partir de um prompt escrito. Image-to-video se condiciona a um still—seja como frame inicial a animar ou como referência visual—e depois segue suas direções de motion e áudio (blog da BFL).
Qual caminho devo usar primeiro em flux3.video?
Se você não tem um still aprovado, comece com text to video. Se o look de marca já está fixo, comece com image to video no mesmo gerador de vídeo.
Posso usar os dois no mesmo projeto?
Sim. Muitas equipes descobrem com texto, travam um still em imagem ou a partir de uma foto e depois terminam com image-to-video.
Image-to-video inclui áudio?
A lista pública de capacidades de vídeo do FLUX 3 inclui geração de áudio nativo nas saídas, inclusive caminhos condicionados por imagem no mesmo conjunto de capacidades (blog da BFL; The Decoder). Ainda assim escute cada take.
Qual deve ser a duração do meu primeiro clip?
A narrativa pública de teto é de cerca de 20 segundos (blog da BFL). Para decidir, comece com 8–12 segundos para a qualidade do caminho ficar óbvia.
Por que o logo do meu produto quebra em text-to-video?
O modelo está inventando pixels. Mude para um still de verdade + image to video e proíba texto novo no prompt.
Por que o image-to-video ignora o meu still?
Em geral o still está poluído ou o prompt redescreve um produto diferente. Recorte para um sujeito; escreva só motion + câmera + áudio.
Preciso do gerador de imagem?
Só para locks híbridos. Texto puro e foto→vídeo puro podem pular. Stills ficam em imagem quando você precisa.
Onde entram os prompts multi-shot?
Em qualquer um dos caminhos. Numere os planos de forma explícita—veja multi-shot e áudio nativo.
Isto é o mesmo que um artigo de ranking frente a modelos pares?
Não. Esta página é seleção de caminho dentro do FLUX 3. Para critérios frente a outros sistemas, leia FLUX 3 vs modelos de vídeo IA pares.
Onde eu testo grátis?
Abra o FLUX 3 vídeo em flux3.video e comece grátis—não precisa de cartão para iniciar.
Sobre Reese Okada
Reese Okada escreve sobre fluxos de trabalho de vídeo com IA e transforma prompts multi-shot em workflows repetíveis no navegador no FLUX 3. Este guia foca em escolher texto vs still-first para que os runs grátis vão para o caminho que encaixa no trabalho.