30% OFF por tempo limitado!Pegar oferta

FLUX 3 Video: multi-shot, clips ~20 s e áudio nativo

Escrito por Reese Okada · Publicado em 2026-07-24 flux-3flux3multi-shottext-to-videoimage-to-videonative-audiohow-to
FLUX 3 Video: multi-shot, clips ~20 s e áudio nativo

TLDR

  1. Abra o FLUX 3 vídeo.
  2. Escreva Shot 1 / Shot 2 / Shot 3 (quem, câmera, ação) em vez de uma vibe vaga.
  3. Limite a ambição: em primeiros rascunhos, busque clareza de ~8–12 s antes de maximizar a duração.
  4. Adicione intenção de áudio (ambiente / SFX / sem música) em uma linha.
  5. Revisão em tela cheia: rostos, lógica de cortes, mãos, movimento de lábios se houver fala, crop para Reels.
  6. Opcional: trave um hero still em imagem e depois image to video.

Pontos principais

  • Multi-shot é skill de primeira classe: criadores com acesso antecipado destacam vários ângulos em uma geração (venturetwins).
  • ~20 s é o teto narrativo público—não um requisito em cada take (The Decoder).
  • Áudio nativo significa que você pode especificar ambiente/SFX/energia de diálogo em vez de sempre pós-sincronizar depois (lançamento BFL; The Decoder).
  • Estrutura de prompt vence adjetivos: numere os planos, nomeie a câmera, trave a continuidade de figurino.
  • Try here: tudo abaixo roda no gerador de vídeo (text-to-video e image-to-video).

Antes de começar (checklist de 60 segundos)

| Checagem | Por quê | | --- | --- | | Você tem um trabalho real (anúncio UGC, product spin, beat de diálogo) | Prompts “epic” aleatórios desperdiçam runs grátis | | Você consegue listar 2–4 planos no papel | Modelos multi-shot recompensam cortes explícitos | | Figurino / sujeito é uma linha clara | Drift de identidade costuma começar com personagens vagos | | Você sabe o aspect ratio (9:16, 16:9, 1:1) | Crops de social matam bons centros | | Você vai revisar em tela cheia uma vez | Thumbnails mentem sobre rostos e mãos |

Passo 1 — Abrir o gerador de vídeo FLUX 3

Vá para FLUX 3 vídeo. Mantenha o FLUX 3 selecionado como modelo de vídeo da casa. Fique nesta página para text to video e image to video—você não precisa de um segundo produto para o loop básico.

Precisa de stills primeiro? Gere ou refine um frame hero em FLUX 3 imagem, baixe/salve e depois anime no vídeo.

Passo 2 — Escrever prompts multi-shot (a skill central)

Use este esqueleto toda vez:

  1. Linha de formato — intenção de duração, aspect, gênero.
  2. Lista de planos — Shot 1 wide / Shot 2 medium / Shot 3 close (verbos de ação).
  3. Linha de continuidade — mesmas pessoas, mesmas roupas, mesmo local.
  4. Linha de áudio — ambiente, SFX, diálogo ou silêncio.
  5. Negativos — no watermark, no extra logos, no random text.

Prompt 1 — multi-shot product unbox (copy-paste)

Vertical 9:16 product ad, about 10 seconds, clean desk daylight.
Shot 1 wide: sealed matte white product box on oak table, soft window light.
Shot 2 medium: hands open the box lid smoothly, tissue paper folds clearly.
Shot 3 close-up: wireless earbuds lift toward camera, subtle specular highlight.
Same hands, same box branding color, continuous desk environment.
Soft paper rustle and light whoosh SFX, no music bed, no on-screen text, no watermark.

Prompt 2 — multi-shot dialogue beat

Horizontal short scene, about 12 seconds, warm kitchen night.
Shot 1 medium two-shot: two friends at a small table, tea cups, fairy lights bokeh.
Shot 2 over-shoulder: person A speaks with natural lip motion, soft smile.
Shot 3 reaction close-up: person B laughs, eyes crinkle, steam rises from cup.
Same wardrobe and hairstyles across all shots, consistent table props.
Quiet room tone plus light cup clink SFX; dialogue energy, no loud score, no subtitles, no watermark.

Prompt 3 — multi-shot outdoor action (simple)

Horizontal action clip, about 8 seconds, golden hour park path.
Shot 1 wide tracking: runner in red jacket jogs toward camera on gravel path.
Shot 2 side medium: arms and jacket fabric motion, trees streak softly.
Shot 3 low angle hero: runner passes, dust motes in sunbeams.
Same red jacket and black shorts throughout.
Footsteps and light wind ambience, no music, no text, no watermark.

Text-to-video style keyframe — motion-first storytelling · showcase on FLUX 3

Linguagem de movimento orientada ao prompt · keyframe showcase no FLUX 3 · still de estilo gerado para planejamento, não um frame de filme etalonado

Passo 3 — Adicionar áudio nativo de propósito

A história pública do FLUX 3 inclui áudio nativo com o vídeo (BFL; The Decoder). Trate o áudio como uma linha de direção, não um afterthought:

| Intenção | Linha de exemplo | | --- | --- | | Só ambiente | “city night ambience and light rain, no music, no dialogue” | | Hit de SFX | “soft whoosh on logo settle, no voiceover” | | Energia de diálogo | “natural conversational speech, quiet room tone, no score” | | Silêncio | “no music, no SFX, no dialogue—picture only” |

Dica de lipsync: coloque o rosto que fala em plano close ou medium e diga “natural lip motion” de forma explícita (Prompt 2). Planos extremos de corpo inteiro dificultam julgar o detalhe da boca.

Passo 4 — Text to video vs image to video

| Começar de | Usar quando | Caminho | | --- | --- | --- | | Text to video | Você inventa a cena inteira | Gerador de vídeo | | Image to video | Você já tem foto de produto, frame de personagem ou poster | Mesma página de vídeo; still opcional em imagem |

Receita image-to-video: mantenha o still simples (um sujeito, bordas claras) e prompteie só movimento + câmera + áudio—não redescreva um outfit diferente.

Image-to-video, 6 seconds, gentle push-in.
Preserve the exact product, colors, and logo from the reference still.
Soft studio light consistency, subtle rotation of the product, clean background.
Soft whoosh SFX, no new text, no watermark.

Passo 5 — Checklist pass/fail (tela cheia)

Assista uma vez sem scrub e depois revise:

  1. Lógica de cortes — Shot 1→2→3 se lê como intencional?
  2. Identidade — mesmo rosto, cabelo, figurino entre cortes?
  3. Mãos / props — dedos a mais, caixas derretendo, labels deslizando?
  4. Encaixe do áudio — o som bate com os eventos (ou você pediu silêncio)?
  5. Crop — rostos e produto seguros em 9:16?
  6. Poluição de texto — glifos aleatórios ou watermarks?

Se dois desses falharem, reescreva a lista de planos antes de queimar mais runs. Em geral o fix é planos mais curtos e claros, não mais adjetivos.

Modos de falha comuns (e fixes)

| Sintoma | Causa provável | Fix | | --- | --- | --- | | Um plano longo contínuo | Sem planos numerados | Adicione Shot 1/2/3 explícitos | | Personagem muta entre cortes | Figurino vago | Uma frase travando roupa/cabelo | | Áudio cheio demais | Música + diálogo + SFX em conflito | Escolha uma prioridade de áudio | | Ótimo rosto, logo de produto ruim | Muito caos de câmera | Push-in lento; menos cortes | | Bom 16:9, 9:16 quebrado | Sem aspect no prompt | Declare vertical 9:16 + sujeito centralizado |

Como rodar um loop de avaliação em 3 passos no FLUX 3

  1. Abra FLUX 3 vídeo.
  2. Cole o Prompt 1 (ou seu brief real usando o esqueleto).
  3. Julgue com a lista pass/fail → salve o keeper → polish opcional image-to-video a partir de um still em imagem.

FAQ

O que torna o prompting de FLUX 3 vídeo diferente?

Notas públicas de criadores destacam o controle multi-shot a partir de um único prompt e microdetalhe mais forte (venturetwins; lançamento BFL). Escreva cortes, não só moods.

Qual deve ser a duração do meu primeiro clip FLUX 3?

Materiais públicos falam de gerações de até cerca de 20 segundos (The Decoder). Para aprender multi-shot, comece por volta de 8–12 segundos para cada beat continuar legível.

Quantos planos devo pedir?

Dois a quatro em primeiros rascunhos. Mais planos aumentam o risco de continuidade antes de você ter uma linha de personagem estável.

O FLUX 3 faz áudio nativo e lipsync?

Áudio nativo faz parte da história multimodal oficial (BFL; The Decoder). Demos da comunidade também destacam movimento de lábios—sempre escute e faça zoom nos seus próprios takes.

Devo usar text to video ou image to video?

Text to video para cenas inventadas; image to video quando stills de marca já existem. Ambos estão no gerador de vídeo.

Preciso da página de imagem?

Só se quiser um still controlado primeiro. Gere em imagem e depois anime no vídeo.

Por que meu multi-shot colapsa em um take contínuo?

Seu prompt provavelmente carece de planos numerados e tamanhos de câmera. Use o esqueleto do Passo 2.

Posso banir música?

Sim—diga “no music bed” ou “picture only, no SFX” na linha de áudio.

Onde testar grátis?

Abra o FLUX 3 vídeo em flux3.video e comece grátis—sem cartão para iniciar.

O que ler em seguida?

O overview do lançamento: O que é o FLUX 3?.

Sobre Reese Okada

Reese Okada é escritor/a de workflows de vídeo com IA que transforma prompts multi-shot em fluxos de navegador repetíveis no FLUX 3.

More Posts