30% DE DESCUENTO por tiempo limitadoObtener oferta

FLUX 3 Video: multi-shot, clips ~20 s y audio nativo

Escrito por Reese Okada · Publicado el 2026-07-24 flux-3flux3multi-shottext-to-videoimage-to-videonative-audiohow-to
FLUX 3 Video: multi-shot, clips ~20 s y audio nativo

TLDR

  1. Abre FLUX 3 vídeo.
  2. Escribe Shot 1 / Shot 2 / Shot 3 (quién, cámara, acción) en lugar de una vibe vaga.
  3. Limita la ambición: en primeros borradores, apunta a claridad de ~8–12 s antes de maximizar la duración.
  4. Añade intención de audio (ambiente / SFX / sin música) en una línea.
  5. Revisión a pantalla completa: caras, lógica de cortes, manos, movimiento de labios si hay habla, crop para Reels.
  6. Opcional: fija un hero still en imagen y luego image to video.

Puntos clave

  • Multi-shot es una skill de primer nivel: creadores con acceso anticipado destacan varios ángulos en una generación (venturetwins).
  • ~20 s es el techo narrativo público—no un requisito en cada take (The Decoder).
  • Audio nativo significa que puedes especificar ambiente/SFX/energía de diálogo en lugar de post-sincronizar siempre después (lanzamiento BFL; The Decoder).
  • La estructura del prompt gana a los adjetivos: numera los planos, nombra la cámara, fija la continuidad de vestuario.
  • Try here: todo lo de abajo corre en el generador de vídeo (text-to-video e image-to-video).

Antes de empezar (checklist de 60 segundos)

| Control | Por qué | | --- | --- | | Tienes un trabajo real (anuncio UGC, product spin, beat de diálogo) | Los prompts “epic” al azar desperdician runs gratis | | Puedes listar 2–4 planos en papel | Los modelos multi-shot premian cortes explícitos | | Vestuario / sujeto es una línea clara | La deriva de identidad suele empezar con personajes vagos | | Sabes el aspect ratio (9:16, 16:9, 1:1) | Los crops sociales matan buenos centros | | Revisarás a pantalla completa una vez | Las miniaturas mienten sobre caras y manos |

Paso 1 — Abrir el generador de vídeo FLUX 3

Ve a FLUX 3 vídeo. Mantén FLUX 3 seleccionado como modelo de vídeo de la casa. Quédate en esta página para text to video e image to video—no necesitas un segundo producto para el loop básico.

¿Necesitas stills primero? Genera o refina un frame hero en FLUX 3 imagen, descárgalo/guárdalo y luego anima en vídeo.

Paso 2 — Escribir prompts multi-shot (la skill central)

Usa este esqueleto cada vez:

  1. Línea de formato — intención de duración, aspect, género.
  2. Lista de planos — Shot 1 wide / Shot 2 medium / Shot 3 close (verbos de acción).
  3. Línea de continuidad — mismas personas, misma ropa, misma ubicación.
  4. Línea de audio — ambiente, SFX, diálogo o silencio.
  5. Negativos — no watermark, no extra logos, no random text.

Prompt 1 — multi-shot product unbox (copy-paste)

Vertical 9:16 product ad, about 10 seconds, clean desk daylight.
Shot 1 wide: sealed matte white product box on oak table, soft window light.
Shot 2 medium: hands open the box lid smoothly, tissue paper folds clearly.
Shot 3 close-up: wireless earbuds lift toward camera, subtle specular highlight.
Same hands, same box branding color, continuous desk environment.
Soft paper rustle and light whoosh SFX, no music bed, no on-screen text, no watermark.

Prompt 2 — multi-shot dialogue beat

Horizontal short scene, about 12 seconds, warm kitchen night.
Shot 1 medium two-shot: two friends at a small table, tea cups, fairy lights bokeh.
Shot 2 over-shoulder: person A speaks with natural lip motion, soft smile.
Shot 3 reaction close-up: person B laughs, eyes crinkle, steam rises from cup.
Same wardrobe and hairstyles across all shots, consistent table props.
Quiet room tone plus light cup clink SFX; dialogue energy, no loud score, no subtitles, no watermark.

Prompt 3 — multi-shot outdoor action (simple)

Horizontal action clip, about 8 seconds, golden hour park path.
Shot 1 wide tracking: runner in red jacket jogs toward camera on gravel path.
Shot 2 side medium: arms and jacket fabric motion, trees streak softly.
Shot 3 low angle hero: runner passes, dust motes in sunbeams.
Same red jacket and black shorts throughout.
Footsteps and light wind ambience, no music, no text, no watermark.

Text-to-video style keyframe — motion-first storytelling · showcase on FLUX 3

Lenguaje de movimiento orientado al prompt · keyframe showcase en FLUX 3 · still de estilo generado para planificar, no un fotograma de cine etalonado

Paso 3 — Añadir audio nativo a propósito

La historia pública de FLUX 3 incluye audio nativo con el vídeo (BFL; The Decoder). Trata el audio como una línea de dirección, no como un afterthought:

| Intención | Línea de ejemplo | | --- | --- | | Solo ambiente | “city night ambience and light rain, no music, no dialogue” | | Hit de SFX | “soft whoosh on logo settle, no voiceover” | | Energía de diálogo | “natural conversational speech, quiet room tone, no score” | | Silencio | “no music, no SFX, no dialogue—picture only” |

Tip de lipsync: pon la cara que habla en un plano close o medium y di “natural lip motion” de forma explícita (Prompt 2). Los planos extremos de cuerpo completo hacen más difícil juzgar el detalle de la boca.

Paso 4 — Text to video vs image to video

| Empezar desde | Usar cuando | Ruta | | --- | --- | --- | | Text to video | Inventas toda la escena | Generador de vídeo | | Image to video | Ya tienes una foto de producto, frame de personaje o póster | Misma página de vídeo; still opcional desde imagen |

Receta image-to-video: mantén el still simple (un sujeto, bordes claros) y promptea solo movimiento + cámara + audio—no redescribas un outfit distinto.

Image-to-video, 6 seconds, gentle push-in.
Preserve the exact product, colors, and logo from the reference still.
Soft studio light consistency, subtle rotation of the product, clean background.
Soft whoosh SFX, no new text, no watermark.

Paso 5 — Checklist pass/fail (pantalla completa)

Mira una vez sin scrub y luego revisa:

  1. Lógica de cortes — ¿Shot 1→2→3 se lee como intencional?
  2. Identidad — ¿misma cara, pelo, vestuario entre cortes?
  3. Manos / props — ¿dedos de más, cajas que se derriten, labels que se deslizan?
  4. Encaje del audio — ¿el sonido coincide con los eventos (o pediste silencio)?
  5. Crop — ¿caras y producto seguros en 9:16?
  6. Contaminación de texto — ¿glifos aleatorios o watermarks?

Si fallan dos de estos, reescribe la lista de planos antes de quemar más runs. Suele arreglarse con planos más cortos y claros, no con más adjetivos.

Modos de fallo comunes (y fixes)

| Síntoma | Causa probable | Fix | | --- | --- | --- | | Un solo plano largo continuo | Sin planos numerados | Añade Shot 1/2/3 explícitos | | El personaje muta entre cortes | Vestuario vago | Una frase que fije ropa/pelo | | Audio saturado | Música + diálogo + SFX en conflicto | Elige una prioridad de audio | | Gran cara, mal logo de producto | Demasiado caos de cámara | Push-in lento; menos cortes | | Buen 16:9, 9:16 roto | Sin aspect en el prompt | Indica vertical 9:16 + sujeto centrado |

Cómo correr un loop de evaluación en 3 pasos en FLUX 3

  1. Abre FLUX 3 vídeo.
  2. Pega el Prompt 1 (o tu brief real usando el esqueleto).
  3. Juzga con la lista pass/fail → guarda el keeper → polish opcional image-to-video desde un still en imagen.

FAQ

¿Qué hace diferente el prompting de FLUX 3 vídeo?

Las notas públicas de creadores destacan el control multi-shot desde un solo prompt y un microdetalle más fuerte (venturetwins; lanzamiento BFL). Escribe cortes, no solo moods.

¿Cuánto debería durar mi primer clip de FLUX 3?

Los materiales públicos hablan de generaciones de hasta unos 20 segundos (The Decoder). Para aprender multi-shot, empieza alrededor de 8–12 segundos para que cada beat se lea bien.

¿Cuántos planos debo pedir?

Dos a cuatro en primeros borradores. Más planos aumentan el riesgo de continuidad antes de tener una línea de personaje estable.

¿Puede FLUX 3 hacer audio nativo y lipsync?

El audio nativo forma parte de la historia multimodal oficial (BFL; The Decoder). Las demos de la comunidad también destacan el movimiento de labios—siempre escucha y haz zoom en tus propios takes.

¿Debo usar text to video o image to video?

Text to video para escenas inventadas; image to video cuando ya existen stills de marca. Ambos están en el generador de vídeo.

¿Necesito la página de imagen?

Solo si quieres un still controlado primero. Genera en imagen y luego anima en vídeo.

¿Por qué mi multi-shot se colapsa en un take continuo?

Tu prompt probablemente carece de planos numerados y tamaños de cámara. Usa el esqueleto del Paso 2.

¿Puedo prohibir la música?

Sí—di “no music bed” o “picture only, no SFX” en la línea de audio.

¿Dónde lo pruebo gratis?

Abre FLUX 3 vídeo en flux3.video y empieza gratis—sin tarjeta para comenzar.

¿Qué debo leer después?

El overview del lanzamiento: ¿Qué es FLUX 3?.

Sobre Reese Okada

Reese Okada es escritor/a de workflows de vídeo con IA que convierte prompts multi-shot en flujos de navegador repetibles en FLUX 3.

More Posts