FLUX 3 Text-to-Video vs Image-to-Video: cuándo partir de un still

Escrito por Reese Okada · Publicado el 2026-08-02 flux-3flux3text-to-videoimage-to-videohow-todecision-guide
FLUX 3 Text-to-Video vs Image-to-Video: cuándo partir de un still

Black Forest Labs posiciona FLUX 3 como un sistema multimodal que puede generar vídeo + audio nativo a partir de texto puro o de referencias de imagen—incluida la animación desde un fotograma de partida (blog de BFL FLUX 3, 23 de julio de 2026; página de modelos de BFL; notas de lanzamiento vía @bfl_ai).

En FLUX 3 (este producto), ambos caminos viven en el mismo generador de vídeo. El error caro no es “elegir el modelo más débil”—es empezar por el camino equivocado para el trabajo: inventar un packaging que debe coincidir con arte legal, o sobre-restringir una escena que solo necesitaba un beat sheet escrito.

Esto es un how-to de decisión: cuándo partir de texto, cuándo bloquear un still primero, y cómo correr un loop de evaluación justo y gratis en flux3.video. Para la gramática multi-shot, usa la guía compañera multi-shot y audio nativo. Para el mapa de lanzamiento, ve ¿Qué es FLUX 3?.

TLDR

Empieza conMejor cuandoOmite cuando
Text to videoEstás inventando el mundo, probando gramática multi-shot o explorando estilosLa marca necesita geometría exacta de logo/packaging
Image to videoYa tienes un still de producto, character board o frame aprobadoNo tienes still ni tiempo para hacer uno—solo escribe texto
Híbrido (still → motion)La identidad o el packaging debe sobrevivir a los cortesSolo necesitas una prueba de mood

Regla por defecto: si el look debe coincidir con un still aprobado, usa image to video. Si la historia y la cámara inventan el look, usa text to video. Ambos corren en FLUX 3 vídeo; crea stills en FLUX 3 imagen cuando haga falta.

Puntos clave

  • Camino dual oficial: el vídeo de FLUX 3 incluye text-to-video e image-to-video (animación desde fotograma de partida o imágenes como referencias visuales), con audio nativo en las salidas (blog de BFL).
  • Techo de ~20 s por generación única es la narrativa pública de duración—no un requisito en cada borrador (resumen de The Decoder sobre materiales de BFL; blog de BFL).
  • Multi-shot desde un solo prompt es una skill de creador de primer nivel en las notas tempranas—numera tus planos en cualquiera de los dos caminos (Justine Moore / a16z).
  • Cambio de prompt en image-to-video: describe motion + cámara + audio, no un segundo outfit ni una forma nueva de producto (BFL: framing de “animación” desde fotograma de partida).
  • Money pages aquí: vídeo para ambos modos; craft opcional de stills en imagen.

Cara a cara: texto vs partida desde still

Lee esta tabla primero—unos 30 segundos para elegir camino.

DimensiónText to videoImage to video
Qué aportasSolo escena escritaStill + prompt de motion
Qué inventa el modeloLook, vestuario, set, iluminaciónMotion, cámara, tiempo, a menudo energía de audio
Mejores trabajosBeats de historia, personas UGC, exploración de estilo, experimentos multi-shotProduct spin, packshots de marca, lock de personaje aprobado, poster-to-motion
Fuerza de continuidadViene de locks en el prompt (líneas de vestuario/ubicación)Viene primero de los píxeles del still
Modo de falloLogo / cara / producto inventa y se desvíaStill demasiado cargado; el prompt redescribe un objeto distinto
Tiempo de prepEl más rápidoNecesita un still limpio (foto o generador de imagen)
Raíz de capacidad públicaLista de vídeo FLUX 3 de BFLEl mismo post: animación desde fotograma de partida + referencias de imagen

Lenguaje de motion text-first — keyframe de planificación en FLUX 3

Lenguaje de motion prompt-first · keyframe showcase en FLUX 3 · still de planificación, no un master calificado

Cuándo gana el text to video puro

Elige text to video cuando el still aún no existe—o cuando inventar el still haría perder el sentido del experimento.

1. Pruebas de historia multi-shot

Te importa la legibilidad de Shot 1 → Shot 2 → Shot 3 más que un packaging a nivel de píxel. El comentario público de early access destaca el control multi-shot desde un solo prompt (venturetwins). Empieza en vídeo con planos numerados (recetas completas en el how-to multi-shot).

2. Invención UGC / persona

Sin foto de talento aprobada. Quieres un creator handheld creíble, no un match de brand kit. Escribe vestuario + habitación + energía de habla en un bloque—luego itera líneas, no stills.

3. Exploración de rango de estilo

BFL enfatiza un rango amplio de estilos—desde energía de camcorder candid hasta animación y cinemática (blog de BFL). El texto es más rápido para “probar tres looks” que bloquear tres masters primero.

4. Pitches de concepto puro

Los stakeholders solo necesitan un motion board de primera pasada. El texto te lleva ahí sin un loop de art direction sobre stills.

Omite el texto puro cuando: legal, marca o ecommerce necesita arte de etiqueta exacto, color de SKU o un personaje ya firmado como frame.

Cuándo gana image to video

Elige image to video cuando el look ya está decidido y el motion es el trabajo que queda.

1. Producto real / packaging

Si la caja, botella o captura de UI ya existe, no la re-alucines. Fija el still y luego prompt solo rotación, manos, luz, SFX. Ver también el pack de prompts de product demo.

2. Lock de identidad de personaje

Frame hero aprobado (o un still que generaste en imagen) → anima con continuidad. El propio framing de BFL incluye continuar desde un fotograma de partida como animación (blog de BFL).

3. Poster / key art a motion

El arte de campaña está fijo; necesitas un push-in social de 6–12 s. Image-to-video mantiene la composición; text-to-video arriesga un keyframe “parecido pero no el mismo”.

4. Después de que el texto ya encontró un still ganador

Ruta híbrida abajo: congela el mejor frame (o regenera un still limpio) y vuelve a correr motion desde ese lock.

Omite image-to-video cuando: el still está saturado, es de baja resolución o tiene varios sujetos en competencia—limpia el still primero.

Lenguaje still-to-cinematic para frames de lock — FLUX 3

Lenguaje de lock still-first · frame showcase en FLUX 3 · still de planificación, no un fotograma de cine calificado

Ruta híbrida: página de imagen → página de vídeo

Este es el loop de producción que la mayoría de equipos de marca realmente necesita:

  1. Crea o refina un still en FLUX 3 imagen (o usa una foto real).
  2. Abre FLUX 3 vídeoimage to video.
  3. Prompt solo motion + cámara + audio + “preserve exact colors/logo/outfit.”
  4. Revisión a pantalla completa una vez; si el logo falla dos veces, deja de inventar—arregla el still, no los adjetivos.

Los materiales públicos también señalan referencias de imagen como anclas visuales (no solo animación desde fotograma de partida) (blog de BFL). Trata el still como el contrato; el texto es la dirección.

Cómo correr ambos caminos en FLUX 3 (loop de evaluación)

  1. Abre FLUX 3 vídeo (el modelo de la casa se mantiene FLUX 3).
  2. Elige camino con la tabla de arriba.
  3. Pega el Prompt A (texto) o el Prompt B (image-to-video) con el sustantivo real de tu producto.
  4. Juzga con el checklist de abajo → quédate con un ganador.
  5. Opcional: pule un still en imagen y luego re-anima.

Apunta primeros borradores a unos 8–12 segundos aunque los materiales públicos hablen de clips de hasta unos 20 segundos (The Decoder; blog de BFL). Los beats más cortos se leen mejor en el teléfono.

Prompt A — text to video multi-shot (copy-paste)

Vertical 9:16 short, about 10 seconds, soft daylight bedroom UGC.
Shot 1 medium: creator in gray hoodie holds a matte white product box to camera, natural smile.
Shot 2 close hands: opens lid smoothly, tissue paper folds read clearly.
Shot 3 product close-up: lifts the item toward lens, subtle specular highlight.
Same hoodie, same box color, continuous bedroom background.
Quiet room tone, soft paper rustle SFX, conversational energy, no music bed, no on-screen text, no watermark.

Prompt B — image to video desde un still bloqueado (copy-paste)

Úsalo después de adjuntar un still limpio de producto o personaje en vídeo.

Image-to-video, about 8 seconds, gentle orbital move then settle.
Preserve the exact product shape, materials, colors, and logo from the reference still.
Keep the same lighting direction and background cleanliness.
Soft studio whoosh on the settle frame, no new text, no watermark, no extra products, no music bed.

Prompt C — craft de still y luego animar (texto híbrido para la página de imagen)

Genera un lock limpio en imagen y luego usa el Prompt B:

Studio packshot, single matte white wireless earbud case centered on seamless light gray, soft top light, sharp logo edges, empty background, product photography, no text overlay, no watermark, high detail materials.

Checklist de pass/fail (sirve para ambos caminos)

Mira una vez sin scrubbing y luego haz scrub:

  1. Encaje del camino — ¿inventaste cuando debías bloquear, o bloqueaste cuando necesitabas libertad?
  2. Identidad / producto — ¿misma cara, vestuario o logo a lo largo del clip?
  3. Manos / bordes — ¿caja que se derrite, dedos de más, etiquetas que se deslizan?
  4. Audio — ¿encaja con los eventos, o pediste silencio? El audio nativo forma parte de la historia multimodal oficial (@bfl_ai; The Decoder).
  5. Crop — ¿sujeto seguro para placements 9:16 tipo Reels/TikTok (mantén centros legibles para ads de feed—ver resumen de Meta ads y TikTok Ads Help)?
  6. Contaminación de texto — ¿glifos aleatorios o watermarks?

Dos fallos → cambia de camino o de still, no solo añadas adjetivos.

Errores comunes

ErrorPor qué dueleArreglo
Text-to-video para packaging legalEl logo se inventaStill real + image-to-video
Prompt de image-to-video reescribe el productoPelea contra el stillSolo motion/cámara/audio
Still cargado (muchos objetos)Falla el latch de motionRecorta a un sujeto hero
Sin shot list en ninguno de los caminosPapilla continuaNumera Shot 1/2/3
Duración máxima en el primer tryBeats ilegiblesEmpieza ~8–12 s
Música + diálogo + SFX a la vezAudio embarradoUna sola línea de prioridad de audio

Ganadores por escenario (si / entonces)

Si…Entonces empieza con…Por qué
Solo tienes una idea de una líneaText to videoLoop más rápido
La marca envió un packshot PNGImage to videoLa geometría ya es la verdad
El personaje solo se ve bien en un stillHíbridoCongela el look, varía la cámara
Prueba de diálogo multi-shotText to video primeroGramática antes de locks
El logo falló dos veces en textoPara → still + i2vNo quemes más runs de invención
Exploras estilo camcorder vs animaciónText to videoEl estilo es el experimento (rango de estilo BFL)

Lo que sabemos vs. lo que no

Sabemos (con fuente)No sabemos / no afirmamos
Lanzamiento público de FLUX 3 el 23 de julio de 2026 con framing multimodal de vídeo + audio (@bfl_ai; blog de BFL; resumen wire)Que cada host exponga controles o duraciones idénticos de fotograma de partida
La lista oficial de vídeo incluye text-to-video e image-to-video (fotograma de partida o referencias de imagen) (blog de BFL)Perfección de logo garantizada en el primer take para cada SKU
Clips de hasta unos 20 segundos con audio nativo aparecen en materiales públicos (blog de BFL; The Decoder)Que más largo sea siempre mejor para ads sociales
El encadenado multi-shot aparece en notas tempranas de creadores (venturetwins)Certificaciones independientes de la industria que rankeen un camino permanentemente “mejor”

FAQ

¿Cuál es la diferencia entre FLUX 3 text-to-video e image-to-video?

Text-to-video construye el clip solo a partir de un prompt escrito. Image-to-video se condiciona a un still—ya sea como fotograma de partida a animar o como referencia visual—y luego sigue tus direcciones de motion y audio (blog de BFL).

¿Qué camino debo usar primero en flux3.video?

Si no tienes un still aprobado, empieza con text to video. Si el look de marca ya está fijado, empieza con image to video en el mismo generador de vídeo.

¿Puedo usar ambos en un mismo proyecto?

Sí. Muchos equipos descubren con texto, bloquean un still en imagen o desde una foto y luego terminan con image-to-video.

¿Image-to-video incluye audio?

La lista pública de capacidades de vídeo de FLUX 3 incluye generación de audio nativo en las salidas, también en caminos condicionados por imagen dentro del mismo set de capacidades (blog de BFL; The Decoder). Aun así escucha cada take.

¿Qué duración debe tener mi primer clip?

La narrativa pública de techo es de unos 20 segundos (blog de BFL). Para decidir, empieza con 8–12 segundos para que la calidad del camino sea obvia.

¿Por qué se rompe el logo de mi producto en text-to-video?

El modelo está inventando píxeles. Cambia a un still real + image to video y prohíbe texto nuevo en el prompt.

¿Por qué image-to-video ignora mi still?

Suele ser que el still está saturado o el prompt redescribe un producto distinto. Recorta a un sujeto; escribe solo motion + cámara + audio.

¿Necesito el generador de imagen?

Solo para locks híbridos. Texto puro y foto→vídeo puro pueden omitirlo. Los stills viven en imagen cuando los necesitas.

¿Dónde encajan los prompts multi-shot?

En cualquiera de los dos caminos. Numera los planos de forma explícita—ver multi-shot y audio nativo.

¿Es lo mismo que un artículo de ranking frente a modelos pares?

No. Esta página es selección de camino dentro de FLUX 3. Para criterios frente a otros sistemas, lee FLUX 3 vs modelos de vídeo IA pares.

¿Dónde lo pruebo gratis?

Abre FLUX 3 vídeo en flux3.video y empieza gratis—no hace falta tarjeta para comenzar.

Sobre Reese Okada

Reese Okada escribe sobre flujos de trabajo de vídeo con IA y convierte prompts multi-shot en workflows repetibles en el navegador sobre FLUX 3. Esta guía se centra en elegir texto vs still-first para que los runs gratis vayan al camino que encaja con el trabajo.

More Posts