30% DE DESCUENTO por tiempo limitadoObtener oferta

¿Qué es FLUX 3? Vídeo e imagen multimodales, gratis online

Escrito por Avery Lin · Publicado el 2026-07-24 flux-3flux3black-forest-labsrelease-watchai-videotext-to-videomultimodal
¿Qué es FLUX 3? Vídeo e imagen multimodales, gratis online

TLDR

FLUX 3 es el modelo fundacional multimodal de Black Forest Labs del 23 de julio de 2026. Posicionamiento oficial: una arquitectura que aprende de forma conjunta a partir de imágenes, vídeo y audio, con una vía de predicción de acción para partners de robótica (blog de BFL; modelos BFL). Los highlights públicos de vídeo incluyen clips de hasta unos 20 segundos, secuencias multi-shot desde un solo prompt y audio nativo (efectos de sonido, ambiente, diálogo) (resumen de The Decoder de materiales BFL; notas de acceso anticipado de Justine Moore / a16z). En FLUX 3 (este sitio), abre el generador de vídeo o el generador de imagen y empieza gratis—sin tarjeta para probar.

Puntos clave

Qué se entregó de verdad

1. Un pitch multimodal unificado—no “vídeo atornillado a la imagen”

Black Forest Labs describe FLUX 3 como un aprendizaje conjunto a partir de imágenes, vídeo y audio dentro de una arquitectura unificada, porque ninguna modalidad sola captura el mundo (blog de BFL; The Decoder). La compañía lo enmarca como avance hacia la inteligencia visual del mundo real—modelos que perciben, predicen y (vía partners) actúan (hilo de anuncio BFL).

Cinematic still vibe for FLUX 3 video realism — showcase on FLUX 3

Lenguaje de still de lo cotidiano a lo cinematográfico · frame showcase en FLUX 3

2. Vídeo: duración, multi-shot, audio nativo

Los materiales públicos y la cobertura de la semana de lanzamiento destacan:

| Capacidad | Afirmación pública | Fuentes principales | | --- | --- | --- | | Duración | Clips de vídeo de hasta unos 20 segundos | The Decoder; CryptoBriefing | | Multi-shot | Varios planos / ángulos desde un solo prompt | Justine Moore (a16z) | | Audio nativo | Sonido alineado con el clip (SFX, ambiente, vías de diálogo) | enfoque de lanzamiento BFL; The Decoder | | Interfaces | Text-to-video, image-to-video y flujos de vídeo relacionados en la narrativa pública | The Decoder; ruta de producto en el generador de vídeo de este sitio |

Las tablas de preferencia tempranas publicadas en la cobertura de lanzamiento (por ejemplo, comparaciones cortas en 720p frente a otros sistemas de vídeo) son señales tempranas reportadas por el proveedor, no certificaciones independientes de la industria del cine (resumen de gráfico de The Decoder). Úsalas como contexto y luego juzga con tus propios prompts.

Text-to-video keyframe style — desert chase energy · showcase on FLUX 3

Lenguaje de movimiento orientado al prompt · keyframe showcase en FLUX 3

3. Ruta de imagen en la misma familia

Los posts oficiales muestran muestras de FLUX 3 Image y describen síntesis/edición entre estilos, ratios de aspecto y resoluciones como parte del stack multimodal (muestras PS del hilo BFL; blog de BFL). En este producto, los stills viven en el generador de imagen con FLUX 3 como default de imagen de la casa.

4. Acción / robótica (contexto, no el CTA principal para creadores)

BFL también anunció el trabajo FLUX-mimic con Mimic Robotics, incluidas narrativas de pruebas industriales con Audi (post de acción BFL en el hilo de lanzamiento; comunicado). Eso importa para la historia del “world model”. Para anuncios sociales, demos de producto y cortos, la superficie práctica sigue siendo la generación de vídeo + imagen.

5. Cronología de la serie (FLUX → FLUX.2 → FLUX 3)

| Generación | Tema público | Ancla | | --- | --- | --- | | Era FLUX.1 | Ola open/imagen que hizo de FLUX un default para creadores | Historia de la serie en BFL / resumen en Wikipedia | | FLUX.2 | Generación y edición de imagen de producción (multi-referencia, mayor fidelidad) | blog FLUX.2, 25 nov. 2025 | | FLUX 3 | Backbone multimodal de vídeo + audio + imagen | blog FLUX 3, 23 de julio de 2026 |

En profundidad: para quién es FLUX 3

Marketers de social y UGC

Clips cortos que sostienen caras, movimiento e iluminación cotidiana—sin contratar un día entero de producción—son los trabajos que habilitan multi-shot + audio nativo. Empieza en text to video.

Equipos de producto y growth

Image-to-video convierte un still de packaging o un frame hero de producto en un primer pase de anuncio en movimiento. Usa un still limpio y luego anima en el mismo workspace de vídeo.

Cineastas de IA y storyboarders

El multi-shot de un solo prompt es el diferenciador del que hablan los creadores en la semana de lanzamiento (venturetwins). Trata las salidas tempranas como primeros pases editables y luego refina prompts plano a plano.

Diseñadores de stills que ya viven en FLUX

Si conoces FLUX por los stills, la historia pública de FLUX 3 es “misma familia, ahora tiempo + sonido”. Mantén los stills en imagen y el motion en vídeo.

Lo que sabemos vs. lo que no sabemos

| Sabemos (con fuente) | No sabemos / no afirmamos | | --- | --- | | Lanzamiento público el 23 de julio de 2026 con posicionamiento multimodal (@bfl_ai; blog de BFL) | Que cada host, resolución o control de duración sea idéntico en todos los productos del mundo | | La narrativa de vídeo incluye ~20 s, multi-shot, audio nativo (The Decoder) | Perfección garantizada al primer take en cada cara, mano y giro de cuerpo completo | | Existen scores de preferencia tempranos en la cobertura de lanzamiento y son preliminares (The Decoder) | Rankings independientes peer-reviewed que coronen un “modelo de vídeo #1” permanente | | FLUX.2 consolidó un capítulo fuerte de imagen (BFL FLUX.2) | Que stills y vídeo compartan siempre la misma huella estética en cada seed | | Este sitio expone generadores en el navegador de vídeo e imagen para flujos FLUX 3 | Tablas de precio dólar-por-segundo entre vendors (no se comparan aquí) |

Por qué importa para builders

  1. Vídeo + audio en una sola generación reduce saltar entre herramientas en primeros pases de anuncios y explainers.
  2. El prompting multi-shot cambia cómo escribes briefs: escribe cortes, no solo vibes (notas multi-shot anticipadas).
  3. La continuidad de marca FLUX ayuda a equipos que ya promptean en lenguaje de stills FLUX a migrar motion sin un modelo mental nuevo.
  4. Las vías de prueba en el navegador ganan a esperar una instalación local perfecta cuando solo necesitas saber si tu plano de producto sobrevive al movimiento.

Cómo evaluar FLUX 3 tú mismo en este sitio

  1. Abre el generador de vídeo FLUX 3.
  2. Pega el Prompt A de abajo (multi-shot).
  3. Míralo una vez a pantalla completa: caras, claridad de cortes, encaje del audio (si hay) y supervivencia del crop en 9:16.
  4. Guarda keepers; opcional: segundo pase con image to video desde un still que ya te guste en imagen.

Prompt A — multi-shot backyard joust

Multi-shot short film, 12 seconds, playful daylight backyard.
Shot 1 wide: two kids jousting with bright pool noodles, green grass, summer sun.
Shot 2 medium: slow motion near-miss as noodles clash, fabric and hair motion clear.
Shot 3 close-up: both kids laughing, natural faces, soft bokeh fence in background.
Natural ambient audio feel, no music bed, no text overlays, no watermark.

Prompt B — product hero spin

Product commercial, 8 seconds, clean studio.
Shot 1: matte black wireless earbuds case on white seamless, soft key light.
Shot 2: lid opens smoothly, earbuds catch a specular highlight.
Shot 3: earbud floats closer to camera, macro detail on mesh.
Subtle whoosh SFX energy, no logos other than the product shape, no watermark.

Prompt C — rainy neon street (mood)

Cinematic street clip, 10 seconds, night rain, neon reflections.
Single continuous push-in toward a woman laughing under a translucent umbrella,
wet asphalt, cyan and magenta signs, handheld micro-motion, natural skin texture.
City ambience and light rain SFX, no dialogue, no on-screen text, no watermark.

Qué vigilar a continuación

FAQ

¿Qué es FLUX 3?

FLUX 3 es el modelo fundacional multimodal de Black Forest Labs del 23 de julio de 2026 para imagen, vídeo, audio y predicción de acción, entrenado de forma conjunta en lugar de como modelos monopropósito separados (blog de BFL; hilo de lanzamiento).

¿FLUX 3 es solo un modelo de vídeo?

No. Los materiales públicos describen vías de vídeo, imagen, audio y acción bajo un diseño multimodal (modelos BFL). En este sitio puedes empezar con vídeo o imagen.

¿Cuánto pueden durar los vídeos de FLUX 3?

La cobertura de lanzamiento cita clips de hasta unos 20 segundos en la narrativa pública de BFL (The Decoder). Confirma siempre el control de duración disponible en la UI del generador para tu run.

¿FLUX 3 soporta multi-shot en un solo prompt?

Sí—es un highlight de creadores en la semana de lanzamiento: varios planos desde un solo prompt (venturetwins). Escribe líneas explícitas Shot 1 / Shot 2 / Shot 3 para mejor control.

¿Qué es el audio nativo en FLUX 3?

Audio nativo significa que el modelo puede producir sonido con el vídeo—ambiente, SFX y demos orientadas al diálogo aparecen en la cobertura pública (The Decoder; lanzamiento BFL).

¿En qué se diferencia FLUX 3 de FLUX.2?

FLUX.2 (nov. 2025) es el capítulo de generación y edición de imagen de producción (BFL FLUX.2). FLUX 3 amplía la familia a un stack multimodal con narrativa de primera clase en vídeo + audio (BFL FLUX 3).

¿Puedo probar FLUX 3 gratis online?

Sí. Abre el generador de vídeo FLUX 3 en flux3.video para empezar gratis—sin tarjeta para comenzar. Stills: generador de imagen.

¿Text to video o image to video—cuál primero?

Usa text to video cuando inventas una escena desde cero. Usa image to video cuando ya tienes una foto de producto o un still de personaje que quieres animar—ambos viven bajo vídeo.

¿Las comparaciones de win-rate publicadas son definitivas?

No. Las tasas de preferencia tempranas en artículos de lanzamiento son señales preliminares reportadas por el proveedor bajo condiciones de test concretas (The Decoder). Ejecuta tus propios prompts para las decisiones que importan.

¿Por dónde empiezo ahora mismo?

Pega el Prompt A en el generador de vídeo, míralo a pantalla completa una vez y luego itera descripciones de planos—no solo adjetivos.

Sobre Avery Lin

Avery Lin es analista de lanzamientos de modelos de IA que sigue los releases de la familia FLUX y convierte hechos públicos del modelo en vías de prueba claras para creadores en FLUX 3.

More Posts