TLDR
- FLUX 3(2026년 7월 23일): 멀티모달 백본; 공개 비디오 스토리 = 멀티샷 + 약 20초 + 네이티브 오디오(BFL 블로그; The Decoder).
- 동세대는 클론이 아니다: Runway Gen-4.5는 모션 품질 / 프롬프트 준수(Runway research); Kling VIDEO 3.0은 제품 문서에서 멀티샷 + 네이티브 오디오(Kling VIDEO 3.0 guide); Sora 2는 물리 + 멀티샷 + 동기화 사운드(OpenAI); Veo 3.1은 비디오와 네이티브 오디오(DeepMind Veo); Luma Ray3.x는 연출 가능한 연속성 / modify(Luma Ray); Grok Imagine Video는 image-to-video + 오디오 + 속도(xAI); Seedance 2.0은 풍부한 레퍼런스의 멀티모달 오디오-비디오(ByteDance Seed).
- 결정 규칙: 단일 Elo나 벤더 선호도 표가 아니라 작업 축(스토리보드 컷, 립싱크 대사, 제품 스틸→모션, 물리 개그, 긴 제어 루프)으로 고른다.
- 이 사이트: 같은 프롬프트를 FLUX 3 비디오(스틸은 이미지)에서 돌리고 키퍼를 직접 채점한다.
핵심 요약
- 멀티샷은 2026년 1급 축—FLUX 3 초기 노트는 한 프롬프트에서 다각도 시퀀스를 강조(Justine Moore / a16z); Kling은 멀티샷 내러티브를 문서화(VIDEO 3.0 guide); Sora 2는 월드 상태 지속을 포함한 멀티샷 지시 따르기를 주장(OpenAI).
- 네이티브 오디오는 이제 보너스가 아니라 테이블스테이크 언어: FLUX 3(The Decoder), Sora 2(OpenAI), Veo(DeepMind), Kling(VIDEO 3.0), Grok Imagine Video(xAI), Seedance 2.0(Seed).
- 벤더 선호도 차트는 초기 시그널이지 동료 심사 왕관이 아님—BFL 관련 런치 보도에는 다른 시스템 대비 예비 선호도형 수치가 포함됨; 맥락으로만 취급(The Decoder chart summary).
- 제어 표면이 다르다: 어떤 스택은 순수 생성 품질을, 어떤 스택은 키프레임 modify·멀티 레퍼런스·앱 생태계를 판다(예: Luma Ray3 Modify; Runway Gen-4.5 positioning).
- FLUX 브랜드 연속성은 스틸 언어가 이미 FLUX에 있을 때 중요—스틸은 이미지, 모션은 비디오(시리즈 맥락: BFL FLUX.2 → FLUX 3).
- 한 브라우저 표면에서의 동일 프롬프트 평가는 광고·단편 출고에 추상 랭킹보다 낫다—FLUX 3 비디오 에서 무료 시작.
헤드투헤드: 공개 축(랭킹 아님)
이 표는 30초 안에 읽습니다. 셀은 공개 포지셔닝 / 문서화된 기능이지 독립 랩 점수가 아닙니다. 비어 있거나 「제품에서 확인」은 링크한 1차 자료에서 헤드라인 주장을 찾지 못했다는 뜻—아무것도 못 한다는 뜻이 아닙니다.
| 축(내 작업) | FLUX 3 (BFL) | Runway Gen-4.5 | Kling VIDEO 3.0 | OpenAI Sora 2 | Google Veo 3.x | Luma Ray3.x | Grok Imagine Video | Seedance 2.0 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | | 주요 공개 피치 | 멀티모달 시각 지능; 비디오 + 오디오 + 이미지 패밀리(BFL) | 모션 품질, 프롬프트 준수, 시각 충실도(Runway) | 멀티샷 내러티브 + 네이티브 오디오 + 일관성(Kling) | 물리적으로 정확한 비디오 + 동기 대사/SFX(OpenAI) | 네이티브 오디오가 있는 선도 비디오 생성(DeepMind Veo) | 연출 가능·연속·시네마틱 제어(Luma Ray) | 네이티브 오디오가 있는 빠른 이미지/비디오(xAI) | 멀티모달 오디오-비디오 공동 생성 + 풍부한 레퍼런스(Seed) | | 멀티샷 / 멀티컷 | 강한 런치 내러티브(venturetwins; The Decoder) | 제어·구성 강조; 유일한 「멀티샷 제품 스토리」는 아님(Runway) | 문서화된 멀티샷 생성(Kling) | 멀티샷 지시 + 월드 상태(OpenAI) | 시네마틱 언어/제어; Studio에서는 제품 길이가 짧은 클립인 경우가 많음(AI Studio Veo) | 모든 컷/프레임 방향 마무리(Luma Ray) | 스틸·프롬프트 기반 모션; 멀티컷이 핵심 브랜드 라인은 아님(xAI) | Seedance 라인의 멀티샷 유산 + 2.0 멀티모달 제어(Seedance 1.0; 2.0) | | 네이티브 / 동기 오디오 | 공개 주장(BFL; The Decoder) | Gen-4.5 연구 포스트에서는 시각 우선 생성 포커스가 많음(Runway) | VIDEO 3.0의 네이티브 오디오 업그레이드(Kling) | 대사 + SFX + 사운드스케이프(OpenAI) | 비디오가 오디오를 만남(DeepMind) | 제품 페이지 FAQ에 오디오 질문 표면(Luma Ray) | 네이티브 오디오·스피치 개선(xAI) | 공동 오디오-비디오 아키텍처(Seed) | | 물리 / 소재 리얼리즘 | 일상의 「더 실물 같은」 멀티모달 프레이밍(BFL; wire) | 무게·액체·머리카락·소재를 언급(Runway; CNBC) | 제품 카피의 일관성 + 내러티브 다듬기(Kling) | 이전 Sora 대비 명시적 물리 도약(OpenAI) | 고충실 스토리텔링 피치(DeepMind) | modify 워크플로의 물리 로직(Luma news) | 1.5의 더 나은 모션·물리(xAI) | 모션 안정성 + 몰입 AV(Seed) | | 스틸 → 모션 / 레퍼런스 | 패밀리 내 이미지 경로 + 이 사이트의 브라우저 i2v(BFL; 비디오 툴) | 생성 + 편집 모드의 강한 생태계(Runway) | 3.0 매트릭스의 시작 프레임 + 요소 레퍼런스(Kling guide) | 텍스트 및/또는 이미지(생태계 문서의 remix 경로)(OpenAI) | 최근 Veo 카드의 텍스트·이미지·비디오 입력(AI Studio) | 키프레임 / 캐릭터 레퍼런스 modify(Luma) | image-to-video가 플래그십 경로(xAI) | 텍스트·이미지·오디오·비디오 입력(Seed) | | 길이 공개 내러티브 | 최대 약 20s가 자주 인용(The Decoder) | HD 클립 생성; 플랜의 제품 한도 확인(Runway) | 샷별 제품 멀티샷 길이(Kling guide) | 제어 가능한 멀티샷 시퀀스; 제품 길이는 표면에 따라 다름(OpenAI) | Studio 카드는 짧은 고정 길이(예: 4/6/8s 대역)(AI Studio) | 워크플로 지향 길이; 제품 FAQ에서 확인(Luma) | API 예시의 짧은 클립 대역(예: 최대 10s 샘플)(xAI API) | 시네마틱 멀티샷 출력; 제품 티어는 다양(Seed) | | 이 제품의 체험 경로 | FLUX 3 비디오 + 이미지 | N/A(다른 벤더) | N/A | N/A | N/A | N/A | N/A | N/A |
표 사용법: 브리프가 「세 컷, 한 캐릭터, 방 앰비언스」면 멀티샷 + 오디오 열에 가중. 「액체 붓기, 무게감 있는 제품」이면 물리. 「이 정확한 패키징 스틸이 움직여야」면 스틸→모션 / 레퍼런스.

왕관이 아니라 기준 · 이 비교의 에디토리얼 커버 프레임 · FLUX 3에서 생성
패밀리 맥락(먼저 FLUX만—그다음 동세대)
| 세대 | 공개 테마 | 앵커 | | --- | --- | --- | | FLUX.2 | 프로덕션 스틸 & 편집 | BFL FLUX.2 블로그 | | FLUX 3 | 멀티모달 비디오 + 오디오 + 이미지 백본 | BFL FLUX 3 블로그 | | 동세대 클래스(2025–2026) | 경쟁하는 제어 스토리를 가진 전문 비디오 시스템 | Runway Gen-4.5 · Kling VIDEO 3.0 · Sora 2 · Veo 3.x · Luma Ray3.x · Grok Imagine Video · Seedance 2.0(링크는 위 표) |
동세대는 FLUX 패밀리 구성원이 아닙니다. 모두 텍스트 프롬프트를 받는다고 미학·안전 필터·길이 노브가 같다고 가정하지 마세요.
시나리오 승자(if / then)
1. 두 컷과 방 톤이 있는 소셜 UGC 광고
만약 한 생성에서 wide → close 스토리가 필요하고 앰비언스가 장면에 붙어 있는 느낌이 중요하면, 그때 공개 자료가 멀티샷 + 네이티브 오디오를 강조하는 모델을 우선합니다(FLUX 3 런치 내러티브; Kling VIDEO 3.0 문서; Sora 2 오디오+멀티샷 주장).
이 사이트: 다른 스택을 쇼핑하기 전에 비디오 에서 Shot 1 / Shot 2를 한 문단으로 초안.
2. 잠긴 스틸에서 제품 히어로
만약 패키징·로고 크롭·소재 마감이 이미 스틸로 승인됐다면, 그때 image-to-video(또는 스틸 우선) 워크플로로 시작—Grok Imagine Video의 공개 스토리는 i2v에 강함(xAI); Seedance 2.0과 Kling 3.0은 레퍼런스/시작 프레임 경로를 문서화; FLUX 3 패밀리에는 먼저 잠글 수 있는 이미지 표면이 있음(BFL).
이 사이트: 이미지 에서 스틸을 고정한 뒤 비디오 에서 애니메이트.
3. 물리 개그 또는 소재 데모
만약 농담이나 증명이 무게·액체·천·충돌이라면, 그때 물리 정확도를 마케팅하는 시스템에 가중(Sora 2; Runway Gen-4.5 연구 언어). 그래도 자신의 정확한 오브젝트로 검증—마케팅 데모는 내 SKU가 아님.
이 사이트: 아래 Prompt C를 쓰고 손·엣지·접점을 전체 화면 검토.
4. 대사 / 립싱크 설명
만약 캐릭터가 카메라 앞에서 말해야 한다면, 그때 공식 스토리에 네이티브 오디오 + 스피치가 있는 스택을 선호(Sora 2; Kling 네이티브 오디오; FLUX 3 대사/SFX 내러티브; Grok Imagine 스피치 개선). 재시도를 예상; 립싱크는 합격/불합격 체크리스트이지 첫 테이크 보장이 아님.
이 사이트: Prompt B + 헤드폰으로 한 번 듣기.
5. 긴 제어 루프(modify, 연장, 보드)
만약 팀이 반복 키프레임·modify-video·멀티 에셋 보드에서 산다면, 그때 제어 중심 제품 스토리(Luma Ray3 Modify; Seedance 멀티모달 레퍼런스; Google Veo 제어 표면)를 1차 생성기에 더해 봅니다.
이 사이트: 1차 생성이 CTA—비디오 에서 키퍼 클립을 얻은 뒤 승자를 편집 스택으로.
아는 것 vs 모르는 것
| 아는 것(출처 있음) | 모르거나 주장하지 않는 것 | | --- | --- | | FLUX 3 공개 런치 2026년 7월 23일, 멀티모달 포지셔닝(@bfl_ai; BFL 블로그) | 모든 작업·스타일을 아우르는 영구 글로벌 #1 비디오 모델 | | 멀티샷 + 약 20s + 네이티브 오디오가 FLUX 3 런치 보도에 등장(The Decoder; venturetwins) | 모든 호스트가 동일한 길이/해상도 토글을 제공한다는 것 | | 동세대 벤더는 서로 다른 헤드라인을 냄(물리, 멀티샷 제품 매트릭스, modify 워크플로, 멀티모달 레퍼런스)—표 링크 참조 | 모든 축을 정리하는 독립·동료 심사 교차 랩 리더보드 | | 런치 보도의 초기 선호도형 수치는 예비 / 벤더 맥락(The Decoder) | 채널 간 초당 달러 가격 표(여기서 비교하지 않음) | | 이 제품은 브라우저 FLUX 3 비디오 와 이미지 를 노출 | 한 번의 무료 런이 모든 브랜드 안전 기준의 프로덕션 준비성을 증명한다는 것 |
FLUX 3에서 평가하는 방법(동일 프롬프트 프로토콜)
- FLUX 3 비디오 를 엽니다.
- 아래 Prompt A, B, C를 그대로 실행합니다(정말 필요한 제품명/의 연속 줄만 바꿔도 됨).
- 각 테이크를 다섯 차원으로 채점(각 0–2): 컷 명료성, 피사체 정체성, 모션 리얼리즘, 오디오 적합, 크롭 생존(9:16).
- 합계 ≥7/10인 클립을 후보로 유지; 실패한 샷 줄만 다시 씀.
- 선택: 이미지 에서 스틸을 잠근 뒤 같은 브리프를 image-to-video.
Prompt A — 멀티샷 소셜 UGC
Vertical 9:16 UGC ad, about 10 seconds, daylight kitchen.
Shot 1 wide: young adult in a blue hoodie pours iced coffee into a clear glass, casual phone-tripod energy.
Shot 2 medium: glass fills, ice clinks, condensation visible, same hoodie and kitchen tiles.
Shot 3 close-up: satisfied sip, natural smile, soft window light, no logos.
Natural kitchen ambience and ice clink SFX, no music bed, no captions, no watermark.
Prompt B — 대사 설명 비트
Horizontal 16:9 product explainer, about 8 seconds, clean home office.
Medium shot: friendly presenter in a charcoal sweater speaks to camera,
holds a small white wireless earbud case, clear enunciation, natural hand gestures.
Background: blurred bookshelf, soft daylight.
Native dialogue energy: short line about "all-day battery," ambient room tone only, no music, no on-screen text, no watermark.
Prompt C — 제품 물리 / 소재
Product commercial, 8 seconds, studio softbox, 16:9.
Macro to medium: matte black aluminum water bottle on slate table.
Slow push-in as a bead of water rolls down the side, realistic weight and reflection,
then a hand lifts the bottle smoothly—fingers and metal contact stay solid.
Subtle studio ambience only, no music, no logos beyond the bottle, no watermark.

Prompt-first 모션 언어 · FLUX 3 쇼케이스 키프레임 · 위 Prompt A–C와 함께 사용

일상에서 시네마틱까지 스틸 언어 · FLUX 3 쇼케이스 스타일 프레임 · Prompt C와 페어
결정 규칙(한 문장)
다음일 때 FLUX 3를 먼저 선택: FLUX 멀티모달 패밀리 안에서 브라우저 네이티브 멀티샷 + 오디오 체험 경로가 필요하고 실제 프롬프트로 키퍼를 직접 판단할 때—벤더 차트나 소셜 스레드가 영구 승자를 왕관으로 씌울 때가 아님.
다음일 때 다른 동세대 스택의 제어 표면으로: 병목이 modify-video, 멀티 에셋 레퍼런스 보드, 또는 해당 벤더가 핵심 제품으로 문서화한 전문 앱 워크플로일 때—단, 위 축에서 자신의 프롬프트가 이미 실패함을 안 뒤에.
FAQ
FLUX 3가 Sora, Runway, Kling보다 「더 나은가」?
보편 순위로 보면 아닙니다. 공개 자료는 겹치지만 다른 강점을 보여 줍니다(표 참조). 더 나음 = 동일 프롬프트 테스트 후 내 작업 축에 맞음—단일 Elo나 초기 선호도 차트가 아님(The Decoder context).
AI 비디오 모델을 비교하는 가장 공정한 방법은?
프롬프트·화면비·검토 체크리스트를 고정하고 모델/호스트만 바꾼 뒤 컷·정체성·물리·오디오·크롭을 채점합니다. 그것이 위 프로토콜이며 FLUX 3 비디오 에서 실행합니다.
FLUX 3는 한 프롬프트에서 멀티샷을 하나?
런치 주 크리에이터·보도 노트는 멀티샷을 헤드라인 능력으로 취급합니다(venturetwins; The Decoder). Shot 1 / Shot 2 / Shot 3를 명시적으로 쓰세요—FLUX 3 비디오: 멀티샷, 약 20초 클립 & 네이티브 오디오 참고.
동세대 모델도 네이티브 오디오를 주장하나?
예—예시는 Sora 2(OpenAI), Veo(DeepMind), Kling VIDEO 3.0(guide), Grok Imagine Video(xAI), Seedance 2.0(Seed). 오디오 품질은 매번 듣기 패스가 필요합니다.
순수 텍스트 대신 언제 스틸에서 시작해야 하나?
브랜드 패키징, 얼굴 유사도, 레이아웃이 이미 승인됐을 때. 스틸 생성/다듬기는 FLUX 3 이미지, 애니메이트는 비디오.
FLUX 3 클립은 얼마나 길 수 있나?
공개 보도는 종종 약 20초를 내러티브 상한으로 인용합니다(The Decoder). 초안에서는 많은 크리에이터가 길이를 최대화하기 전 약 8–12초를 목표로 하면 더 명료한 결과를 얻습니다.
Artificial Analysis / Elo / 벤더 선호도 차트를 믿어야 하나?
맥락으로는 예; 구매 복음으로는 아니오. Gen-4.5 공개 연구는 리더보드 Elo를 인용(Runway); FLUX 런치 보도에는 예비 선호도형 수치가 포함(The Decoder). 키퍼를 결정하는 것은 여전히 내 SKU와 크롭입니다.
이 사이트는 Black Forest Labs 공식인가?
아니요. flux3.video는 FLUX 3 브랜드 브라우저 생성을 제공하는 독립 제품입니다. 공식 모델 연구는 bfl.ai와 BFL 채널에 있습니다.
로컬 도구 설치 없이 FLUX 3를 써 볼 수 있나?
예—브라우저에서 FLUX 3 비디오 또는 이미지 를 엽니다.
손이나 얼굴이 체크리스트에 실패하면?
더 타이트한 medium/close 샷과 고정된 의상 언어로 한 번 재생성; 형용사를 더 쌓지 마세요. 정체성이 여전히 흐트러지면 먼저 스틸을 잠근 뒤 image-to-video.
멀티샷 프롬프트 형식은 어디서 배우나?
FLUX 3 비디오: 멀티샷, 약 20초 클립 & 네이티브 오디오를 읽고 위 Prompt A를 생성기에 붙여 넣으세요.
Avery Lin 소개
Avery Lin은 FLUX Model Release Analyst입니다. Avery는 FLUX 패밀리 런치를 추적하고 공개 모델 사실을 FLUX 3의 명확한 체험 경로로—기준이 먼저, 과장이 나중—옮깁니다.
