Black Forest Labs, 이미지·비디오·오디오·로봇 동작 예측을 위한 멀티모달 플로우 모델 'FLUX 3' 공개
Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction

TL;DR AI
1분핵심 요약
Black Forest Labs가 이미지, 비디오, 오디오, 로봇 액션을 하나의 백본으로 다루는 멀티모달 모델 FLUX 3를 공개했다.
FLUX 3는 Self-Flow 접근을 기반으로 공동 학습됐으며, 시각·청각·예측을 더 일관되게 맞추는 데 초점을 맞췄다.
FLUX 3 Video는 최대 20초 길이의 클립과 네이티브 오디오를 지원하며, 비디오와 액션 기능은 현재 초기 접근 방식으로 제공된다.
이번 출시로 생성형 미디어와 임바디드 AI 전반에서 활용 범위가 넓어질 가능성이 커졌다.
