언어 바꾸기English
이전 목록

Black Forest Labs, 이미지·비디오·오디오·로봇 동작 예측을 위한 멀티모달 플로우 모델 'FLUX 3' 공개

Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction

TL;DR AI

핵심 요약

1분
  1. Black Forest Labs가 이미지, 비디오, 오디오, 로봇 액션을 하나의 백본으로 다루는 멀티모달 모델 FLUX 3를 공개했다.

  2. FLUX 3는 Self-Flow 접근을 기반으로 공동 학습됐으며, 시각·청각·예측을 더 일관되게 맞추는 데 초점을 맞췄다.

  3. FLUX 3 Video는 최대 20초 길이의 클립과 네이티브 오디오를 지원하며, 비디오와 액션 기능은 현재 초기 접근 방식으로 제공된다.

  4. 이번 출시로 생성형 미디어와 임바디드 AI 전반에서 활용 범위가 넓어질 가능성이 커졌다.

원문 보기