언어 바꾸기English
이전 목록

하나의 모델, 세 가지 모달리티: ByteDance, 이미지·비디오 이해·생성·편집용 Lance 공개

One Model, Three Modalities: ByteDance Releases Lance for Image and Video Understanding, Generation, and Editing

TL;DR AI

핵심 요약

1분
  1. 바이트댄스 연구진이 이미지·비디오 이해, 텍스트 생성, 시각 생성/편집을 하나로 묶은 단일 멀티모달 모델 Lance를 공개했다.

  2. Lance는 공유 멀티모달 컨텍스트와 이해·생성 분리 경로를 사용하며, 새로운 모달리티 인식 위치 인코딩 MaPE를 적용했다.

  3. 이 모델은 텍스트-이미지, 텍스트-비디오, 이미지 편집, 비디오 편집까지 아우르는 전체 이미지-비디오 파이프라인을 목표로 한다.

  4. 적용 범위가 넓어지면서 멀티모달 AI 시스템을 단순화하고 이해와 생성 간 일관성을 높일 수 있다.

원문 보기