언어 바꾸기English
이전 목록

SANA-Video 2.0: 효율적인 비디오 생성을 위한 Attention Residual이 적용된 하이브리드 선형 어텐션

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

TL;DR AI

핵심 요약

1분
  1. 연구진이 효율적인 비디오 생성을 위한 하이브리드 비디오 확산 트랜스포머 SANA-Video 2.0을 공개했다.

  2. 5B·14B 모델은 선형 어텐션과 소프트맥스 어텐션, 그리고 어텐션 리저널을 결합해 토큰 상호작용을 강화한다.

  3. 처음부터 학습된 이 시스템은 단일 GPU에서 최대 720p 영상을 효율적으로 생성할 수 있다.

  4. 이 방식은 소프트맥스의 품질을 상당 부분 유지하면서 선형 어텐션의 확장성을 살리는 것을 목표로 한다.

원문 보기