SANA-Video 2.0: 효율적인 비디오 생성을 위한 Attention Residual이 적용된 하이브리드 선형 어텐션
SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
TL;DR AI
1분핵심 요약
연구진이 효율적인 비디오 생성을 위한 하이브리드 비디오 확산 트랜스포머 SANA-Video 2.0을 공개했다.
5B·14B 모델은 선형 어텐션과 소프트맥스 어텐션, 그리고 어텐션 리저널을 결합해 토큰 상호작용을 강화한다.
처음부터 학습된 이 시스템은 단일 GPU에서 최대 720p 영상을 효율적으로 생성할 수 있다.
이 방식은 소프트맥스의 품질을 상당 부분 유지하면서 선형 어텐션의 확장성을 살리는 것을 목표로 한다.
