RiT: 표현 공간에서는 바닐라 확산 트랜스포머로 충분하다
RiT: Vanilla Diffusion Transformers Suffice in Representation Space
TL;DR AI
1분핵심 요약
RiT-XL 체크포인트, 가중치, 평가 코드가 공개되며 ImageNet 256×256 생성용 모델을 사용할 수 있게 됐다.
이 모델은 고정된 DINOv2-Small 특징을 활용하고, 추가 증류 없이 표준 샘플링으로 동작한다.
FID 성능은 CFG=1에서 1.45, CFG≈3.7과 Heun 25 step에서 1.14를 기록했다.
여러 기존 diffusion transformer 변형보다 좋은 결과로, frozen encoder만으로도 기본형 diffusion transformer가 매우 강력할 수 있음을 보여준다.
