JLT: 잠재 확산 트랜스포머의 클린-레이턴트 예측
JLT: Clean-Latent Prediction in Latent Diffusion Transformers
TL;DR AI
1분핵심 요약
연구진은 고정된 FLUX.2 VAE 코드를 학습한 1.3억 파라미터 규모의 latent diffusion Transformer JLT를 공개했다.
동일한 조건에서 clean-latent prediction이 velocity prediction보다 더 나은 기하학적 학습 특성을 보였다.
이 모델은 ImageNet 256x256에서 classifier-free guidance 적용 시 FID-50K 2.50을 포함한 우수한 성능을 기록했다.
이번 연구는 latent diffusion의 학습 타깃이 단순한 재매개변수가 아니라 최적화와 샘플 품질에 직접적인 영향을 준다는 점을 보여준다.
