주제 중심 생성을 위해 멀티모달 대규모 언어 모델의 용량을 끌어내기
Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
TL;DR AI
1분핵심 요약
연구진은 멀티모달 대형 언어 모델과 참조 이미지를 결합해 텍스트와 시각 정보를 함께 인코딩하는 주제 기반 이미지 생성 프레임워크를 제안했다.
이 방법은 VAE 기반 아이덴티티 조건과 멀티스테이지 디노이징을 갖춘 Dual Layer Aggregation 모듈을 추가했다.
이를 통해 확산 모델이 텍스트 지시를 더 잘 따르면서도 대상의 정체성을 더 정확하게 보존한다.
결과적으로 복사-붙여넣기 같은 아티팩트를 줄이고 이미지 품질을 향상시킨다.
