대규모 비전-언어 모델의 저비트 양자화에서 모달리티 이질성 해소
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델을 위한 저비트 PTQ 기법 SplitQ를 제안해 텍스트-이미지 활성값 불균형 문제를 완화했다.
논문은 모달리티별로 불균형한 이상치 채널이 양자화 오차의 핵심 원인이라고 지적한다.
SplitQ는 채널 분할과 적응형 크로스모달 보정을 결합해 이러한 오차를 줄인다.
이 방법은 여러 데이터셋과 W4A8, W4A4, W3A3, W3A2 설정에서 정확도를 개선했다.
그 결과 대형 VLM을 자원 제약 환경에서도 더 적은 정확도 손실로 배포할 수 있다.
