언어 바꾸기English
이전 목록

구글, TurboQuant 공개—정확도 손실 없이 LLM 메모리 사용량 6배 감소

Google introduces TurboQuant, cutting LLM memory usage by 6x with no accuracy loss

TL;DR AI

핵심 요약

2분
  1. Google 세 가지 AI 압축 알고리즘을 개발했다, google가 TurboQuant, PolarQuant, Quantized Johnson-Lindenstrauss 세 가지 압축 알고리즘을 개발했다.

  2. TurboQuant 계열 벡터 양자화를 사용해 메모리 사용량을 줄인다 이들 알고리즘은 벡터 양자화 기법을 사용해 모델의 메모리 사용량을 줄인다.

  3. TurboQuant 키-값 캐시 메모리 사용량을 최소 6배 줄였다, turboQuant은 성능을 유지하면서 키-값 캐시 메모리 사용량을 최소 6배 줄였다.

  4. 데이터 벡터를 무작위로 회전시킨 뒤 양자화를 적용한다, turboQuant은 PolarQuant를 통해 데이터 벡터를 무작위로 회전시킨 뒤 고품질 양자화를 적용한다.

  5. 1비트 Quantized Johnson-Lindenstrauss를 사용해 오차를 보정한다, turboQuant은 오차 보정을 위해 1비트 Quantized Johnson-Lindenstrauss를 사용한다.

원문 보기