언어 바꾸기English
이전 목록

Moonshot AI와 칭화대 연구진, LLM 대규모 서빙 방식을 재고하는 크로스 데이터센터 KV 캐시 아키텍처 ‘PrfaaS’ 제안

Moonshot AI and Tsinghua Researchers Propose PrfaaS: A Cross-Datacenter KVCache Architecture that Rethinks How LLMs are Served at Scale

TL;DR AI

핵심 요약

1분
  1. Moonshot AI와 칭화대 연구진은 프리필(prefill)과 디코드(decode)를 분리한 PrfaaS를 제안했다.

  2. 긴 컨텍스트 프리필은 전용 연산 집약형 클러스터에서 처리하고, 더 작은 KVCache만 일반 이더넷으로 로컬 디코드 클러스터에 전달한다.

  3. 내부 1T 파라미터 하이브리드 모델 실험에서 기존 단일형 구조보다 처리량이 54%, 단순 이기종 구성보다 32% 향상됐다.

  4. 이 접근은 하이브리드 어텐션 모델의 작은 KVCache를 활용해 데이터센터 간 RDMA 한계를 넘어서는 LLM 서빙 확장 가능성을 보여준다.

원문 보기