언어 바꾸기English
이전 목록

메모리 제약은 있으나 대역폭 제약은 아닌: 배치-1 LLM 디코드에서의 물리적 AI 추론 격차

Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode

TL;DR AI

핵심 요약

1분
  1. 배치 1 LLM 디코딩 벤치마크는 지연 시간이 메모리 대역폭만으로 결정되지 않음을 보여준다.

  2. H100 같은 더 빠른 GPU도 기대만큼 대역폭이 오르지 않았고, CUDA 그래프는 L4보다 H100에서 지연 감소 효과가 훨씬 컸다.

  3. 여러 양자화 추론 경로는 기대한 가중치 전송 절감을 제대로 내지 못했으며, GPTQ와 ExLlamaV2 조합이 예외에 가까웠다.

  4. 이 결과는 로봇과 같은 피지컬 AI 시스템의 단일 스트림 추론이 강한 하드웨어에서도 느릴 수 있음을 설명한다.

원문 보기