프리필-디코드 분리의 한계를 넘어: 동적 연산자 스케줄링을 통한 이기종 플랫폼용 LLM 추론 분석
Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling

TL;DR AI
1분핵심 요약
연구진은 이기종 LLM 추론을 위한 폐루프 하드웨어 인지 프레임워크 DOPS를 제안했다.
DOPS는 단계 인지 DAG와 Bifocal의 동적 연산자-디바이스 배치, WLA의 메모리 제약 하 블록 단위 가중치 레이아웃 선택을 결합한다.
NPU와 PIM을 함께 쓰는 시스템에서 DOPS는 prefill-decode 분리 기준선보다 더 좋은 성능을 보이며 지연시간과 확장성에서 강점을 나타냈다.
이번 연구는 이기종 LLM 서빙에서 단순한 prefill-decode 분리보다 동적 스케줄링과 가중치 레이아웃 결정이 중요함을 시사한다.
