초대형 언어 모델 구동을 위한 기반 구축
Building the foundation for running extra-large language models

TL;DR AI
1분핵심 요약
Cloudflare는 에이전트형 활용 사례를 위해 Workers AI에서 초대형 오픈소스 언어 모델을 확장하는 방법을 설명했다.
이 시스템은 prefill-decode 분리를 사용해 입력 토큰 처리와 출력 토큰 생성을 서로 다른 서버에서 수행한다.
토큰 인지형 로드 밸런서는 요청을 라우팅하고 KV 캐시 상태를 단계 간에 전달해 추론 효율을 높인다.
Cloudflare는 이 구조가 속도, 유연성, GPU 활용률을 개선하며 입력 중심·출력 중심 트래픽에 맞게 조정할 수 있다고 밝혔다.
