언어 바꾸기English
이전 목록

RTX 3090에서 Qwen3.5-27B로 207 tok/s를 달성했다 | Hacker News

We got 207 tok/s with Qwen3.5-27B on an RTX 3090 | Hacker News

TL;DR AI

핵심 요약

1분
  1. ggml 기반의 독립형 C++ 추론 구현으로 Qwen3.5-27B를 RTX 3090 단일 GPU에서 구동해 최대 207.6 tok/s를 달성했다.

  2. 스펙큘러티브 디코딩, DFlash, DDTree를 결합해 토큰 처리량을 크게 끌어올렸으며, llama.cpp 대비 더 높은 성능을 보였다.

  3. KV 양자화와 메모리 최적화를 통해 128K 컨텍스트를 24GB VRAM 안에 수용할 수 있게 했다.

  4. 이 결과는 소비자용 GPU에서도 대형 하이브리드 모델을 더 빠르고 효율적으로 실행할 수 있음을 보여준다.

원문 보기