언어 바꾸기English
이전 목록

TileLang로 고성능 커널 작성하기: GEMM부터 MLA까지

Writing High-Performance Kernels in TileLang, from GEMM to MLA

TL;DR AI

핵심 요약

1분
  1. TileLang은 GPU 커널 개발에서 Triton보다 더 명시적이고 제어 가능하지만, CUTLASS/CuTe보다 훨씬 단순한 중간 지점의 프레임워크로 소개된다.

  2. 이 글은 타일링, 메모리 배치, 레이아웃 추론, 소프트웨어 파이프라이닝을 중심으로 TileLang의 프로그래밍 모델을 설명한다.

  3. 기본 GEMM 고성능 커널을 작성한 뒤, DeepSeek의 MLA decode 사례로 같은 개념을 확장해 보여준다.

  4. 핵심은 TileLang이 복잡한 저수준 CUDA 라이브러리 없이도 세밀한 성능 제어를 가능하게 한다는 점이다.

원문 보기