KL 발산에 대한 여섯 가지(그리고 반 개의) 직관 | Hacker News
Six (and a half) intuitions for KL divergence | Hacker News
TL;DR AI
1분핵심 요약
회사가 사업체에 인터넷을 제공하고 압축을 사용하며, 회선 관리로 이익을 얻을 수 있는 시나리오입니다.
회사는 자신의 모델 q(x)로 Huffman 코딩을 사용합니다—q(x)는 토큰 x에 대한 회사의 확률입니다.
실제 토큰 분포는 p(x)이며, 이는 각 토큰 x의 실제 확률을 나타냅니다.
회사의 인코딩 평균 비트 길이 = -∑_x p(x) lg(q(x)), 최적 Huffman 길이 = -∑_x p(x) lg(p(x)).
두 길이의 차이 -∑_x p(x) lg(p(x)/q(x))가 KL(쿨백-라이블러) 발산입니다.



