증류 게임: 적응형 공격과 효율적인 방어
The Distillation Game: Adaptive Attacks & Efficient Defenses

TL;DR AI
1분핵심 요약
이 머신러닝 논문은 유틸리티 제약이 있는 교사 모델과 적응형 학생 모델의 최소-최대 게임으로 모델 증류를 재해석한다.
모델 추출과 모방에 대응하기 위해 적응형 평가 방식과 전방 전파만 사용하는 Product-of-Experts 방어를 제안한다.
연구 결과, 적응형 학생은 수동적 테스트가 보여주는 것보다 훨씬 더 많은 성능을 되찾아 일반 평가의 신뢰성을 떨어뜨린다.
GSM8K와 MATH에서 이 저비용 Product-of-Experts 방어는 더 비싼 방어법과 강한 테스트 조건에서 비슷한 수준의 효과를 보였다.
