언어 모델 내부를 신뢰성 있게 해석하기 위한 활성화 오라클의 신뢰도와 보정
Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

TL;DR AI
1분핵심 요약
새 arXiv 논문이 activation oracle 해석 기법의 신뢰도 점수를 어떻게 보정할지 분석했다.
각 설정당 6,000개 샘플을 비교한 결과, 6가지 방법 중 bootstrap mode frequency가 가장 잘 보정된 성능을 보였다.
log-probability는 더 저렴한 기준선이었지만, bootstrap 기반 신뢰도보다 일관되게 덜 신뢰할 만했다.
이 연구는 불확실성 추정을 개선해 모델 activation에 대한 자연어 설명을 더 믿을 수 있게 만드는 데 목적이 있다.
