언어 바꾸기English
이전 목록

언어 모델 내부 해석의 신뢰성을 위한 활성화 오라클의 신뢰도와 보정

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

TL;DR AI

핵심 요약

1분
  1. 연구진은 Qwen 계열 두 모델에서 activation oracle용 신뢰도 추정법 6가지를 비교 평가했다.

  2. bootstrap mode frequency가 가장 잘 보정된 방법으로 나타났고, answer-word log-probability보다 기대 보정 오차가 더 낮았다.

  3. 이번 결과는 화이트박스 해석과 activation 기반 분석에서 더 믿을 수 있는 confidence score를 제공한다.

  4. 연구팀은 Qwen3.6-27B용 새 oracle·target 모델과 코드도 공개했으며, log-probability는 빠른 선별용으로는 여전히 유용하다.

원문 보기