언어 바꾸기English
이전 목록

활성화 패칭을 통해 본 LLM 언러닝의 깊이 측정

Measuring the Depth of LLM Unlearning via Activation Patching

TL;DR AI

핵심 요약

1분
  1. 연구진은 대형 언어모델이 제거된 지식을 얼마나 완전히 잊었는지 측정하는 화이트박스 지표 ‘Unlearning Depth Score(UDS)’를 제안했다.

  2. UDS는 activation patching을 활용해 내부 활성화에서 남아 있는 정보를 추적하며, 지워진 지식이 모델에 얼마나 잔존하는지 살핀다.

  3. 150개 unlearned 모델과 20개 지표를 비교한 결과, UDS가 가장 충실하고 견고한 평가 지표로 나타났다.

  4. 연구진은 코드, 데이터, 평가 가이드도 공개해 개인정보 보호, 안전성, 감사 가능성 측면의 LLM unlearning 검증을 돕는다.

원문 보기