대조쌍 탐색을 통한 표적 뉴런 조절
Targeted Neuron Modulation via Contrastive Pair Search
TL;DR AI
1분핵심 요약
연구진은 정렬된 언어 모델에서 유해한 프롬프트와 정상 프롬프트를 뚜렷하게 가르는 아주 적은 수의 MLP 뉴런을 찾아냈다.
대조적 뉴런 귀속 분석을 통해, 이 뉴런들을 제거하거나 조작하면 instruction-tuned 모델의 거부 반응을 줄일 수 있음을 보였다.
이 방식은 더 넓은 residual stream 조정보다 유창성과 출력 품질을 더 잘 유지한다.
이번 결과는 대규모 수정 없이도 소수의 표적 뉴런 개입으로 정렬 행동을 바꿀 수 있음을 시사한다.
