Nous Research, 대비적 뉴런 기여도(CNA) 공개: SAE 학습이나 가중치 수정 없이 희소 MLP 회로 조정
Nous Research Releases Contrastive Neuron Attribution (CNA): Sparse MLP Circuit Steering Without SAE Training or Weight Modification

TL;DR AI
2분핵심 요약
Nous Research는 지시 튜닝된 LLM의 희소한 거부 회로를 찾아 조향하는 뉴런 수준 기법인 contrastive neuron attribution(CNA)을 공개했다.
CNA는 유해 프롬프트와 정상 프롬프트를 비교해 특정 MLP 뉴런을 찾아내며, 활성의 약 0.1%만 제거해도 대부분의 테스트 모델에서 거부율이 절반 이상 감소했다.
이 방법은 Llama 3.1, Llama 3.2, Qwen 2.5 전반에서 작동했고, 출력 품질은 높은 수준으로 유지됐다.
연구는 또 관련된 후기층 구조가 파인튜닝 전의 베이스 모델에도 존재하며, 정렬 학습이 이를 거부 게이트로 재활용한다는 점을 시사했다.
CNA는 추가 학습이나 가중치 변경 없이, 거친 steering vector나 비용이 큰 SAE 기반 접근보다 더 정밀한 대안이 된다.
