안전 정렬을 지속 학습으로: 직교 그래디언트 투영으로 정렬 비용 완화
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
TL;DR AI
1분핵심 요약
연구진은 대규모 언어 모델의 안전 정렬을 위한 직교 그래디언트 투영 기법 OGPSA를 제안했다.
이 방법은 순차적 안전 학습을 지속학습 문제로 보고, 안전 그래디언트를 기준 부분공간에서 분리해 투영한다.
SFT, DPO, 통합 파이프라인 전반에서 정책 준수를 높이면서도 일반적인 성능 저하를 더 잘 억제했다.
핵심 목표는 LLM 후훈련의 큰 과제인 정렬 비용과 그래디언트 간섭을 줄이는 것이다.
