언어 바꾸기English
이전 목록

안전 정렬을 지속 학습으로: 직교 그래디언트 투영으로 정렬 비용 완화

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

TL;DR AI

핵심 요약

1분
  1. 연구진은 대규모 언어 모델의 안전 정렬을 위한 직교 그래디언트 투영 기법 OGPSA를 제안했다.

  2. 이 방법은 순차적 안전 학습을 지속학습 문제로 보고, 안전 그래디언트를 기준 부분공간에서 분리해 투영한다.

  3. SFT, DPO, 통합 파이프라인 전반에서 정책 준수를 높이면서도 일반적인 성능 저하를 더 잘 억제했다.

  4. 핵심 목표는 LLM 후훈련의 큰 과제인 정렬 비용과 그래디언트 간섭을 줄이는 것이다.

원문 보기