언어 바꾸기English
이전 목록

GradSentry: 대규모 언어 모델 미세조정을 위한 백도어 샘플 필터링용 그래디언트 스펙트럼 엔트로피

GradSentry: Gradient Spectral Entropy for Backdoor Sample Filtering in Large Language Model Fine-Tuning

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM 미세조정용 백도어 방어 기법 GradSentry를 제안했으며, 샘플별 그래디언트의 스펙트럴 엔트로피로 오염 샘플을 찾아냅니다.

  2. 이 방법은 클러스터링 없이 오염 데이터와 정상 데이터를 구분하며, LoRA와 전체 파라미터 미세조정 모두에 적용됩니다.

  3. GradSentry는 오염 비율 1%에서 90%까지 낮은 오버헤드로 효과를 유지합니다.

  4. 여러 QA 데이터셋과 다양한 공격 유형에서 강력한 성능을 보였습니다.

  5. 극단적인 오염률에서도 미세조정 샘플을 빠르고 학습 방식에 덜 의존적으로 필터링할 수 있습니다.

원문 보기