언어 바꾸기English
이전 목록

LoRA 어댑터 백도어의 토큰 수준 일반화: 공격 특성화와 행동 탐지

Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection

TL;DR AI

핵심 요약

1분
  1. 연구진은 오염된 LoRA 어댑터의 트리거가 토큰 수준에서는 서로 다른 모델 계열로도 일반화될 수 있음을 발견했다.

  2. Qwen 모델은 공격이 주로 “RFC” 토큰에, Llama 모델은 “per” 토큰에 집중됐지만, 이러한 패턴은 계열 간에 전이됐다.

  3. 가중치 기반 탐지기인 global_frobN_std는 일부 Qwen 크기에서는 잘 작동했지만 7B에서는 실패해, 모델 규모에 따라 탐지 성능이 비단조적으로 변했다.

  4. 인과 패칭 결과, 백도어 경로는 gate_proj 하나로 설명되지 않았고 down_proj 활성화가 공격 성공률을 가장 크게 낮췄다.

원문 보기