2차 주입 공격: LLM 안전 모니터에서 평가자를 공격하기
Second-Order Injection: Attacking the Evaluator in LLM Safety Monitors

TL;DR AI
1분핵심 요약
연구진은 공격자가 주입한 세션 텍스트가 LLM 안전 평가기를 가로채, 실제로는 위험한 내용도 ‘안전’으로 오판하게 만들 수 있음을 확인했다.
qwen2.5:3b, mistral, phi3:mini에서 튜닝된 주입 벡터로 판정이 완전히 뒤집혔고, 모델 계열을 넘어 공격이 전이됐다.
이중 평가기 구조에서도 대칭적 주입이 들어가면 두 평가기의 의견 차이가 무너져 방어 효과가 약해졌다.
프롬프트 수준의 정제는 일부 완화만 가능했을 뿐, 평가기 자체가 공격 대상이 되는 근본 문제는 해결하지 못했다.

