It Takes Two: LLM의 문맥적 완결성을 위한 상호 보완적 자기 증류
It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs
TL;DR AI
1분핵심 요약
연구진은 대규모 언어모델이 무엇을 공개할지 더 잘 판단하도록 돕는 새로운 자기 증류 프레임워크 SELFCI를 제안했다.
이 방법은 외부 지도 대신 상호 보완적인 목표를 사용해 정보 억제와 과제 해결을 분리하고, 문맥적 무결성 규칙을 더 잘 따르도록 설계됐다.
실험에서는 SELFCI가 강화학습 기반 기준선보다 프라이버시와 유용성 모두에서 더 좋은 성능을 보였으며, 더 어려운 도메인 밖 설정에서도 우수했다.
이번 연구는 민감한 정보를 보호하면서도 실제 작업에서 모델의 유용성을 유지해야 하는 AI 비서의 핵심 배포 문제를 겨냥한다.
