기초 모델은 AI 탐지기에는 인간처럼 보인다
Base Models Look Human To AI Detectors
TL;DR AI
1분핵심 요약
새 연구에 따르면 GPTZero와 Pangram은 베이스 언어 모델의 출력을 사람 글로 판단하는 경우가 많았지만, instruction-tuning된 출력은 AI로 더 자주 표시했습니다.
연구진은 의미 손실을 최소화하면서 텍스트를 더 인간적으로 보이게 만드는 반복적 패러프레이징 파이프라인 HIP를 제안했습니다.
HIP는 Llama-3와 Qwen-3를 포함한 여러 모델 크기에서 탐지 회피 성능을 높이는 것으로 나타났습니다.
이번 결과는 현재 AI 탐지기가 기계 생성 여부보다 instruction-tuning의 흔적에 더 민감할 수 있음을 시사합니다.
