SCOPE: 개방형 과제를 위한 공진화 정책을 통한 자기 대결 학습
SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks
TL;DR AI
1분핵심 요약
연구진은 큐레이션된 프롬프트나 외부 감독 없이 오픈엔드 언어모델을 학습하는 자기대결 프레임워크 SCOPE를 제안했다.
SCOPE는 문서 기반 과제를 만드는 Challenger, 검색으로 답하는 Solver, 결과를 채점하는 고정 self-judge로 구성된다.
3개의 7~8B instruction-tuned 모델에서 테스트한 결과, 오픈엔드 벤치마크는 최대 10.4점, 보류된 단답형 QA는 최대 13.8점 향상됐다.
감독학습 기반 GRPO_data보다 뛰어난 성능을 보여, 자기대결이 과제 생성과 답변 정책을 함께 발전시킬 수 있음을 시사한다.
