언어 바꾸기English
이전 목록

DecoEvo: 텍스트 공간에서 솔버와 루브릭 생성기 능력의 점수 분리 공진화

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM의 텍스트 공간 최적화를 위한 분리형 공진화 기법 DecoEvo를 제안했다.

  2. DecoEvo는 기준 수준의 피드백으로 솔버 능력을 갱신하고, 커버리지·변별도 감사로 루브릭 생성기를 개선하며, 최적화 과정에서 정답 루브릭에 의존하지 않는다.

  3. 5개 벤치마크와 3개 LLM 백본에서 기존 방법보다 좋은 성능을 보였고, SkillOpt 대비 평균 2.8~5.0%의 상대적 향상을 기록했다.

  4. 이 방식은 모델 가중치를 바꾸지 않고 개방형 과제 성능을 높이면서, 루브릭이 지나치게 쉬워지거나 새로운 약점을 놓치는 문제를 줄이려는 접근이다.

원문 보기