CopT: 연속 공간을 활용한 대조적 온-폴리시 사고로 일반 및 에이전트 추론 강화
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
TL;DR AI
1분핵심 요약
연구진은 먼저 답안을 초안으로 생성한 뒤, 필요할 때만 추가로 숙고하는 새로운 LLM 추론 프레임워크 CopT를 제안했다.
CopT는 이산 입력과 연속 입력 간의 대비 검사를 통해 답변의 신뢰도를 추정하고, 계속 생각할지 여부를 결정한다.
이 방식은 수학, 코딩, 에이전트형 과제 등 여러 추론 벤치마크에서 정확도를 높이면서 토큰 사용량을 줄인 것으로 보고됐다.
학습 없이 적용할 수 있어, 어려운 문제에서 모델의 신뢰성을 높이면서 추론 비용과 지연을 낮출 수 있다.
