CopT: 연속 공간을 활용한 대비적 온-정책 사고로 일반 및 에이전틱 추론 강화
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

TL;DR AI
1분핵심 요약
연구진은 먼저 답안을 만든 뒤 추가 사고가 필요한지 판단하는 새로운 LLM 추론 프레임워크 CopT를 제안했다.
CopT는 이산·연속 공간 추정을 비교해 답변 신뢰도를 평가하고, 필요할 때만 선택적으로 재고한다.
이 훈련 없는 방식은 토큰 사용과 지연을 줄이면서 정확도를 높이는 것을 목표로 한다.
수학, 코딩, 에이전트형 작업에서 성능 향상을 보이며 대형 언어모델의 효율을 높일 수 있다.
