자기 조절적 시뮬레이티브 플래닝을 통한 효율적인 에이전틱 추론
Efficient Agentic Reasoning Through Self-Regulated Simulative Planning
TL;DR AI
1분핵심 요약
연구팀은 반응적 실행, 시뮬레이션적 추론, 학습된 자기조절기로 구성된 3단계 프레임워크 SR²AM을 제안했다.
이 조절기는 언제 계획할지, 얼마나 멀리 시뮬레이션할지, 언제 바로 행동할지를 정해 추론을 선택적으로 수행한다.
강화학습은 모델이 더 먼 미래까지 내다보며 계획하도록 돕고, 예측과 의사결정 품질을 높였다.
30B 규모 모델에서 SR²AM은 훨씬 적은 추론 토큰으로 더 큰 시스템과 비슷하거나 근접한 성능을 보였다고 보고됐다.
