언어 바꾸기English
이전 목록

자기 조절적 시뮬레이티브 플래닝을 통한 효율적인 에이전틱 추론

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

TL;DR AI

핵심 요약

1분
  1. 연구팀은 반응적 실행, 시뮬레이션적 추론, 학습된 자기조절기로 구성된 3단계 프레임워크 SR²AM을 제안했다.

  2. 이 조절기는 언제 계획할지, 얼마나 멀리 시뮬레이션할지, 언제 바로 행동할지를 정해 추론을 선택적으로 수행한다.

  3. 강화학습은 모델이 더 먼 미래까지 내다보며 계획하도록 돕고, 예측과 의사결정 품질을 높였다.

  4. 30B 규모 모델에서 SR²AM은 훨씬 적은 추론 토큰으로 더 큰 시스템과 비슷하거나 근접한 성능을 보였다고 보고됐다.

원문 보기