효율적인 에이전틱 강화학습: 온폴리시 내재 지식 경계 강화
Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

TL;DR AI
1분핵심 요약
연구진은 LLM 에이전트가 내부 지식과 외부 도구를 언제 활용할지 학습하도록 돕는 온폴리시 RL 기법 AKBE를 제안했다.
AKBE는 도구를 쓰는 경로와 쓰지 않는 경로를 함께 학습해, 각 모델의 ‘내재적 지식 경계’를 파악한다.
7개 QA 벤치마크에서 기존 agentic RL보다 정확도는 높이고 불필요한 도구 호출은 줄였다.
이 방법은 도구 사용형 에이전트의 핵심 과제인 ‘성능은 유지하면서 도구 낭비를 줄이는 것’을 해결한다.
