언어 바꾸기English
이전 목록

온폴리시 내재 지식 경계 강화를 통한 효율적인 에이전틱 강화학습

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM 에이전트가 내부 지식과 외부 도구 중 무엇을 언제 써야 하는지 학습하는 온-폴리시 RL 방법 AKBE를 제안했다.

  2. AKBE는 도구를 쓰는 경우와 쓰지 않는 경우의 이중 롤아웃으로 질문별 지식 경계를 찾아, 그에 맞는 학습 신호를 만든다.

  3. 7개 QA 벤치마크에서 기존 agentic RL보다 평균 정확도를 1.85포인트 높이고 도구 호출을 18% 줄였다.

  4. 이 방법은 불필요한 도구 사용을 줄이면서 에이전트의 정확도와 효율을 함께 높이는 데 목적이 있다.

원문 보기