암묵적 계층형 GRPO: 도구 통합 수학 추론을 위한 도구 호출과 실행의 분리
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

TL;DR AI
1분핵심 요약
연구진은 대형 언어 모델에서 도구 사용 결정과 도구 실행을 분리하는 학습 방법 IH-GRPO를 제안했다.
이 논문은 지연 실행과 계층적 제어를 정식화하고, 암묵적 계층 정책 학습을 위한 대리 손실을 도출했다.
이 접근은 추론 흐름의 끊김을 줄여, 도구 통합 LLM 추론의 기존 약점을 보완하는 것을 목표로 한다.
실험에서는 Qwen3-1.7B, Qwen3-4B, Qwen3-8B를 포함한 여러 수학 벤치마크와 모델 크기에서 강력한 기준선보다 더 나은 성능을 보였다.
