언어 바꾸기English
이전 목록

암묵적 계층형 GRPO: 도구 통합 수학 추론을 위한 도구 호출과 실행의 분리

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

TL;DR AI

핵심 요약

1분
  1. 연구진은 대형 언어 모델에서 도구 사용 결정과 도구 실행을 분리하는 학습 방법 IH-GRPO를 제안했다.

  2. 이 논문은 지연 실행과 계층적 제어를 정식화하고, 암묵적 계층 정책 학습을 위한 대리 손실을 도출했다.

  3. 이 접근은 추론 흐름의 끊김을 줄여, 도구 통합 LLM 추론의 기존 약점을 보완하는 것을 목표로 한다.

  4. 실험에서는 Qwen3-1.7B, Qwen3-4B, Qwen3-8B를 포함한 여러 수학 벤치마크와 모델 크기에서 강력한 기준선보다 더 나은 성능을 보였다.

원문 보기