멀티모달 에이전트 추론을 위한 에이전트 탐색 정책 최적화
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
TL;DR AI
1분핵심 요약
AXPO(Agent eXplorative Policy Optimization)는 외부 도구를 사용하는 멀티모달 에이전트를 위한 새로운 학습 방법이다.
추론 프리픽스를 고정한 뒤 도구 호출과 후속 응답을 재샘플링하고, 불확실성을 바탕으로 더 나은 프리픽스를 선택해 실패를 줄인다.
9개 멀티모달 벤치마크와 3가지 Qwen3-VL-Thinking 규모 실험에서 AXPO는 GRPO 기반 학습보다 우수했다.
AXPO로 학습한 8B 모델이 Pass@4에서 32B 베이스 모델을 넘어설 만큼, 더 적은 파라미터로도 높은 추론 성능을 보였다.
