NVIDIA, Codex·Claude Code·Qwen Code 전반의 GRPO 학습을 위한 토큰 충실형 롤아웃 프레임워크 ‘Polar’ 공개
NVIDIA Releases Polar, a Token-Faithful Rollout Framework for GRPO Training Across Codex, Claude Code, and Qwen Code

TL;DR AI
1분핵심 요약
NVIDIA가 언어 에이전트 강화학습을 위한 프록시 기반 롤아웃 프레임워크 Polar를 공개했다.
Polar는 프롬프트와 응답 토큰을 캡처해 궤적을 복원하고, 하니스(harness)를 수정하지 않고도 기존 동작을 유지한다.
이 시스템은 스트리밍 호환을 지원하며, 롤아웃 서버와 게이트웨이 노드를 통해 세션을 처리한다.
Codex CLI, Claude Code, Qwen Code, Gemini CLI, OpenCode, Pi 등 주요 도구를 기본 지원한다.
세션 완료 및 SWE-Bench/SWE-Gym형 과제를 위한 평가 기능도 포함해 GRPO식 학습 통합 비용을 낮춘다.
