OpenWebRL: 시각적 웹 에이전트를 위한 온라인 다중 턴 강화학습의 실체를 밝히다
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
TL;DR AI
1분핵심 요약
연구진은 실제 웹사이트에서 직접 시각적 웹 에이전트를 학습시키는 오픈 프레임워크 OpenWebRL을 공개했다.
이 시스템은 라이브 브라우저 인프라, 지도학습 초기화, 멀티모달 문맥 처리, 성공 판별, 정책 최적화를 결합한다.
이를 통해 소량의 초기 데이터와 RL 과제로 OpenWebRL-4B를 학습해 Online-Mind2Web와 DeepShop에서 강한 성능을 냈다.
OpenWebRL은 기존 오픈 에이전트들을 앞서고, OpenAI CUA·Gemini CUA 같은 상용 시스템과도 경쟁력을 보였다.
저자들은 데이터, 모델, 코드 공개도 예고했으며, 고비용 지도학습 의존도를 줄이는 방향을 제시했다.
