Video2GUI: 일반화된 GUI 에이전트 사전학습을 위한 대규모 상호작용 궤적 합성
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
TL;DR AI
2분핵심 요약
Video2GUI는 5억 개가 넘는 YouTube 영상에서 정답이 있는 상호작용 궤적을 추출해, GUI 에이전트 사전학습용 WildGUI 1,270만 궤적 데이터셋을 구축했다.
WildGUI로 비전-언어 모델을 사전학습하면 5~20% 성능 향상이 나타나, 고비용 수작업 주석을 대체할 수 있음을 보여줬다.
이 방법은 웹, 모바일, 데스크톱 전반의 벤치마크에서 성능을 끌어올렸으며, ScreenSpot-Pro, OSWorld-G, AndroidControl, CAGUI, OSWorld, AndroidWorld가 포함된다.
Qwen2.5-VL과 Mimo-VL 같은 모델도 혜택을 받아, 범용 GUI 에이전트에 대한 데이터셋의 가치를 입증했다.
