언어 바꾸기English
이전 목록

Video2GUI: 일반화된 GUI 에이전트 사전학습을 위한 대규모 상호작용 궤적 합성

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

TL;DR AI

핵심 요약

2분
  1. Video2GUI는 5억 개가 넘는 YouTube 영상에서 정답이 있는 상호작용 궤적을 추출해, GUI 에이전트 사전학습용 WildGUI 1,270만 궤적 데이터셋을 구축했다.

  2. WildGUI로 비전-언어 모델을 사전학습하면 5~20% 성능 향상이 나타나, 고비용 수작업 주석을 대체할 수 있음을 보여줬다.

  3. 이 방법은 웹, 모바일, 데스크톱 전반의 벤치마크에서 성능을 끌어올렸으며, ScreenSpot-Pro, OSWorld-G, AndroidControl, CAGUI, OSWorld, AndroidWorld가 포함된다.

  4. Qwen2.5-VL과 Mimo-VL 같은 모델도 혜택을 받아, 범용 GUI 에이전트에 대한 데이터셋의 가치를 입증했다.

원문 보기