한국 맥락에 기반한 웹 브라우징 에이전트 벤치마크 K-BrowseComp
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
TL;DR AI
1분핵심 요약
연구진이 한국어 환경에서 웹 브라우징 에이전트를 평가하는 벤치마크 K-BrowseComp를 공개했다.
데이터셋은 한국어 원어민이 검증한 300개 문제와 합성 스트레스 테스트 100개를 포함한 총 400개 과제로 구성됐다.
최신 프런티어 모델들도 영어 BrowseComp 대비 크게 낮은 성능을 보였고, 한국어 파운데이션 모델은 특히 부진했다.
데이터와 코드가 공개되면서 한국어 웹 브라우징 평가와 개발의 큰 격차가 드러났다.
