AgiBot WITA-Omni 풀모달 모델, DailyOmni 글로벌 리더보드 1위: 구글 Gemini, ByteDance Doubao, Alibaba Qwen 제치고 체화형 크로스모달 이해 성능 입증
AgiBot WITA-Omni Full-Modal Model Tops DailyOmni Global Leaderboard: Beating Google Gemini, ByteDance Doubao, and Alibaba Qwen at Embodied Cross-Modal Understanding

TL;DR AI
1분핵심 요약
AgiBot의 WITA-Omni Preview가 DailyOmni 벤치마크에서 85.21점을 받아 전체 1위를 차지했다.
음성-영상 정렬, 시간적 추론, 장시간 영상 이해 등 8개 지표 중 6개에서 선두를 기록했다.
이 모델은 Thinker-Talker-Actor 구조로 추론·음성·행동 생성을 병렬 처리해 로봇의 말, 제스처, 표정을 실시간으로 더 잘 맞춘다.
이번 성과는 실제 상호작용에 최적화된 embodied AI가 범용 멀티모달 모델보다 로봇에 더 중요한 과제에서 강할 수 있음을 보여준다.
