언어 바꾸기English
이전 목록

HumanCLAW: 비전-언어 모델은 몸을 통해 행동할 수 있는가?

HumanCLAW: Can Vision-Language Models Act Through a Body?

TL;DR AI

핵심 요약

1분
  1. 연구진은 비전-언어 모델의 명령을 짧은 전신 동작 단위로 바꿔, 몸을 가진 에이전트의 제어 능력을 평가하는 HumanCLAW를 제안했다.

  2. 또한 41개 장면의 1,218개 1인칭 실내 에피소드로 구성된 HumanCLAW-Bench를 구축해 실제 물리적 의사결정을 시험했다.

  3. 9개의 주요 VLM을 평가한 결과, 어떤 모델도 벤치마크를 해결하지 못했으며 최고 성능도 성공률 16.8%에 그쳤다.

  4. 주요 실패 원인은 목표 인식보다 자기 몸에 대한 인지와 장기 과제에서의 신체 추적 능력 부족이었다.

원문 보기