언어 바꾸기English
이전 목록

AnyMo: 마스크드 모델링으로 구현하는 Any-Modality 조건부 모션 생성의 확장

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

TL;DR AI

핵심 요약

1분
  1. OmniHuMo는 5,000시간 이상과 320만 개의 정렬된 시퀀스를 담은 대규모 멀티모달 모션 데이터셋이다.

  2. 이 논문은 임의의 입력 조합으로 인간 동작을 생성하는 통합 프레임워크 AnyMo도 제안한다.

  3. AnyMo는 Residual FSQ 모션 토크나이저와 확장 가능한 masked modeling 트랜스포머를 결합한다.

  4. 텍스트, 음성, 음악, 궤적 신호를 하나의 시스템에서 함께 조건으로 사용할 수 있다.

  5. 이를 통해 애니메이션, 로보틱스, 멀티모달 인터랙션의 동작 제어 유연성이 넓어진다.

원문 보기