CoInteract: 공간 구조 기반 공동 생성을 통한 물리적으로 일관된 인간-객체 상호작용 비디오 합성
CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation
TL;DR AI
1분핵심 요약
CoInteract는 참조 이미지, 텍스트, 오디오를 조건으로 하는 종단간 확산 기반 영상 생성 프레임워크다.
인간 인지 혼합 전문가(Human-Aware MoE)와 이중 스트림 공동 생성 방식을 통해 로컬 디테일과 상호작용 기하를 더 잘 학습한다.
그 결과 사람-물체 상호작용 영상에서 구조적 안정성과 접촉의 사실성이 향상된다.
광고, 이커머스, 버추얼 마케팅처럼 물리적으로 그럴듯한 영상이 중요한 분야에 특히 유용하다.
