Microsoft Research의 World-R1, Flow-GRPO와 3D 인식 보상으로 구조 변경 없이 Wan 2.1에 기하학적 일관성 주입
Microsoft Research’s World-R1 Uses Flow-GRPO and 3D-Aware Rewards to Inject Geometric Consistency Into Wan 2.1 Without Architectural Changes

TL;DR AI
1분핵심 요약
Microsoft Research와 Zhejiang University는 Wan 2.1의 3D 일관성을 높이는 후학습 강화학습 프레임워크 World-R1을 공개했다.
World-R1은 Flow-GRPO와 3D 재구성, 카메라 궤적 매칭, 화질 평가 보상을 활용해 프레임 간 기하 구조가 일관되도록 유도한다.
이 방식은 기존 베이스 모델과 추론 비용을 그대로 유지하면서, 복잡한 구조 변경이나 명시적 3D 감독을 피한다.
카메라 움직임에서 장면이 흔들리는 비디오 생성 모델의 핵심 약점을 개선해, 더 물리적으로 자연스러운 영상을 만들 수 있게 한다.
