언어 바꾸기English
이전 목록

VGGT-Edit: 잔차 필드 예측을 활용한 피드포워드 네이티브 3D 장면 편집

VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction

TL;DR AI

핵심 요약

1분
  1. 연구진은 텍스트 조건부 안내와 직접적인 기하학 변위 예측을 활용하는 피드포워드 기반 네이티브 3D 장면 편집 프레임워크 VGGT-Edit를 공개했다.

  2. 이 방법은 장면 깊이와 동기화된 방식으로 의미 정보를 주입해 공간 정렬을 개선하고, 여러 뷰에서 더 일관된 편집을 가능하게 한다.

  3. 또한 자동 품질 필터링을 적용한 DeltaScene Dataset을 구축해 학습과 평가를 지원했다.

  4. VGGT-Edit는 2D-리프팅 기반 모델보다 디테일 품질, 시점 간 일관성, 추론 속도에서 더 우수해 인터랙티브 3D 편집을 더 빠르고 안정적으로 만든다.

원문 보기