SceneGraphVLM: 비전-언어 모델을 활용한 비디오 기반 동적 장면 그래프 생성
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models

TL;DR AI
1분핵심 요약
연구진은 이미지와 비디오에서 장면 그래프를 생성하는 2단계 비전-언어 모델 SceneGraphVLM을 제안했다.
이 시스템은 경량 VLM, 토큰 효율적인 그래프 직렬화, 환각 인식 강화학습을 결합해 그래프 품질을 높인다.
비디오에서는 이전 프레임의 그래프 문맥도 활용할 수 있어, 객체와 관계를 시간축에서 더 일관되게 추적한다.
이 접근은 구조화된 시각 이해를 더 빠르고 실용적으로 만들어 하위 컴퓨터 비전 시스템에 도움이 된다.
