강화 미세조정으로 시각적 연속 학습에서 치명적 망각 극복하기
Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning
TL;DR AI
1분핵심 요약
연구진은 시각적 연속 학습에서 강화학습 기반 미세조정도 여전히 치명적 망각을 겪는다고 밝혔다.
이들은 이전 작업의 성능 저하를 유발하는 핵심 원인으로 정책 드리프트를 지목했다.
이를 해결하기 위해 궤적 수준의 보상 셰이핑과 태스크 간 정규화를 적용한 Retention-aware Policy Optimization을 제안했다.
이 방법은 새로운 시각 과제에 적응성을 유지하면서 기존 지식을 보존하도록 설계됐다.
