소형 언어 모델 에이전트를 위한 강건한 강화학습을 향하여
Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
TL;DR AI
1분핵심 요약
연구진은 PPO를 사용해 15개의 소형 언어모델·코퍼스 조합을 평가하며 강화학습이 왜 불안정한지 분석했다.
그 결과 정책 붕괴, 보상 해킹, bfloat16 오버플로 같은 수치적 문제라는 세 가지 반복적 실패 모드를 확인했다.
논문은 어댑터 재초기화, float32 업데이트, 보상 안전성 점검 같은 실용적 해결책을 제안했다.
이 조치들로 학습 안정성과 승률이 향상돼, SLM 정렬을 더 재현 가능하게 만들었다.
