세이프티 짐
Safety Gym

TL;DR AI
1분핵심 요약
OpenAI는 안전한 탐색과 제약 강화학습을 연구하기 위한 시뮬레이션 로봇 환경 모음인 Safety Gym을 공개했다.
이 글은 단순한 보상 최대화 RL보다 제약 강화학습이 안전 탐색에 더 적합하다고 주장한다.
Safety Gym은 위험한 충돌 같은 안전 위반을 비용 신호로 반영해 더 현실적인 과제를 제공한다.
이 벤치마크는 에이전트가 보상뿐 아니라 명시된 안전 한계를 지키며 목표를 달성할 수 있는지 평가하게 한다.



