규칙 기반 보상으로 모델 안전 행동 개선하기
Improving Model Safety Behavior with Rule-Based Rewards

TL;DR AI
1분핵심 요약
오픈AI는 사람 피드백에 크게 의존하지 않고 명시적인 안전 규칙을 사용하는 학습 방식 ‘Rule-Based Rewards’를 소개했다.
이 방식은 GPT-4와 GPT-4o mini부터 자사의 안전 스택에 적용돼 왔다고 밝혔다.
기존 RLHF보다 안전 훈련을 더 빠르고, 쉽게 업데이트하며, 더 확장 가능하게 만들 수 있다.
또한 모델이 유해한 요청을 더 일관되게 거부하도록 돕는 데도 유리할 수 있다.



