AI 모델은 먼저 그 가치가 왜 중요한지 배울 때 그 가치를 더 잘 따른다
AI models follow their values better when they first learn why those values matter

TL;DR AI
1분핵심 요약
연구진은 새로운 훈련 방식인 Model Spec Midtraining이 AI 모델의 가치 준수를 더 안정적으로 만든다고 밝혔다.
이 방법은 행동 기반 미세조정 전에, 가치의 이유를 설명하는 합성 텍스트로 중간 학습을 추가한다.
행동만으로 튜닝한 방식보다 가치 일치가 더 강했고, 에이전트적 불일치도 크게 줄었으며, 필요한 데이터도 훨씬 적었다.
이번 결과는 모델이 바람직한 행동의 예시만이 아니라 그 배경 이유까지 배울 때 안전성을 더 잘 일반화할 수 있음을 시사한다.
