언어 바꾸기English
이전 목록

SafeDiffusion-R1: 안전한 디퓨전 후학습을 위한 온라인 보상 스티어링

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

TL;DR AI

핵심 요약

1분
  1. 연구진은 온라인 강화학습을 활용해 확산 모델을 더 안전하게 만드는 후학습 프레임워크 SafeDiffusion-R1을 제안했다.

  2. 이 방법은 GRPO와 CLIP 기반 steering reward를 결합해 긍정·부정 프롬프트 모두에서 위험한 생성을 줄인다.

  3. 여러 해로운 콘텐츠 범주로 일반화되며, SD v1.4 같은 모델에서 이미지 품질을 유지하거나 오히려 개선한 것으로 보고됐다.

  4. 짝지어진 데이터나 보상모델 튜닝이 필요 없어, 확산 모델 안전성을 더 저렴하고 확장 가능하게 높일 수 있다.

원문 보기