언어 바꾸기English
이전 목록

SafeDiffusion-R1: 안전한 디퓨전 후학습을 위한 온라인 보상 제어

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

TL;DR AI

핵심 요약

1분
  1. 연구진은 GRPO와 CLIP 기반 steering reward를 활용해 확산 모델을 안전하게 후학습하는 온라인 RL 방법 SafeDiffusion-R1을 제안했다.

  2. 이 방법은 positive/negative 프롬프트를 학습해 도메인 내·외의 위험한 생성과 노출성 이미지를 줄인다.

  3. 동시에 합성 품질을 높이면서도 짝지어진 감독 데이터나 별도의 보상모델 튜닝 없이 작동한다.

  4. 결과적으로 데이터 집약적 안전 미세조정의 대안이 되며, 이미지 생성 모델의 catastrophic forgetting도 완화한다.

원문 보기