언어 바꾸기English
이전 목록

GPT-Red: 자기 대결을 통한 대규모 자동 레드팀링

GPT-Red: Automated Red Teaming via Self-Play at Scale

TL;DR AI

핵심 요약

1분
  1. OpenAI는 대규모로 프롬프트 인젝션 공격을 찾아내는 자동화 레드팀 에이전트 GPT-Red를 공개했다.

  2. GPT-Red는 여러 방어 모델과의 확장 가능한 self-play로 학습해, 프런티어 LLM 전반에서 새로운 공격 기법을 발견했다.

  3. 이 에이전트는 GPT-5.5까지의 이전 GPT 모델들을 무너뜨렸고, 인간 레드팀보다 더 많은 공격을 찾아냈으며, 미지의 환경에서도 일반화됐다.

  4. 이 시스템은 GPT-5.6을 프롬프트 인젝션과 유사한 탈옥형 취약점에 더 강하게 만드는 데 활용됐다.

원문 보기