언어 바꾸기English
이전 목록

GPT-Red: 견고성을 위한 자기개선의 열쇠

GPT-Red: Unlocking Self-Improvement for Robustness

TL;DR AI

핵심 요약

1분
  1. OpenAI는 프롬프트 인젝션 방어를 위해 내부 자동화 레드팀 모델 GPT-Red를 공개했다.

  2. GPT-Red는 자기 대결 강화학습으로 공격 프롬프트를 만들며, 실제 제품 훈련에도 활용됐다.

  3. 회사에 따르면 GPT-5.6 Sol은 어려운 프롬프트 인젝션 벤치마크에서 이전 모델보다 실패가 크게 줄었다.

  4. OpenAI는 GPT-Red를 배포 제품과 분리해 두고, 인간 레드팀을 보완하는 안전성 테스트 확장 수단으로 본다.

원문 보기