GPT-Red: 견고성을 위한 자기개선의 열쇠
GPT-Red: Unlocking Self-Improvement for Robustness

TL;DR AI
1분핵심 요약
OpenAI는 프롬프트 인젝션 방어를 위해 내부 자동화 레드팀 모델 GPT-Red를 공개했다.
GPT-Red는 자기 대결 강화학습으로 공격 프롬프트를 만들며, 실제 제품 훈련에도 활용됐다.
회사에 따르면 GPT-5.6 Sol은 어려운 프롬프트 인젝션 벤치마크에서 이전 모델보다 실패가 크게 줄었다.
OpenAI는 GPT-Red를 배포 제품과 분리해 두고, 인간 레드팀을 보완하는 안전성 테스트 확장 수단으로 본다.



