언어 바꾸기English
이전 목록

새 벤치마크, Claude Mythos와 GPT-5.5가 실제 브라우저 취약점 공격 코드를 자율적으로 개발할 수 있음 보여줘

New benchmark shows Claude Mythos and GPT-5.5 can develop real browser exploits autonomously

TL;DR AI

핵심 요약

1분
  1. 카네기멜론 연구진이 구글 V8 취약점을 대상으로, 원격 코드 실행까지의 진척도를 측정하는 벤치마크 ExploitBench를 공개했다.

  2. 평가 결과 Claude Mythos Preview는 GPT-5.5보다 보조형·완전자율형 모두에서 크게 앞섰고, 41개 취약점 중 21개에서 최상위 단계에 도달했다.

  3. 반면 GPT-5.5는 2개에 그쳤으며, Mythos는 훨씬 높은 비용을 치렀다.

  4. 이번 벤치마크는 이미 알려진 V8 버그만 사용해 새로운 취약점 발견이나 완전한 무기화는 아직 평가하지 않는다.

  5. 그럼에도 최전선 AI 모델이 실제 공격용 보안 작업을 상당 부분 수행할 수 있다는 우려를 키우고 있다.

원문 보기