SeClaw: 자율 에이전트 평가를 위한 명세 기반 보안 태스크 합성
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

TL;DR AI
1분핵심 요약
연구진은 구조화된 위험 명세에서 보안 과제를 생성하는 SeClaw 프레임워크를 제안했다.
SeClaw는 표준화된 Docker 기반 테스트베드에서 자율 LLM 에이전트를 재현 가능한 안전 시나리오로 평가한다.
이 프레임워크는 자원, 사용자 과제, 환경, 에이전트 행동에 걸친 위험 범위를 넓힌다.
최종 결과만이 아니라 위험한 실행 경로를 평가해, 안전성 측정을 더 체계적이고 확장 가능하게 만든다.
