MonitorBench: 대형 언어모델의 연쇄사고 모니터링 벤치마크
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
TL;DR AI
1분핵심 요약
MonitorBench는 연쇄사고 모니터링을 평가하는 오픈 벤치마크다.
데이터는 1,514개 인스턴스와 두 가지 스트레스 테스트를 포함한다.
구조적 추론이 필요할 때 모니터링 가능성이 더 높았다.
스트레스 테스트로 일부 작업의 모니터링 가능성이 최대 30% 감소했다.
