PRISM: LLM 동료 리뷰어 평가를 위한 다차원 벤치마크
PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers
TL;DR AI
1분핵심 요약
연구진은 AI 동료 심사자를 깊이, 새로움 평가, 결함 식별, 건설성 등으로 평가하는 벤치마크 PRISM을 제안했다.
PRISM은 주장 마이닝과 검색 기반 검증을 활용해 단순한 문장 비교보다 더 엄격하게 리뷰 품질을 점수화한다.
ICLR, ICML, NeurIPS의 인간 리뷰와 5개 자동 심사 시스템을 시험한 결과, LLM은 일부 항목에서 인간과 비슷한 성능을 보였다.
하지만 어떤 시스템도 모든 기준에서 인간 리뷰어를 일관되게 따라잡지는 못해, 현재 LLM 동료 심사자의 한계가 드러났다.
