A2RBench: 형식적으로 검증 가능한 추상적 추론 벤치마크 생성을 위한 자동 패러다임
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation
TL;DR AI
1분핵심 요약
연구진은 추상적 추론 과제를 자동으로 생성·확장하고, 프로그램 검증으로 정답의 유일성을 보장하는 A2RBench를 공개했다.
이 벤치마크는 암기 이상의 능력을 평가할 수 있도록, 확장 가능하고 검증 가능한 방식으로 설계됐다.
실험 결과, 주요 LLM들은 추상 추론에서 여전히 인간보다 뒤처졌고 특히 3D 과제에서 약했다.
이번 연구는 최신 모델의 추론 한계를 드러내는 동시에, 이를 체계적으로 시험할 수 있는 방법을 제시한다.
