MLS-Bench: 더 나은 AI 구축에 대한 AI 시스템의 종합적이고 엄격한 평가
MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI
TL;DR AI
1분핵심 요약
연구진은 12개 분야의 140개 과제로 구성된 MLS-Bench를 공개해, AI가 일반화되고 확장 가능한 ML 방법을 실제로 발명할 수 있는지 평가하도록 했다.
논문은 현재의 AI 에이전트가 대체로 인간이 설계한 방법에 못 미치며, 진정한 발명보다 엔지니어링식 튜닝에 더 강하다고 보여준다.
더 많은 연산, 탐색, 긴 컨텍스트만으로는 과학적 발견 능력의 격차를 메우지 못한다는 점도 확인했다.
또한 지속적 평가를 위한 데이터, 코드, 커뮤니티 플랫폼도 함께 공개했다.
