언어 바꾸기English
이전 목록

LongDS-Bench: 장기 지평 에이전틱 데이터 분석의 실패에 대하여

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

TL;DR AI

핵심 요약

1분
  1. LongDS는 6개 도메인의 실제 Kaggle 노트북 과제 68개와 2,225턴으로 AI 에이전트의 장기 데이터 분석 능력을 평가한 벤치마크다.

  2. 5개 주요 모델 중 최고 정확도는 48.45%에 그쳐, 긴 분석 흐름에서의 신뢰성이 아직 낮음을 보여줬다.

  3. 대화가 길어질수록 성능이 크게 떨어졌고, 대부분의 오류는 분석 상태를 추적·갱신하지 못한 데서 비롯됐다.

  4. 이번 결과는 실제 데이터 사이언스 업무를 안정적으로 돕기 위한 에이전트의 핵심 한계를 드러낸다.

원문 보기