OpenSkillEval: LLM 에이전트를 위한 오픈 스킬 생태계 자동 감사
OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
TL;DR AI
1분핵심 요약
연구진은 LLM 에이전트가 커뮤니티가 만든 스킬을 실제에 가까운 과제에서 얼마나 잘 활용하는지 자동으로 평가하는 OpenSkillEval을 제안했다.
이 프레임워크는 실제 아티팩트에서 과제를 생성하고, 다섯 개 응용 분야에서 스킬이 결합된 에이전트와 개별 스킬을 평가한다.
600개 이상의 과제와 30개의 오픈소스 스킬을 실험한 결과, 스킬이 있다고 해서 에이전트 성능이 항상 좋아지지는 않았다.
성능 향상 폭은 모델, 프레임워크, 스킬에 따라 크게 달라져, 스킬 추가가 자동으로 유리한 것은 아님을 보여준다.
