실제 에이전트 작업에서 로컬 모델 6개를 테스트해 봤다. 최고 점수는 50%였다.
I Tested 6 Local Models on Real Agent Tasks. The Best Scored 50%.

TL;DR AI
1분핵심 요약
6개의 로컬 모델을 평가한 결과, 뛰어난 코딩 성능이 에이전트 작업 성공으로 이어지지 않는 것으로 나타났다.
SmolLM3-3B가 50%로 가장 높았고, Phi-4-mini·Qwen2.5-Coder-14B·Llama 3.1-8B는 코드 벤치마크 대비 성능이 크게 떨어졌다.
이번 커스텀 벤치마크는 도구 선택, 연쇄 호출, 인자 전달, 그리고 사용할 도구가 없을 때 침묵하는지까지 점검했다.
약 100줄 규모의 프록시가 텍스트 기반 도구 출력을 OpenAI 스타일의 tool call로 변환해 평가했으며, 코딩 실력과 에이전트 준비도 사이의 격차를 보여줬다.
