더 이상 감에 의존하지 마세요: 17개 이상의 에이전트 프레임워크에서 작동하는 LLM 평가 프레임워크를 만들었습니다
Stop Flying Blind: We Built an LLM Evaluation Framework That Works Across 17+ Agent Frameworks

TL;DR AI
1분핵심 요약
Custom Evals는 17개 이상 에이전트 프레임워크의 LLM 및 에이전트 출력을 평가하는 경량 오픈소스 프레임워크다.
결정적 체크, LLM 심판, NLP 유사도, OCR/문서 메트릭의 4개 계층으로 점수를 매긴다.
백엔드, 대시보드, 필수 테스트 러너 없이 동작하도록 설계됐다.
배포 전 여러 스택에서 동작을 일관되게 검증하려는 팀의 생산 환경 공백을 메운다.
