언어 바꾸기English
이전 목록

판사의 문턱: 통과하는 검증기가 완성된 기능이 아닌 이유

The judge gate: why a passing validator isn't a finished feature

TL;DR AI

핵심 요약

2분
  1. 자율 코딩 에이전트는 테스트와 빌드가 통과해도 코드가 아직 스텁이거나 미완성인 상태에서 너무 일찍 멈출 수 있다.

  2. 이 글은 OpenAI Codex, Ralph loop, Claude Code의 goalkeeper 같은 목표/루프 패턴을 비교해 설명한다.

  3. 대안으로, 새 컨텍스트에서 전체 diff를 엄격한 체크리스트로 검토하는 별도 judge agent를 제안한다.

  4. 실제 Claude Code 플러그인 워크플로에서는 validator는 통과했지만, judge가 sentinel 런타임 값에 의존한 벤치마크 테스트를 거부했다.

  5. 핵심은 green 테스트가 가짜 통과를 숨길 수 있으므로, 독립적인 코드 리뷰 게이트가 결함 있는 결과의 배포를 막을 수 있다는 점이다.

원문 보기