모델 업그레이드가 어떻게 우리의 추출 프롬프트를 조용히 망가뜨렸는가(그리고 우리가 이를 포착한 방법)
How a model upgrade silently broke our extraction prompt (and how we caught it)

TL;DR AI
1분핵심 요약
고객 지원 티켓 요약 프롬프트는 GPT-4o에서는 정상 동작했지만, GPT-4.1로 바뀐 뒤 urgency 필드가 조용히 이름이 바뀌었다.
JSON 파싱은 문제없이 통과해, 하위 로직이 모든 티켓을 자동으로 낮은 긴급도로 처리했고 결국 고객 불만으로만 발견됐다.
이 사례는 LLM을 교체할 때 출력이 눈에 띄지 않게 달라져 구조화된 워크플로를 망칠 수 있음을 보여준다.
모델 교체 전에 기준 비교 테스트와 CI 검사를 넣어 프롬프트 회귀를 잡아야 한다는 점을 강조한다.
