45분간 프로덕션 파드를 중단시킨 GKE 업그레이드
The GKE Upgrade That Took Down Our Production Pods for 45 Minutes

TL;DR AI
1분핵심 요약
GKE Standard의 자동 노드 풀 업그레이드 중 노드가 순차적으로 drain되며 파드가 evict돼 프로덕션 장애가 발생했다.
세션 검증 서비스와 레이트 리미팅 서비스는 각각 2개 복제본뿐이어서, eviction이 겹치자 일시적으로 가용성을 잃었다.
그 결과 약 45분 동안 API 요청이 느려지거나 실패했으며, 업그레이드가 영향을 준 노드를 지나가면서 정상화됐다.
이번 사례는 Pod Disruption Budget과 안전한 재스케줄링 설계가 없으면 자동 Kubernetes 업그레이드도 프로덕션에 영향을 줄 수 있음을 보여준다.

