Vercel이 2025년 10월 20일 AWS us-east-1 리전 장애로 인해 두 차례 독립적인 서비스 중단을 겪었다. 첫 번째는 글로벌 캐시 인프라 cascading failure 로 전체 트래픽의 22%에 영향을 준 트래픽 장애이고, 두 번째는 피처 플래그 공급자 장애가 Kubernetes 클러스터 자원을 고갈시켜 대시보드·API·CLI·로그 처리가 전면 중단된 컨트롤 플레인 장애다.
핵심 포인트- 1차 인시던트: Regional Cache 서비스가 cascading failure 를 일으켜 정적 자산·ISR 콘텐츠·함수 호출이 중단됐고 트래픽 22%가 영향을 받았다.
- 2차 인시던트: 피처 플래그 공급자 타임아웃이 Kubernetes 클러스터 리소스를 고갈시켜 대시보드·API·CLI·런타임 로그까지 연쇄 다운됐다.
- 두 인시던트는 같은 AWS us-east-1 장애에서 비롯됐지만 다른 경로로 전파돼 독립적으로 진행됐다.
- Vercel의 리전 캐시 설계가 리전 장애 시 캐시 자체 복구를 가정하고 있었는데, 이번에 그 가정이 깨졌다.
- "단 하나의 요청도 빠뜨리지 않겠다"는 Vercel의 약속이 지켜지지 못했음을 공식 인정했다.
상세 정리- 배경: Vercel iad1 리전이 AWS us-east-1 에 위치하며, 리전 캐시가 독립적으로 복구된다는 설계 가정에 의존하고 있었다.
- 1차 인시던트 타임라인: 06:55 UTC 자동 알림 발동 → 07:15 iad1 트래픽 우회 시작 → 07:25 백업 리전으로 함수 호출 우회 → 07:45 Regional Cache cascading failure 발생, 트래픽 22% 영향 → 08:18 정적 파일 서빙 복구 → 09:21 단일 리전 고객 완전 복구.
- 1차 피해 범위: 정적 자산 서빙, Regional Cache 인프라, us-east-1 전용 배포의 함수 호출, 엣지 캐싱 없는 ISR 콘텐츠.
- cascading failure 원인: 메타데이터는 전 세계에 배포 중이었지만 Regional Cache 서비스가 리전 장애 중에도 가용성을 유지하지 못했다.
- 2차 인시던트 발생: 19:20 UTC 1차 장애의 여파로 피처 플래그 공급자가 중단됐고, 타임아웃 요청이 Kubernetes 클러스터 리소스를 전부 소진했다.
- 2차 피해 범위: 대시보드, API, CLI, 로그 처리 전면 중단.
- 2차 복구 타임라인: 19:41 원인 파악(피처 플래그 공급자 타임아웃) → 19:48 타임아웃 단축 완화 배포 → 03:30 대시보드·API 완전 복구 → 06:21 런타임 로그 완전 복구.
- 사후 조치: 시스템적 장애 모드 완화 방안 개발 및 리전 장애 리허설 강화를 약속했으나 구체적 기술 수정 내용은 미공개.
왜 읽나AWS 단일 리전 장애가 캐시 레이어와 컨트롤 플레인을 동시에 어떻게 cascading failure 로 이끄는지, 피처 플래그 의존 서비스 타임아웃이 Kubernetes 자원 고갈로 이어지는 경로를 인시던트 타임라인과 함께 파악하고 싶은 인프라·SRE 엔지니어에게 적합.