pile·
AI / ML·vercel-blogVercel Blog·

Zo Computer: AI 신뢰성 20배 개선 — AI SDK + Gateway 도입기

8인 스타트업 Zo Computer가 AI 프로바이더 어댑터 난립 문제를 AI SDK + AI Gateway로 해결해 재시도율 20배 감소, P99 지연시간 38% 단축을 달성한 사례다. OpenAI, Anthropic, MiniMax, GLM, Fireworks 각각에 맞춘 커스텀 어댑터와 재시도 로직을 유지하는 부담을 단일 SDK 레이어로 대체했다.

핵심 포인트
  • 20배 재시도율 감소: 7.5% → 0.34%. 채팅 성공률 98% → 99.93%.
  • P99 지연시간 38% 단축: 131s → 81s.
  • 모델 배포 시간 120배 단축: ~60분 → 30초.
  • 핵심 문제 "어댑터의 죽음": 프로바이더별 커스텀 어댑터, 재시도·폴백 로직, 엣지 케이스 처리 유지 부담.
  • 해결 구조: AI SDK(프로바이더 통합 인터페이스) + AI Gateway(재시도·폴백 라우팅·프로바이더 상태 모니터링).
상세 정리
  • 도입 전 아키텍처: OpenAI, Anthropic, MiniMax, GLM, Fireworks 각각에 커스텀 어댑터 유지. 신규 모델 배포마다 주 단위 사이클.
  • AI SDK 역할: 프로바이더별 어댑터 코드 제거. 이미지 지원, 응답 정규화 표준화. 커스텀 어댑터 유지 보수 불필요.
  • AI Gateway 역할: 재시도·폴백 라우팅 인프라 레벨로 이관. 프로바이더 상태 자동 모니터링. 업타임 관리 자동화.
  • A/B 테스트 결과: 동일 트래픽을 Vercel 경유 vs 비경유로 동시 라우팅. 비Vercel 루트 오류율 10.38% vs Vercel 루트 0.45%.
  • MiniMax M2.5 지연시간: 평균 25.7% 개선, P95 46s → 34s (25% 단축).
  • 1.00 평균 시도 횟수 달성: 사실상 첫 요청에서 성공. 폴백 자동 처리로 사용자에게 투명.
  • 컨텍스트 윈도우 3.3배 확대: 신뢰성 향상으로 더 큰 요청을 안정적으로 처리 가능.
  • 트래픽 전환: A/B 테스트 종료 시점에 91.88%가 Vercel 경유.
  • 팀 효과: 인프라 유지 부담에서 제품 개발로 집중 전환. 2026년 백만 명 사용자 온보딩 목표에 집중.
왜 읽나멀티 프로바이더 LLM을 운영하며 재시도·폴백·지연시간 문제를 겪는 AI 백엔드 엔지니어에게 구체적 수치(재시도율 20배 감소)와 마이그레이션 접근법 제공.
vercel-blog
Vercel Blog 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2