pile·
AI / ML·vercel-blogVercel Blog·

Vercel AI Gateway에서 모델별 실시간 성능 메트릭 API 제공 시작

Vercel AI Gateway가 수백 개 LLM 모델의 실시간 지연·처리량 메트릭을 대시보드와 REST API로 노출하기 시작했다. 어느 공급자에서 동일 모델을 쓸 때 성능이 더 나은지를 코드 한 줄로 확인할 수 있다.

핵심 포인트
  • 모델별·공급자별 P50/P95 지연(ms)과 처리량(초당 토큰)을 시간당 갱신되는 실시간 데이터로 제공한다.
  • REST API 엔드포인트 `ai-gateway.vercel.sh/v1/models/{creator}/{model}/endpoints`로 JSON 응답을 조회할 수 있다.
  • 응답은 `latency_last_1h.p50`, `p95`, `throughput_last_1h.p50`, `p95` 구조로 공급자별 비교가 가능하다.
  • AI Gateway 대시보드에서도 정렬 가능한 컬럼으로 모델 간 성능을 시각적으로 비교할 수 있다.
상세 정리
  • 배경: LLM 공급자가 많아지면서 동일 모델도 어느 API 공급자를 쓰느냐에 따라 지연과 처리량 차이가 크다. 이를 실측 데이터 없이 선택하기 어려웠다.
  • 메트릭 범위: 수백 개 모델, 공급자별(OpenAI, Anthropic, AWS Bedrock, Azure, Google Vertex 등) 분리 집계.
  • 갱신 주기: 매 시간 업데이트 — 실시간 순간 스파이크가 아닌 1시간 집계 기준.
  • API 형식: `GET ai-gateway.vercel.sh/v1/models/{creator/model-name}/endpoints` 호출 시 각 공급자 엔드포인트별로 `{latency_last_1h: {p50, p95}, throughput_last_1h: {p50, p95}}` JSON 반환.
  • 활용 패턴: 모델 선택 시 API로 p50 지연이 가장 낮은 공급자를 자동 선택하거나, 장애 조치(failover) 로직에 성능 기준을 추가하는 데 쓸 수 있다.
  • 전체 모델 목록 조회: `/v1/models` 엔드포인트로 지원 모델 전체 리스트 확인 가능.
왜 읽나여러 LLM 공급자를 비교하거나 최적 공급자를 자동 선택하는 라우팅 로직이 필요한 AI 인프라 엔지니어에게 실측 기반 공급자 선택 기준 레퍼런스.
vercel-blog
Vercel Blog 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2