pile·
AI / ML·vercel-blogVercel Blog·

Vercel AI Gateway에서 Gemini 3 Flash 사용 가능

Google의 Gemini 3 Flash 모델이 Vercel AI Gateway에 출시됐다. Gemini 2.5 Pro보다 대부분의 벤치마크에서 우위를 보이면서 3배 빠른 속도와 30% 적은 토큰 사용량을 달성했다. 주목할 점은 thinking 모드를 지원해 고수준 추론과 flash-level 지연 시간을 함께 제공한다는 것이다.

핵심 포인트
  • **벤치마크**: Gemini 2.5 Pro 대비 대부분 벤치마크에서 우위, 토큰 30% 절감, 3배 빠름
  • **Thinking 모드 지원**: `thinkingLevel: 'high'`와 `includeThoughts: true` 옵션으로 추론 과정 포함 응답
  • **모델 ID**: `google/gemini-3-flash`, AI SDK에서 즉시 사용 가능
상세 정리

Gemini 3 Flash는 Gemini 3의 Pro급 추론 능력을 Flash 수준의 지연 시간과 비용 효율로 제공한다. Gemini 2.5 Pro 대비 30% 적은 토큰으로 처리하며 3배 빠르다.

AI SDK를 통한 사용 예시:

```tsx import { streamText } from 'ai'; const result = streamText({ model: 'google/gemini-3-flash', prompt: 'Your prompt here', providerOptions: { google: { thinkingLevel: 'high', includeThoughts: true }, }, }); ```

`thinkingLevel: 'high'`는 모델이 내부 추론 단계를 더 깊이 수행하도록 지시한다. `includeThoughts: true`를 설정하면 모델의 사고 과정이 응답에 포함돼 디버깅이나 사용자에게 추론 흐름을 보여줄 때 유용하다.

AI Gateway를 통해 사용하면 별도 Google Cloud 계정 없이 Vercel 대시보드에서 사용량·비용을 통합 모니터링할 수 있다.

왜 읽나Gemini 2.5 Pro를 쓰다 비용이나 지연 시간이 부담스러웠던 팀에게 실질적인 대안이다. thinking 모드와 Flash 속도를 함께 제공하는 조합은 기존 Flash 모델로는 어려웠던 추론 집약적 작업에도 적용할 수 있다. `thinkingLevel`과 `includeThoughts` 옵션은 다른 Google Gemini 모델에도 동일하게 적용되는 AI SDK 패턴이다.
vercel-blog
Vercel Blog 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2