모델
verified · type: entity · verified: 2026-07 · review: 30d · updated: 2026-08-01 · [model]

Google Gemini 패밀리

Gemini 를 실제로 붙이기 직전에 여는 문서 — 어떤 모델 ID 가 진짜 GA 인지, 200K 요율 함정은 어디인지, Claude 대신 언제 Gemini 를 쓰는지.

Google 은 non-Anthropic 프로바이더라 기본 신뢰도는 [MED]. 단 ai.google.dev·cloud.google.com 값은 1차 출처라 [HIGH] 로 표기한다. Anthropic 쪽 숫자는 models-overview·claude-family 가 최종 권위.


라인업 — GA 와 preview 를 헷갈리지 마라 (verified 2026-07)

핵심 함정 하나로 요약: Flash 계열은 3.6 까지 GA 됐지만, Pro 계열은 GA 최신이 gemini-2.5-pro이고 그 위는 gemini-3.1-pro-preview (preview) 가 최신이다.

모델 ID 상태 위치
gemini-3.6-flash stable(GA) 최신 Flash, 속도+지능 균형, agentic·멀티모달
gemini-3.5-flash stable(GA) sustained frontier 지능
gemini-3.5-flash-lite / gemini-3.1-flash-lite stable(GA) 가장 빠르고 저렴
gemini-2.5-pro stable(GA) GA 로 존재하는 유일한 Pro — 복잡 추론·롱컨텍스트
gemini-2.5-flash / gemini-2.5-flash-lite stable(GA) 가성비·최저가
gemini-3.1-pro-preview preview 최신 Pro, "better thinking"·SWE·agentic 최적화
gemini-3-flash-preview, *-live-*, *-tts-* preview 실시간 음성·번역·TTS 계열

DO-NOT-CITE 박스. "Gemini 3.5 Pro" 와 "Gemini 3 Pro (GA)" 는 애그리게이터(codersera·eesel·metacto·pricepertoken)만 주장하고 ai.google.dev 공식 pricing/models 페이지에는 존재하지 않는다. "2M 토큰 컨텍스트 GA" 도 마찬가지로 공식 미확인 — 개별 모델 페이지는 전부 1M 만 노출한다. 이 세 가지는 코드·견적에 절대 넣지 마라. 재검증 과정에서 models-overview 에서 이미 제거됐다.


컨텍스트·스펙 — 전 모델이 동일 (verified 2026-07)

관측된 현행 GA/preview 모델은 입력 1,048,576 (=1M) / 출력 65,536 (=64K) 로 전부 같다. 입력 모달리티도 대체로 동일하게 넓다.

모델 입력(컨텍스트) 출력 knowledge cutoff 입력 모달리티
gemini-2.5-pro 1,048,576 65,536 (미표기, 재확인 필요) text·image·video·audio·PDF
gemini-2.5-flash 1,048,576 65,536 January 2025 text·image·video·audio
gemini-2.5-flash-lite 1,048,576 65,536 January 2025 +PDF (출력은 text)
gemini-3.1-pro-preview 1,048,576 65,536 (미표기, 재확인 필요) text·image·video·audio·PDF
gemini-3.5-flash / gemini-3.6-flash 1,048,576 65,536 (미표기, 재확인 필요) text·image·video·audio·PDF

토큰·컨텍스트 개념은 tokens-and-context-windows 참고. 출력은 전부 text — 이미지·영상 생성은 별도 모델(gemini-*-image, Veo)이다.


가격 함정: 200K 경계에서 Pro 요율이 뛴다 (verified 2026-07)

Gemini Developer API 표준 티어, per 1M tokens. Pro 계열만 200K 토큰 경계에서 요율이 거의 2배가 된다. Flash/Flash-Lite 는 구간 구분 없이 단일 요율.

모델 입력 (표준) 출력 (표준)
gemini-2.5-pro $1.25 (≤200K) → $2.50 (>200K) $10.00 → $15.00
gemini-3.1-pro-preview $2.00 (≤200K) → $4.00 (>200K) $12.00 → $18.00
gemini-3.6-flash $1.50 $7.50
gemini-3.5-flash $1.50 $9.00
gemini-3.5-flash-lite $0.30 $2.50
gemini-3.1-flash-lite $0.25 (text/img/video), $0.50 (audio) $1.50
gemini-2.5-flash $0.30 $2.50
gemini-2.5-flash-lite $0.10 $0.40 (최저가)

티어 배수: Batch/Flex = 표준 −50%, Priority = 표준 +80%. 예) 2.5 Pro Batch ≤200K = 입력 $0.625 / 출력 $5.00.

함정 정리: - 롱컨텍스트를 노리고 Pro 에 200K 넘게 밀어넣으면 입력·출력 요율이 통째로 상위 구간으로 점프한다. "1M 되니까 다 넣자"가 그대로 청구서가 된다. - 이 점프는 초과분만이 아니라 요청 전체 토큰에 상위 요율이 적용되는 형태로 관측됐다(구간별 rate). 대용량은 Flash 로 내리거나 청크를 200K 밑으로 쪼개는 게 1순위 레버.


Gemini Developer API vs Vertex AI (verified 2026-07)

숫자 자체는 대체로 같지만 표면이 다르다.

구분 Gemini Developer API (ai.google.dev) Vertex AI (cloud.google.com)
엔드포인트 단일 Global vs Non-global 구분 (Non-global ≈ +10%)
audio 입력 요약표에 별도 요율 노출 덜 됨 audio 입력을 별도 상위 요율로 명시 (예: 2.5 Flash audio 입력 $1.00 vs text $0.30)
캐시 모델별 캐싱·저장 요율 cached input = regular 대비 90% 할인 (2.5 Pro cached $0.13/$0.25)
구세대 노출 적음 gemini-2.0-flash·gemini-2.0-flash-lite 잔존
오류 응답 4xx/5xx 는 과금 안 함

Non-global 가격은 "2026-07-01 부터 적용"이라 지금(2026-08)은 실제 적용 중일 것 — 세부는 재확인 필요. Deep Research Agent(Vertex)는 $2/1M 입력, $12/1M 출력(캐시 없음).


Deep Think — API 종량이 아니다

gemini-3-deep-think 를 API 로 붙일 계획이면 멈춰라. blog.google [HIGH] 기준 Deep Think 는 Google AI Ultra 구독자에게 Gemini 앱에서만 독점 제공되는 기능이고, 일반 종량 과금 모델이 아니다. API 는 Vertex AI Early Access Program 으로만 열려 있다([MED], DeepMind/Pichai X 게시물). 프로덕션 종량 파이프라인의 기본 선택지가 아니라고 보면 된다.


멀티모달·롱컨텍스트 강점 (verified 2026-07)

  • 네이티브 멀티모달 입력: 전 현행 모델이 text+image+video+audio+PDF 를 단일 모델에서 받는다. audio·video 가 토큰으로 직접 과금(오디오는 종종 상위 요율)돼 진짜 멀티모달 파이프라인이다. 개념은 multimodality 참고.
  • 1M 컨텍스트: 긴 영상·대용량 코드베이스·다문서 분석이 2.5 Pro 의 핵심 마케팅 포인트.
  • Live 계열(preview): gemini-3.1-flash-live-preview·gemini-3.5-live-translate-preview·TTS → 실시간 음성·번역·합성 스트리밍.
  • 임베딩(gemini-embedding-001, Gemini Embedding 2)은 image/audio/video 별도 요율까지 있다 — embeddings-and-vector-search 참고.

언제 Claude 대신 Gemini 를 쓰나

상황 선택 이유
video/audio 를 입력으로 직접 처리 Gemini Claude 에 없는 네이티브 video·audio 입력
200K 이하 대량 저비용 처리 Gemini Flash-Lite 입력 $0.10 급, Claude Haiku($1)보다 저렴
실시간 음성·번역 스트리밍 Gemini Live 전용 preview 라인
GCP/Vertex 에 이미 락인 Gemini(Vertex) 인프라·과금 통합
코딩·에이전트 주력, 매일 쓰는 도구 Claude Opus 5 기본값, thinking·strict tool use 성숙
200K 초과 롱컨텍스트를 자주 케이스별 Gemini Pro 는 요율 점프, Claude 는 1M 단일 요율($5/$25)

Claude 쪽 스펙은 claude-family·models-overview, 최종 선택 흐름은 model-choice-decision-guide. OpenAI 와의 비교는 openai-gpt-family.


참고

출처: Google 1차(ai.google.dev·cloud.google.com) 값은 [HIGH], 소비자 구독·Deep Think EAP 는 [MED]. 원본 → 2026-07-25-google-gemini-deep