Google Gemini 패밀리
Gemini 를 실제로 붙이기 직전에 여는 문서 — 어떤 모델 ID 가 진짜 GA 인지, 200K 요율 함정은 어디인지, Claude 대신 언제 Gemini 를 쓰는지.
Google 은 non-Anthropic 프로바이더라 기본 신뢰도는 [MED]. 단 ai.google.dev·cloud.google.com 값은 1차 출처라 [HIGH] 로 표기한다. Anthropic 쪽 숫자는 models-overview·claude-family 가 최종 권위.
라인업 — GA 와 preview 를 헷갈리지 마라 (verified 2026-07)
핵심 함정 하나로 요약: Flash 계열은 3.6 까지 GA 됐지만, Pro 계열은 GA 최신이 gemini-2.5-pro 뿐이고 그 위는 gemini-3.1-pro-preview (preview) 가 최신이다.
| 모델 ID | 상태 | 위치 |
|---|---|---|
gemini-3.6-flash |
stable(GA) | 최신 Flash, 속도+지능 균형, agentic·멀티모달 |
gemini-3.5-flash |
stable(GA) | sustained frontier 지능 |
gemini-3.5-flash-lite / gemini-3.1-flash-lite |
stable(GA) | 가장 빠르고 저렴 |
gemini-2.5-pro |
stable(GA) | GA 로 존재하는 유일한 Pro — 복잡 추론·롱컨텍스트 |
gemini-2.5-flash / gemini-2.5-flash-lite |
stable(GA) | 가성비·최저가 |
gemini-3.1-pro-preview |
preview | 최신 Pro, "better thinking"·SWE·agentic 최적화 |
gemini-3-flash-preview, *-live-*, *-tts-* |
preview | 실시간 음성·번역·TTS 계열 |
⛔ DO-NOT-CITE 박스. "Gemini 3.5 Pro" 와 "Gemini 3 Pro (GA)" 는 애그리게이터(codersera·eesel·metacto·pricepertoken)만 주장하고
ai.google.dev공식 pricing/models 페이지에는 존재하지 않는다. "2M 토큰 컨텍스트 GA" 도 마찬가지로 공식 미확인 — 개별 모델 페이지는 전부 1M 만 노출한다. 이 세 가지는 코드·견적에 절대 넣지 마라. 재검증 과정에서 models-overview 에서 이미 제거됐다.
컨텍스트·스펙 — 전 모델이 동일 (verified 2026-07)
관측된 현행 GA/preview 모델은 입력 1,048,576 (=1M) / 출력 65,536 (=64K) 로 전부 같다. 입력 모달리티도 대체로 동일하게 넓다.
| 모델 | 입력(컨텍스트) | 출력 | knowledge cutoff | 입력 모달리티 |
|---|---|---|---|---|
gemini-2.5-pro |
1,048,576 | 65,536 | (미표기, 재확인 필요) | text·image·video·audio·PDF |
gemini-2.5-flash |
1,048,576 | 65,536 | January 2025 | text·image·video·audio |
gemini-2.5-flash-lite |
1,048,576 | 65,536 | January 2025 | +PDF (출력은 text) |
gemini-3.1-pro-preview |
1,048,576 | 65,536 | (미표기, 재확인 필요) | text·image·video·audio·PDF |
gemini-3.5-flash / gemini-3.6-flash |
1,048,576 | 65,536 | (미표기, 재확인 필요) | text·image·video·audio·PDF |
토큰·컨텍스트 개념은 tokens-and-context-windows 참고. 출력은 전부 text — 이미지·영상 생성은 별도 모델(gemini-*-image, Veo)이다.
가격 함정: 200K 경계에서 Pro 요율이 뛴다 (verified 2026-07)
Gemini Developer API 표준 티어, per 1M tokens. Pro 계열만 200K 토큰 경계에서 요율이 거의 2배가 된다. Flash/Flash-Lite 는 구간 구분 없이 단일 요율.
| 모델 | 입력 (표준) | 출력 (표준) |
|---|---|---|
gemini-2.5-pro |
$1.25 (≤200K) → $2.50 (>200K) | $10.00 → $15.00 |
gemini-3.1-pro-preview |
$2.00 (≤200K) → $4.00 (>200K) | $12.00 → $18.00 |
gemini-3.6-flash |
$1.50 | $7.50 |
gemini-3.5-flash |
$1.50 | $9.00 |
gemini-3.5-flash-lite |
$0.30 | $2.50 |
gemini-3.1-flash-lite |
$0.25 (text/img/video), $0.50 (audio) | $1.50 |
gemini-2.5-flash |
$0.30 | $2.50 |
gemini-2.5-flash-lite |
$0.10 | $0.40 (최저가) |
티어 배수: Batch/Flex = 표준 −50%, Priority = 표준 +80%. 예) 2.5 Pro Batch ≤200K = 입력 $0.625 / 출력 $5.00.
함정 정리: - 롱컨텍스트를 노리고 Pro 에 200K 넘게 밀어넣으면 입력·출력 요율이 통째로 상위 구간으로 점프한다. "1M 되니까 다 넣자"가 그대로 청구서가 된다. - 이 점프는 초과분만이 아니라 요청 전체 토큰에 상위 요율이 적용되는 형태로 관측됐다(구간별 rate). 대용량은 Flash 로 내리거나 청크를 200K 밑으로 쪼개는 게 1순위 레버.
Gemini Developer API vs Vertex AI (verified 2026-07)
숫자 자체는 대체로 같지만 표면이 다르다.
| 구분 | Gemini Developer API (ai.google.dev) |
Vertex AI (cloud.google.com) |
|---|---|---|
| 엔드포인트 | 단일 | Global vs Non-global 구분 (Non-global ≈ +10%) |
| audio 입력 | 요약표에 별도 요율 노출 덜 됨 | audio 입력을 별도 상위 요율로 명시 (예: 2.5 Flash audio 입력 $1.00 vs text $0.30) |
| 캐시 | 모델별 캐싱·저장 요율 | cached input = regular 대비 90% 할인 (2.5 Pro cached $0.13/$0.25) |
| 구세대 | 노출 적음 | gemini-2.0-flash·gemini-2.0-flash-lite 잔존 |
| 오류 응답 | — | 4xx/5xx 는 과금 안 함 |
Non-global 가격은 "2026-07-01 부터 적용"이라 지금(2026-08)은 실제 적용 중일 것 — 세부는 재확인 필요. Deep Research Agent(Vertex)는 $2/1M 입력, $12/1M 출력(캐시 없음).
Deep Think — API 종량이 아니다
gemini-3-deep-think 를 API 로 붙일 계획이면 멈춰라. blog.google [HIGH] 기준 Deep Think 는 Google AI Ultra 구독자에게 Gemini 앱에서만 독점 제공되는 기능이고, 일반 종량 과금 모델이 아니다. API 는 Vertex AI Early Access Program 으로만 열려 있다([MED], DeepMind/Pichai X 게시물). 프로덕션 종량 파이프라인의 기본 선택지가 아니라고 보면 된다.
멀티모달·롱컨텍스트 강점 (verified 2026-07)
- 네이티브 멀티모달 입력: 전 현행 모델이 text+image+video+audio+PDF 를 단일 모델에서 받는다. audio·video 가 토큰으로 직접 과금(오디오는 종종 상위 요율)돼 진짜 멀티모달 파이프라인이다. 개념은 multimodality 참고.
- 1M 컨텍스트: 긴 영상·대용량 코드베이스·다문서 분석이 2.5 Pro 의 핵심 마케팅 포인트.
- Live 계열(preview):
gemini-3.1-flash-live-preview·gemini-3.5-live-translate-preview·TTS → 실시간 음성·번역·합성 스트리밍. - 임베딩(
gemini-embedding-001, Gemini Embedding 2)은 image/audio/video 별도 요율까지 있다 — embeddings-and-vector-search 참고.
언제 Claude 대신 Gemini 를 쓰나
| 상황 | 선택 | 이유 |
|---|---|---|
| video/audio 를 입력으로 직접 처리 | Gemini | Claude 에 없는 네이티브 video·audio 입력 |
| 200K 이하 대량 저비용 처리 | Gemini Flash-Lite | 입력 $0.10 급, Claude Haiku($1)보다 저렴 |
| 실시간 음성·번역 스트리밍 | Gemini Live | 전용 preview 라인 |
| GCP/Vertex 에 이미 락인 | Gemini(Vertex) | 인프라·과금 통합 |
| 코딩·에이전트 주력, 매일 쓰는 도구 | Claude | Opus 5 기본값, thinking·strict tool use 성숙 |
| 200K 초과 롱컨텍스트를 자주 | 케이스별 | Gemini Pro 는 요율 점프, Claude 는 1M 단일 요율($5/$25) |
Claude 쪽 스펙은 claude-family·models-overview, 최종 선택 흐름은 model-choice-decision-guide. OpenAI 와의 비교는 openai-gpt-family.
참고
- claude-family — Claude 세대별 스펙·ID, Gemini 와 직접 비교할 때
- models-overview — 프로바이더 횡단 모델 표(소문 Pro 제거된 최신본)
- model-choice-decision-guide — 작업별 모델 선택 흐름
- openai-gpt-family — 3자 비교 시 GPT 쪽 레퍼런스
- multimodality — video·audio·PDF 입력 처리 개념
- embeddings-and-vector-search — Gemini 임베딩 모델 활용
- tokens-and-context-windows — 1M 컨텍스트·토큰 과금 기초
출처: Google 1차(ai.google.dev·cloud.google.com) 값은 [HIGH], 소비자 구독·Deep Think EAP 는 [MED]. 원본 → 2026-07-25-google-gemini-deep