어떤 모델을 써야 하나?
models-overview 의 표를 "실제 결정"으로 바꾸는 문서. 작업마다 필요한 판단이다. 원칙 하나: 품질 기준을 넘는 가장 싼 티어를 골라라 — 반사적으로 플래그십 집지 마라.
⚠️ 2026-07-25 재검증: 최고 코딩·에이전트 기본값이 Claude Opus 5(
claude-opus-5)로 올라갔다 — 이전의 Opus 4.8 을 대체한다. 그리고 Gemini 3.5 Pro 는 아직 공식 출시 전이다: Google 공식 모델 목록에 없고 2026-07-21 기준 "파트너 테스트 중"이며, 현행 릴리스 Pro 는 Gemini 3.1 Pro 다. 아래 Gemini 3.5 Pro 언급과 2M 컨텍스트·오디오/비디오 스펙은 (재확인 필요).
Step 1 — 작업 난이도 분류
| 난이도 | 예시 | 티어 → 모델 |
|---|---|---|
| 단순/대량 | 분류, 추출, 요약, 라우팅, 초안 | 저가: Haiku 4.5, GPT-5.6 Luna, Gemini Flash, DeepSeek V4 Flash |
| 균형/프로덕션 | 대부분 앱 워크로드, RAG, 챗, 중간 추론 | 중간: Sonnet 5, GPT-5.6 Terra, Gemini 3.1 Pro |
| 최난도 | 장기 에이전트, 복잡한 코딩, 깊은 추론, 새로운 문제 | 프리미엄: Opus 5, GPT-5.6 Sol, Fable 5, Gemini 3.5 Pro |
Step 2 — 작업 축(axis)으로 가중
- 코딩 / 에이전트 → Opus 5, Sonnet 5, GPT-5.6 Sol, Qwen 3.7 Max 다 강함
- 멀티모달 (이미지/오디오/비디오) → Gemini 라인이 리더. Gemini 3.5 Pro 가 오디오/비디오 깊이 추가
- 아주 긴 컨텍스트 → 대부분 플래그십이 1M. Gemini 3.5 Pro 는 2M. ⚠️ 롱컨텍스트 서차지 주의 (OpenAI >272K 는 요청 전체 재과금, Google >200K 는 입력 ~2배)
- 비용/셀프호스트/데이터 레지던시 → 오픈웨이트: DeepSeek V4 (MIT), Mistral Large 3 (Apache 2.0). ⛔ Qwen 3.7 Max 는 런칭 시 오픈 아님
- 토큰당 최저가 → DeepSeek V4 Flash ($0.14/$0.28) 가 닫힌 플래그십들보다 압도적으로 쌈
Step 3 — 실전 휴리스틱 ⭐
- 생각한 것보다 한 티어 아래에서 시작하라. eval 이 실패할 때만 올린다.
- 티어를 바꾸기 전에 모델 안의 effort/thinking 노브로 비용↔품질을 먼저 조절하라 (Anthropic
output_config.effort, OpenAIreasoning.effort). - 에이전트 루프에서는 프리미엄-고effort 가 오히려 총비용이 쌀 때가 많다 — 중간 모델이 여러 턴을 헤매는 것보다.
- 프롬프트 캐싱 + 배치로 비용을 50~90% 후려칠 수 있다 → 스티커 가격 비교 전에 이걸 먼저 반영하라. (prompt-caching)
- 오픈웨이트는 볼륨 + 인프라가 있고, 데이터 통제가 필요하거나, 토큰당 비용이 0 이길 원할 때 말이 된다. 아니면 호스팅 플래그십이 편의성에서 이긴다.
결정 표 — 필요 → 손 뻗을 것
| 필요 | 손 뻗을 것 |
|---|---|
| 저렴하게 대량 분류/추출/요약 | Haiku 4.5 / Luna / Gemini Flash / DeepSeek V4 Flash |
| 프로덕션 앱 기본값 (가성비) | Sonnet 5 / GPT-5.6 Terra / Gemini 3.1 Pro |
| 최고 코딩·에이전트 | Opus 5 (기본), 최난도면 Fable 5 / GPT-5.6 Sol |
| 멀티모달 | Gemini 3.5 Pro / 3.1 Pro |
| 2M 컨텍스트 | Gemini 3.5 Pro |
| 셀프호스트/데이터통제 | DeepSeek V4 (MIT) / Mistral Large 3 (Apache 2.0) |
| 절대 최저 토큰가 | DeepSeek V4 Flash |
참고
- 전체 표·가격 → models-overview
- 추론모델은 프롬프팅 규칙이 다름 → reasoning-vs-standard-models
- 비용 절감 메커니즘 → prompt-caching
- 지식 주입이 필요하면 모델보다 RAG/파인튜닝 결정 을 먼저