모델
verified · type: how-to · verified: 2026-07 · review: 30d · updated: 2026-07-25 · [model, comparison]

어떤 모델을 써야 하나?

models-overview 의 표를 "실제 결정"으로 바꾸는 문서. 작업마다 필요한 판단이다. 원칙 하나: 품질 기준을 넘는 가장 싼 티어를 골라라 — 반사적으로 플래그십 집지 마라.

⚠️ 2026-07-25 재검증: 최고 코딩·에이전트 기본값이 Claude Opus 5(claude-opus-5)로 올라갔다 — 이전의 Opus 4.8 을 대체한다. 그리고 Gemini 3.5 Pro 는 아직 공식 출시 전이다: Google 공식 모델 목록에 없고 2026-07-21 기준 "파트너 테스트 중"이며, 현행 릴리스 Pro 는 Gemini 3.1 Pro 다. 아래 Gemini 3.5 Pro 언급과 2M 컨텍스트·오디오/비디오 스펙은 (재확인 필요).


Step 1 — 작업 난이도 분류

난이도 예시 티어 → 모델
단순/대량 분류, 추출, 요약, 라우팅, 초안 저가: Haiku 4.5, GPT-5.6 Luna, Gemini Flash, DeepSeek V4 Flash
균형/프로덕션 대부분 앱 워크로드, RAG, 챗, 중간 추론 중간: Sonnet 5, GPT-5.6 Terra, Gemini 3.1 Pro
최난도 장기 에이전트, 복잡한 코딩, 깊은 추론, 새로운 문제 프리미엄: Opus 5, GPT-5.6 Sol, Fable 5, Gemini 3.5 Pro

Step 2 — 작업 축(axis)으로 가중

  • 코딩 / 에이전트 → Opus 5, Sonnet 5, GPT-5.6 Sol, Qwen 3.7 Max 다 강함
  • 멀티모달 (이미지/오디오/비디오) → Gemini 라인이 리더. Gemini 3.5 Pro 가 오디오/비디오 깊이 추가
  • 아주 긴 컨텍스트 → 대부분 플래그십이 1M. Gemini 3.5 Pro 는 2M. ⚠️ 롱컨텍스트 서차지 주의 (OpenAI >272K 는 요청 전체 재과금, Google >200K 는 입력 ~2배)
  • 비용/셀프호스트/데이터 레지던시 → 오픈웨이트: DeepSeek V4 (MIT), Mistral Large 3 (Apache 2.0). ⛔ Qwen 3.7 Max 는 런칭 시 오픈 아님
  • 토큰당 최저가 → DeepSeek V4 Flash ($0.14/$0.28) 가 닫힌 플래그십들보다 압도적으로 쌈

Step 3 — 실전 휴리스틱 ⭐

  1. 생각한 것보다 한 티어 아래에서 시작하라. eval 이 실패할 때만 올린다.
  2. 티어를 바꾸기 전에 모델 안의 effort/thinking 노브로 비용↔품질을 먼저 조절하라 (Anthropic output_config.effort, OpenAI reasoning.effort).
  3. 에이전트 루프에서는 프리미엄-고effort 가 오히려 총비용이 쌀 때가 많다 — 중간 모델이 여러 턴을 헤매는 것보다.
  4. 프롬프트 캐싱 + 배치로 비용을 50~90% 후려칠 수 있다 → 스티커 가격 비교 전에 이걸 먼저 반영하라. (prompt-caching)
  5. 오픈웨이트는 볼륨 + 인프라가 있고, 데이터 통제가 필요하거나, 토큰당 비용이 0 이길 원할 때 말이 된다. 아니면 호스팅 플래그십이 편의성에서 이긴다.

결정 표 — 필요 → 손 뻗을 것

필요 손 뻗을 것
저렴하게 대량 분류/추출/요약 Haiku 4.5 / Luna / Gemini Flash / DeepSeek V4 Flash
프로덕션 앱 기본값 (가성비) Sonnet 5 / GPT-5.6 Terra / Gemini 3.1 Pro
최고 코딩·에이전트 Opus 5 (기본), 최난도면 Fable 5 / GPT-5.6 Sol
멀티모달 Gemini 3.5 Pro / 3.1 Pro
2M 컨텍스트 Gemini 3.5 Pro
셀프호스트/데이터통제 DeepSeek V4 (MIT) / Mistral Large 3 (Apache 2.0)
절대 최저 토큰가 DeepSeek V4 Flash

참고