오픈웨이트 모델 지도
데이터 주권·비용·커스터마이징 때문에 Claude 대신(또는 병행) 오픈웨이트를 검토할 때 연다. 핵심 질문은 "라이선스가 상업적 사용을 허락하나"와 "이걸 내가 셀프호스트할 수 있나".
신선도 경고. 아래는 전부 비(非)Anthropic 프로바이더 정보다. 공식 HF 모델카드/API 문서로 교차확인한 것만 [HIGH]로 표기했고, aggregator 단일 출처는 "(재확인 필요)"를 붙였다. 오픈웨이트 판은 몇 주 단위로 바뀐다 — 실제 채택 전 각 사 공식 페이지를 다시 확인하라.
현행 오픈웨이트 지도 (verified 2026-07)
| 모델 | 총/활성 파라미터 | 컨텍스트 | 라이선스 | 상업적 사용 | 셀프호스트 현실성 |
|---|---|---|---|---|---|
| DeepSeek V4-Pro | 1.6T / 49B (MoE) | 1M | MIT | 자유 | 멀티 GPU 노드 — 사실상 API |
| DeepSeek V4-Flash | 284B / 13B | 1M | MIT | 자유 | 고사양 노드 필요 |
| Qwen3.5-397B-A17B | 397B / 17B | native 262K(1M 확장?) | Apache 2.0 | 자유 | 대형, but 0.8B~397B 라인업 넓음 |
| gpt-oss-120b | 117B / 5.1B | 128K | Apache 2.0 | 자유 | 단일 80GB H100 (mxfp4) |
| gpt-oss-20b | 21B / 3.6B | 128K | Apache 2.0 | 자유 | 16GB RAM — 로컬 최적 |
| Mistral Large 3 | 675B / 41B | (미표기) | Apache 2.0 (재확인 필요) | 자유(추정) | 대형 노드 |
| Mistral Small 4 | 119B / 6B | (미표기) | Apache 2.0 (재확인 필요) | 자유(추정) | 중형 |
| Llama 4 Scout | 109B / 17B | 최대 10M 주장 | Llama 4 Community | 7억 MAU↑ 별도계약 | 단일 고급 GPU |
| Llama 4 Maverick | 400B / 17B | — | Llama 4 Community | 위와 동일 | 대형 |
| Kimi K3 | 2.8T / (16 of 896 exp) | 1M | Modified MIT | 제약 있음 | 초대형 — API 전용 |
- DeepSeek V4는 2026-04-24 MIT로 공개. MoE(층당 256 routed + 1 shared expert, top-8) + CSA/HCA 하이브리드 어텐션. [HIGH]
- gpt-oss는 OpenAI가 GPT-2 이후 처음 낸 오픈웨이트(2025-08-05). MoE 가중치에만 4-bit MXFP4 양자화 적용. → quantization. [HIGH]
- Qwen3.5는 0.8B~397B 9개 사이즈 + 공식 FP8/GPTQ-Int4 양자화본을 HF에 함께 공개 — 로컬 선택지가 가장 넓다. [HIGH]
- Meta의 가장 최근 공식 릴리스는 Llama 4(2025-04-05). Behemoth(~2T)는 미출시(학습 중). "Llama 5"는 존재하지 않는다 — 아래 인용 금지 박스 참조.
- Kimi K3: 2026-07-16 발표됐으나 전체 가중치 배포는 2026-07-27 예정 — 2026-07-25 현재 아직 미배포일 수 있다 (재확인 필요).
라이선스: 이게 채택의 핵심
| 그룹 | 모델 | 실무 의미 |
|---|---|---|
| 완전 permissive | DeepSeek V4(MIT), gpt-oss·Qwen3.5/3.6·Mistral(Apache 2.0) | 상업적 사용·재배포·파인튜닝 전부 자유. MIT는 출력으로 타 LLM 학습까지 명시 허용 |
| 커스텀/제약 | Llama 4 Community, Kimi Modified MIT, MiniMax Community, Nemotron OpenMDW | source-available일 뿐. Llama 4는 월 활성 7억 초과 기업 별도 계약 |
- "오픈소스"라고 뭉뚱그리지 마라. Apache 2.0/MIT는 진짜 자유롭지만, Llama Community License는 대기업 제약과 acceptable-use 정책이 붙은 source-available이다.
- 사내 제품에 임베드할 거면 라이선스 원문(모델카드 License 필드)을 직접 확인하라. 여기 표기 중 일부는 aggregator 경유라 "(재확인 필요)"로 남겼다.
셀프호스트 vs 호스팅 API — 언제 뭘 고르나
| 상황 | 선택 | 이유 |
|---|---|---|
| 고객 데이터가 외부로 나가면 안 됨 (의료·금융·사내 기밀) | 셀프호스트 오픈웨이트 | 데이터 주권 — 프롬프트가 자사 인프라를 벗어나지 않음 |
| 특정 도메인에 파인튜닝 필요 | 셀프호스트(permissive 라이선스) | 가중치를 직접 튜닝. API 모델은 불가 |
| 대량·저지연 배치, 단가 극한 압축 | 셀프호스트 or 저가 오픈웨이트 API | 토큰당 단가가 프론티어 API보다 훨씬 낮음 |
| 최고 품질·복잡 추론·에이전트 | Claude 등 프론티어 API | 오픈웨이트 최상위도 프론티어 대비 여전히 격차. → model-choice-decision-guide |
| 운영 인력·GPU 없음, 빨리 붙이고 싶음 | 오픈웨이트 호스팅 API | DeepSeek/Together/Fireworks 등이 호스팅. 셀프호스트 없이 저단가 |
| 로컬 프로토타이핑·오프라인 | gpt-oss-20b(16GB RAM) | 노트북급에서 구동. 실험/PoC에 최적 |
- 셀프호스트라고 무조건 싸지 않다. 1.6T(DeepSeek)·2.8T(Kimi)급은 멀티 GPU 노드가 필요해 사실상 API/클라우드 추론이 답이다. "셀프호스트 가능"과 "셀프호스트 경제적"은 다르다.
- 오픈웨이트라도 대부분은 셀프호스트 대신 제3자 호스팅 API로 쓴다 — 가중치가 공개돼 여러 벤더가 경쟁 호스팅하므로 단가가 낮아지는 게 실익이다.
함정 (gotcha)
- "Llama 5"를 쓰지 마라. 존재하지 않는다. 저신뢰 블로그 밈이다 (아래 박스).
- DeepSeek 활성 파라미터 표기 혼란: HF 조직 페이지가 Pro 862B/Flash 158B로 보이지만, 공식 스펙은 1.6T/284B(total)다. 체크포인트 표기와 논리 파라미터가 달라 보이는 것 — 스펙 인용 시 공식 모델카드 기준을 쓰라.
- DeepSeek V4 API 가격은 확정 인용 금지. aggregator 간 값이 엇갈린다(V4-Flash 출력 $0.242~$0.28/M 등). 공식 가격표는 이미지라 1차 미확인. 실제 견적은 벤더 콘솔에서 확인하라.
- Qwen3.5 컨텍스트: native 262K인지 1M 확장인지 출처마다 다르다 (재확인 필요).
- 컨텍스트 "10M 토큰"(Llama 4 Scout) 같은 수치는 주장값이다. 실제 유효 컨텍스트와 다를 수 있다. → tokens-and-context-windows
- 양자화 배포본을 그냥 쓰지 마라. gpt-oss의 16GB RAM 구동, Qwen의 GPTQ-Int4 등은 양자화 전제다. 정밀도 손실을 감안하라. → quantization
⛔ 인용 금지 박스. "Meta Llama 5" (600B 파라미터, 5M 토큰 컨텍스트, "Recursive Self-Improvement" 주장)는 조작 의심 정보다. 스펙·존재를 인용하지 마라. 출처가 ragyfied.com, chroniclejournal MarketMinute, startuphub.ai 등 저신뢰 블로그/보도자료뿐이고, Wikipedia(2026-04 반영)는 Llama 5 미발표·미출시를 확인한다. Meta는 대신 Muse Spark(폐쇄형)를 냈다. 마찬가지로 GLM 5.2 / MiniMax M3 / Nemotron 3 Ultra의 스펙·가격, Qwen3.8-Max 2.4T(프리뷰, 오픈웨이트 미배포)도 단일 저신뢰 출처라 확정 인용하지 마라.
참고
- models-overview — 전체 모델 지형 요약과 이 페이지의 상위 맥락
- model-choice-decision-guide — 오픈웨이트 vs 프론티어 API를 언제 고르나
- claude-family — 프론티어 비교 기준(품질·에이전트에서 여전히 우위)
- quantization — MXFP4/GPTQ-Int4 등 셀프호스트 필수 개념
- tokens-and-context-windows — "1M/10M 컨텍스트" 주장값 해석
출처: 비Anthropic 프로바이더 정보. DeepSeek/gpt-oss/Qwen/Llama는 공식 HF 모델카드·API 문서·Wikipedia로 교차확인 [HIGH], Mistral·Kimi·기타는 aggregator 경유 [MED]. 가격·미배포 모델은 "(재확인 필요)". 원본 → 2026-07-25-open-weight-models