모델
verified · type: entity · verified: 2026-07 · review: 30d · updated: 2026-07-25 · [model, cost-optimization]

오픈웨이트 모델 지도

데이터 주권·비용·커스터마이징 때문에 Claude 대신(또는 병행) 오픈웨이트를 검토할 때 연다. 핵심 질문은 "라이선스가 상업적 사용을 허락하나"와 "이걸 내가 셀프호스트할 수 있나".

신선도 경고. 아래는 전부 비(非)Anthropic 프로바이더 정보다. 공식 HF 모델카드/API 문서로 교차확인한 것만 [HIGH]로 표기했고, aggregator 단일 출처는 "(재확인 필요)"를 붙였다. 오픈웨이트 판은 몇 주 단위로 바뀐다 — 실제 채택 전 각 사 공식 페이지를 다시 확인하라.


현행 오픈웨이트 지도 (verified 2026-07)

모델 총/활성 파라미터 컨텍스트 라이선스 상업적 사용 셀프호스트 현실성
DeepSeek V4-Pro 1.6T / 49B (MoE) 1M MIT 자유 멀티 GPU 노드 — 사실상 API
DeepSeek V4-Flash 284B / 13B 1M MIT 자유 고사양 노드 필요
Qwen3.5-397B-A17B 397B / 17B native 262K(1M 확장?) Apache 2.0 자유 대형, but 0.8B~397B 라인업 넓음
gpt-oss-120b 117B / 5.1B 128K Apache 2.0 자유 단일 80GB H100 (mxfp4)
gpt-oss-20b 21B / 3.6B 128K Apache 2.0 자유 16GB RAM — 로컬 최적
Mistral Large 3 675B / 41B (미표기) Apache 2.0 (재확인 필요) 자유(추정) 대형 노드
Mistral Small 4 119B / 6B (미표기) Apache 2.0 (재확인 필요) 자유(추정) 중형
Llama 4 Scout 109B / 17B 최대 10M 주장 Llama 4 Community 7억 MAU↑ 별도계약 단일 고급 GPU
Llama 4 Maverick 400B / 17B Llama 4 Community 위와 동일 대형
Kimi K3 2.8T / (16 of 896 exp) 1M Modified MIT 제약 있음 초대형 — API 전용
  • DeepSeek V4는 2026-04-24 MIT로 공개. MoE(층당 256 routed + 1 shared expert, top-8) + CSA/HCA 하이브리드 어텐션. [HIGH]
  • gpt-oss는 OpenAI가 GPT-2 이후 처음 낸 오픈웨이트(2025-08-05). MoE 가중치에만 4-bit MXFP4 양자화 적용. → quantization. [HIGH]
  • Qwen3.5는 0.8B~397B 9개 사이즈 + 공식 FP8/GPTQ-Int4 양자화본을 HF에 함께 공개 — 로컬 선택지가 가장 넓다. [HIGH]
  • Meta의 가장 최근 공식 릴리스는 Llama 4(2025-04-05). Behemoth(~2T)는 미출시(학습 중). "Llama 5"는 존재하지 않는다 — 아래 인용 금지 박스 참조.
  • Kimi K3: 2026-07-16 발표됐으나 전체 가중치 배포는 2026-07-27 예정 — 2026-07-25 현재 아직 미배포일 수 있다 (재확인 필요).

라이선스: 이게 채택의 핵심

그룹 모델 실무 의미
완전 permissive DeepSeek V4(MIT), gpt-oss·Qwen3.5/3.6·Mistral(Apache 2.0) 상업적 사용·재배포·파인튜닝 전부 자유. MIT는 출력으로 타 LLM 학습까지 명시 허용
커스텀/제약 Llama 4 Community, Kimi Modified MIT, MiniMax Community, Nemotron OpenMDW source-available일 뿐. Llama 4는 월 활성 7억 초과 기업 별도 계약
  • "오픈소스"라고 뭉뚱그리지 마라. Apache 2.0/MIT는 진짜 자유롭지만, Llama Community License는 대기업 제약과 acceptable-use 정책이 붙은 source-available이다.
  • 사내 제품에 임베드할 거면 라이선스 원문(모델카드 License 필드)을 직접 확인하라. 여기 표기 중 일부는 aggregator 경유라 "(재확인 필요)"로 남겼다.

셀프호스트 vs 호스팅 API — 언제 뭘 고르나

상황 선택 이유
고객 데이터가 외부로 나가면 안 됨 (의료·금융·사내 기밀) 셀프호스트 오픈웨이트 데이터 주권 — 프롬프트가 자사 인프라를 벗어나지 않음
특정 도메인에 파인튜닝 필요 셀프호스트(permissive 라이선스) 가중치를 직접 튜닝. API 모델은 불가
대량·저지연 배치, 단가 극한 압축 셀프호스트 or 저가 오픈웨이트 API 토큰당 단가가 프론티어 API보다 훨씬 낮음
최고 품질·복잡 추론·에이전트 Claude 등 프론티어 API 오픈웨이트 최상위도 프론티어 대비 여전히 격차. → model-choice-decision-guide
운영 인력·GPU 없음, 빨리 붙이고 싶음 오픈웨이트 호스팅 API DeepSeek/Together/Fireworks 등이 호스팅. 셀프호스트 없이 저단가
로컬 프로토타이핑·오프라인 gpt-oss-20b(16GB RAM) 노트북급에서 구동. 실험/PoC에 최적
  • 셀프호스트라고 무조건 싸지 않다. 1.6T(DeepSeek)·2.8T(Kimi)급은 멀티 GPU 노드가 필요해 사실상 API/클라우드 추론이 답이다. "셀프호스트 가능"과 "셀프호스트 경제적"은 다르다.
  • 오픈웨이트라도 대부분은 셀프호스트 대신 제3자 호스팅 API로 쓴다 — 가중치가 공개돼 여러 벤더가 경쟁 호스팅하므로 단가가 낮아지는 게 실익이다.

함정 (gotcha)

  • "Llama 5"를 쓰지 마라. 존재하지 않는다. 저신뢰 블로그 밈이다 (아래 박스).
  • DeepSeek 활성 파라미터 표기 혼란: HF 조직 페이지가 Pro 862B/Flash 158B로 보이지만, 공식 스펙은 1.6T/284B(total)다. 체크포인트 표기와 논리 파라미터가 달라 보이는 것 — 스펙 인용 시 공식 모델카드 기준을 쓰라.
  • DeepSeek V4 API 가격은 확정 인용 금지. aggregator 간 값이 엇갈린다(V4-Flash 출력 $0.242~$0.28/M 등). 공식 가격표는 이미지라 1차 미확인. 실제 견적은 벤더 콘솔에서 확인하라.
  • Qwen3.5 컨텍스트: native 262K인지 1M 확장인지 출처마다 다르다 (재확인 필요).
  • 컨텍스트 "10M 토큰"(Llama 4 Scout) 같은 수치는 주장값이다. 실제 유효 컨텍스트와 다를 수 있다. → tokens-and-context-windows
  • 양자화 배포본을 그냥 쓰지 마라. gpt-oss의 16GB RAM 구동, Qwen의 GPTQ-Int4 등은 양자화 전제다. 정밀도 손실을 감안하라. → quantization

인용 금지 박스. "Meta Llama 5" (600B 파라미터, 5M 토큰 컨텍스트, "Recursive Self-Improvement" 주장)는 조작 의심 정보다. 스펙·존재를 인용하지 마라. 출처가 ragyfied.com, chroniclejournal MarketMinute, startuphub.ai 등 저신뢰 블로그/보도자료뿐이고, Wikipedia(2026-04 반영)는 Llama 5 미발표·미출시를 확인한다. Meta는 대신 Muse Spark(폐쇄형)를 냈다. 마찬가지로 GLM 5.2 / MiniMax M3 / Nemotron 3 Ultra의 스펙·가격, Qwen3.8-Max 2.4T(프리뷰, 오픈웨이트 미배포)도 단일 저신뢰 출처라 확정 인용하지 마라.


참고

출처: 비Anthropic 프로바이더 정보. DeepSeek/gpt-oss/Qwen/Llama는 공식 HF 모델카드·API 문서·Wikipedia로 교차확인 [HIGH], Mistral·Kimi·기타는 aggregator 경유 [MED]. 가격·미배포 모델은 "(재확인 필요)". 원본 → 2026-07-25-open-weight-models