원본 캡처

오픈웨이트 LLM 지형 (DeepSeek / Qwen / Mistral / Llama / gpt-oss 등) 리서치 원본 — 2026-07-25

불변 캡처. 절대 편집하지 마라. 가공본은 위키 페이지에. 신뢰도 규칙: 비Anthropic 프로바이더는 기본 [MED]. 다만 1차 출처(공식 HuggingFace 모델카드 / 공식 API 문서 / 공식 블로그)로 교차확인된 것만 [HIGH] 로 올림.

조사 방법

검색어

  • "DeepSeek latest model 2026 open weight parameters MoE context license"
  • "Qwen 3 latest model 2026 Alibaba open weight parameters Apache license Hugging Face"
  • "Meta Llama latest model 2026 open weight release official"
  • "gpt-oss OpenAI open weight model 2026 parameters Apache license"
  • "Mistral latest open weight model 2026 Large Apache license parameters"
  • "\"Llama 5\" Meta release 2026 official announcement"
  • "Kimi K3 Moonshot open weight model 2026 parameters MoE license Hugging Face"
  • "DeepSeek V4 official release deepseek-ai huggingface MIT license 671B"
  • "Qwen3.5 397B-A17B open weight Apache 2.0 context length official qwenlm.github.io"

WebFetch 로 실제로 열어본 URL

  1. https://openrouter.ai/blog/insights/the-open-weight-models-that-matter-june-2026/ — OpenRouter (aggregator, 실사용 라우터)
  2. https://openai.com/index/introducing-gpt-oss/ — HTTP 403 (못 읽음)
  3. https://huggingface.co/blog/welcome-openai-gpt-oss — HF 공식 블로그 [1차 근접]
  4. https://huggingface.co/deepseek-ai — DeepSeek 공식 HF 조직 페이지 [1차]
  5. https://api-docs.deepseek.com/news/news260424/ — DeepSeek 공식 API 문서 [1차]
  6. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro — DeepSeek 공식 모델카드 [1차]
  7. https://developer.meta.com/ai/ — Meta 개발자 페이지 (본문 안 실려 무용)
  8. https://en.wikipedia.org/wiki/Llama_(language_model) — Wikipedia [보조 2차, 신뢰 높음]
  9. https://huggingface.co/mistralai — Mistral 공식 HF 조직 페이지 [1차]

확인된 사실 [신뢰도]

DeepSeek V4 (현행 최상위 오픈웨이트, MIT) [HIGH]

  • 출시: 2026-04-24, MIT 라이선스로 오픈웨이트 공개. (api-docs.deepseek.com/news/news260424, huggingface.co/deepseek-ai) [HIGH]
  • DeepSeek-V4-Pro: 총 1.6T 파라미터 / 활성 49B per token. 컨텍스트 1M. (HF 공식 모델카드 deepseek-ai/DeepSeek-V4-Pro) [HIGH]
  • DeepSeek-V4-Flash: 총 284B / 활성 13B. 컨텍스트 1M. (DeepSeek API 문서, OpenRouter) [HIGH]
  • 라이선스: MIT — 모델카드에 "MIT" 명시. 상업적 사용·수정·재배포·모델 출력으로 타 LLM 학습까지 명시 허용 (R1 때와 동일 조항). [HIGH]
  • 아키텍처: MoE. 층당 256 routed expert + 1 shared expert, top-8 라우팅. V3 의 Multi-head Latent Attention 를 대체하는 Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) 하이브리드 어텐션. + Manifold-Constrained Hyper-Connections(mHC). (HF 모델카드 + OpenRouter) — 세부 아키텍처는 [MED] (모델카드/기술리포트 기반이나 요약 경유)
  • 컨텍스트 1M 이 이제 모든 공식 DeepSeek 서비스 기본값. 최대 출력 384K (aggregator 여러 곳, 1차 미확인 → [MED])
  • 호스팅 API 가격 (aggregator morphllm/openrouter, [MED]): V4-Pro 입력 ~$0.435/M, 출력 ~$0.87/M. V4-Flash 입력 ~$0.14/M, 출력 ~$0.28/M. (OpenRouter 는 V4-Flash 를 입력 $0.054 / 출력 $0.242 로 더 낮게 표기 — 값 엇갈림, 아래 미확인 참조)
  • HF 조직 페이지에 파라미터가 158B(Flash)/862B(Pro) 로 표기되는데 이는 압축/체크포인트 표기(활성 아님)로 추정 — 공식 스펙(1.6T/284B total)과 다르게 보임. Base 모델은 DeepSeek-V4-Pro-Base 1.6T, DeepSeek-V4-Flash-Base 292B 로 표기. DSpark 최적화 변형도 존재.

Alibaba Qwen [HIGH / MED]

  • Qwen3.5 (오픈웨이트, 현행 주력): 2026-02-16 첫 공개. 플래그십 Qwen3.5-397B-A17B = 총 397B / 활성 17B. (HF: Qwen/Qwen3.5-397B-A17B, NVIDIA build 모델카드) [HIGH]
  • 라이선스 Apache 2.0. HF 에 공식 FP8 및 GPTQ-Int4 양자화본 포함. [HIGH]
  • 컨텍스트: native 262,144(256K), 확장 시 최대 1M 언급. 아키텍처 하이브리드 Gated DeltaNet + full-attention. 201개 언어. [MED] (aggregator 경유)
  • 2026-02-24 추가 공개: Qwen3.5-122B-A10B, Qwen3.5-35B-A3B, Qwen3.5-27B. 이후 9B/4B/2B/0.8B 도 HF·ModelScope 에. 0.8B~397B 총 9개 사이즈. [MED]
  • Qwen3.6: Qwen3.6-35B-A3B 가 Apache 2.0 로 존재. (github.com/QwenLM/Qwen3.6) [MED]
  • Qwen3.8-Max: 2026-07-19 WAIC(상하이)에서 프리뷰 공개. 2.4T 파라미터 멀티모달. "Fable 5 다음가는" 이라 자칭. 아직 오픈웨이트 아님 — Qwen 팀이 X 에서 "곧" 오픈웨이트 예정이라 언급(플래그십 Max 를 그동안 API 전용 프로프라이어터리로 두던 방침 변경). (marktechpost, dataconomy) [MED — 프리뷰, 오픈웨이트 미출시]

OpenAI gpt-oss (첫 오픈웨이트, GPT-2 이후) [HIGH]

  • 출시: 2025-08-05. gpt-oss-120b, gpt-oss-20b 두 종. (openai.com, HF 공식 블로그) [HIGH]
  • gpt-oss-120b: 총 117B / 활성 5.1B. 컨텍스트 128K. 단일 80GB H100 에 적재(mxfp4). o4-mini 급 추론. [HIGH]
  • gpt-oss-20b: 총 21B / 활성 3.6B. 컨텍스트 128K. 16GB RAM 에서 구동(mxfp4). bfloat16 비압축 시 ~48GB. [HIGH]
  • 아키텍처: token-choice MoE + SwiGLU. 어텐션 층 교대(full-context / sliding 128-token window), head 별 learned attention sink. MoE 가중치에만 4-bit MXFP4 양자화 적용. [HIGH]
  • 라이선스: Apache 2.0 + 소규모 보완 use policy(책임/합법 사용 강조). 상업적 사용 허용. [HIGH]

Meta Llama [HIGH] — ⚠️ Llama 5 는 아래 조작의심 섹션 참조

  • 가장 최근 공식 릴리스는 Llama 4 (2025-04-05). Llama 5 는 공식 발표·출시된 적 없음 (Wikipedia, 2026-04 시점까지 반영). [HIGH]
  • Llama 4 Scout: 활성 17B / 총 109B, MoE, 멀티모달(텍스트+이미지), 최대 10M 토큰 컨텍스트 주장, 단일 고급 GPU 적재. [HIGH]
  • Llama 4 Maverick: 활성 17B / 총 400B, MoE 멀티모달. [HIGH]
  • Llama 4 Behemoth: 활성 288B / 총 ~2T 규모로 예고됐으나 2026-05 시점까지 미출시(학습 중). [HIGH]
  • 라이선스: Llama 4 Community License Agreement + Acceptable Use Policy — source-available. 완전한 오픈소스/Apache 아님. 월간 활성 사용자 7억 이상 기업은 별도 라이선스 필요(커스텀 제약). [HIGH]
  • Meta Superintelligence Labs 는 Llama 대체로 Muse Spark 라는 폐쇄형(closed) 모델을 냄 — 이건 Llama 5 가 아님. [HIGH — Wikipedia]

Mistral AI [MED]

  • Mistral Large 3 (현행 플래그십 오픈웨이트): 2025-12-02 공개. 총 675B / 활성 41B MoE. 라이선스 Apache 2.0 (프론티어급 중 가장 관대). HF 조직 페이지에 Large 3(675B) Instruct-2512/Eagle/NVFP4 변형 확인. (huggingface.co/mistralai, aggregator) [MED — HF 조직 페이지는 675B 확인, Apache 2.0 는 aggregator 다수 일치이나 모델카드 직접 미확인]
  • Mistral Small 4 (2026-03): 총 119B / 활성 6B. Magistral(추론)+Pixtral(비전)+Devstral(코딩)을 단일 모델로 통합. [MED]
  • Mistral Medium 3.5 (128B), Ministral 3 (8~9B), Leanstral 1.5 (119B) 도 HF 조직 페이지에 존재. [MED]
  • 2026-07 초 새 MoE 오픈웨이트("fat but sparse") early access 진입 발표(CEO Arthur Mensch). 세부 스펙 미공개. [MED]

Moonshot Kimi K3 [MED — 오픈웨이트 아직 미배포]

  • 2026-07-16 공개. 총 2.8T 파라미터 MoE, 활성은 896개 expert 중 16개(활성 파라미터 수치는 aggregator 미제공). 컨텍스트 1M, 네이티브 이미지 입력. (mindstudio, felloai, HF 블로그) [MED]
  • 라이선스: K2 계열과 동일한 Modified MIT License 예정. 2026-07-17 시점 아직 full weight dump 미배포 — 제품/API 로만 제공. 전체 가중치는 2026-07-27 예정. [MED — 미래 시점, 미확정]
  • 셀프호스트: 2.8T 규모라 로컬 구동에 막대한 GPU 필요 — 대부분 API/클라우드 추론으로 접근. [MED]

기타 오픈웨이트 (OpenRouter "June 2026 매터링" 목록에서) [MED, aggregator]

  • GLM 5.2 (Zhipu): 가격 입력 $0.447/M / 출력 $3.31/M. 스펙·라이선스 미상. [MED]
  • MiniMax M3: 총 ~428B / 활성 ~23B MoE(Sparse Attention), 컨텍스트 1M, MiniMax Community License. 입력 $0.098/M / 출력 $1.21/M. [MED]
  • NVIDIA Nemotron 3 Ultra: 550B / 활성 55B, Mamba-2 + Transformer MoE 하이브리드, 컨텍스트 1M, OpenMDW 라이선스. 입력 $0.423/M / 출력 $2.61/M(+무료 옵션). [MED]
  • Kimi K2.6: 벤치 비교에만 등장, 스펙 미제공. [MED]

라이선스 유형 요약 (실무 판단용)

  • 완전 permissive (상업적 자유, 재배포·파인튜닝 자유): DeepSeek V4 = MIT, gpt-oss = Apache 2.0, Qwen3.5/3.6 = Apache 2.0, Mistral Large 3/Small 4 = Apache 2.0(모델카드 직접 미확인).
  • 커스텀/제약 있음: Llama 4 = Community License(7억 MAU 초과 기업 별도 계약, source-available), Kimi K3 = Modified MIT, MiniMax = Community License, Nemotron = OpenMDW.
  • 셀프호스트 실무: gpt-oss-20b = 16GB RAM 급(로컬 최적), gpt-oss-120b = 단일 80GB H100. DeepSeek V4-Pro(1.6T)/Kimi K3(2.8T) = 멀티 GPU 노드 필요, 사실상 API/클라우드. Qwen 은 0.8B~397B 로 폭넓어 로컬 선택지 많음.

엇갈리거나 미확인

  • DeepSeek V4 정확한 API 가격: morphllm/aggregator 는 V4-Pro 출력 $0.87/M, V4-Flash 출력 $0.28/M. OpenRouter 는 V4-Flash 를 입력 $0.054 / 출력 $0.242 로 더 낮게 표기. 값 엇갈림 — DeepSeek 공식 가격표(이미지 /img/v4-price-en.png)는 텍스트로 못 읽음. 1차 미확인.
  • DeepSeek V4 최대 출력 토큰(384K): aggregator 만. 1차 미확인.
  • DeepSeek HF 조직 페이지 파라미터 표기(Pro 862B, Flash 158B) vs 공식 스펙(1.6T/284B total): 표기 기준이 달라 보임(체크포인트 크기 vs 논리 파라미터). 정확한 해석 미확인.
  • Qwen3.5 컨텍스트: native 262K 인지 1M 확장인지 출처마다 다름(256K native + 확장으로 추정). 1차 모델카드 직접 미확인.
  • Qwen3.8-Max 오픈웨이트 여부/스펙: 프리뷰 단계, 2.4T 는 aggregator. 오픈웨이트 배포 안 됨.
  • Mistral Large 3 Apache 2.0: aggregator 다수 일치하나 HF 모델카드 라이선스 필드 직접 확인 못 함.
  • Kimi K3 활성 파라미터 수치 / 실제 가중치 배포 여부: 2026-07-27 예정일 뿐, 2026-07-25 현재 미배포일 가능성. 오늘 날짜 기준 "예정".
  • GLM 5.2 / MiniMax M3 / Nemotron 3 Ultra: OpenRouter 단일 aggregator 출처에만 의존. 각 사 1차 미확인.

⛔ 조작 의심 — 인용 금지 (doNotCite)

"Meta Llama 5" (600B, 5M 컨텍스트, Recursive Self-Improvement) — 조작 의심, 스펙 인용 절대 금지

  • 주장 내용: 2026-04-08 Zuckerberg 가 Llama 5 발표, 600B+ 파라미터, 최대 5M 토큰 컨텍스트, "Recursive Self-Improvement(재귀적 자기개선)" 로 스스로 내부 로직을 정제하고 합성 데이터 생성.
  • 출처가 전부 저신뢰 블로그/보도자료 밈뿐:
  • https://ragyfied.com/articles/meta-llama-5-released — "Recursive Self-Improvement" 는 전형적 과장/조작 신호
  • https://markets.chroniclejournal.com/.../marketminute-2026-4-8-meta-unleashes-llama-5 — MarketMinute 보도자료 형식
  • https://www.startuphub.ai/... — 블로그
  • 반증(1차/신뢰): Wikipedia(2026-04 반영) 및 Llama latest 검색 모두 "가장 최근 공식 릴리스는 Llama 4, Llama 5 는 발표·출시된 적 없음" 확인. Meta 는 대신 Muse Spark(closed) 를 냄.
  • 결론: Llama 5 의 스펙/존재를 위키에 인용하지 마라. 공식 Meta 발표로 확인되기 전까지 doNotCite.

단일 저신뢰 출처뿐인 값 (교차확인 전 인용 주의 → doNotCite 후보)

  • DeepSeek V4 구체 API 가격 수치들(aggregator 간 불일치) — 특정 숫자를 확정 인용하지 말 것.
  • GLM 5.2 / MiniMax M3 / Nemotron 3 Ultra 스펙·가격 — OpenRouter 단일 출처.
  • Qwen3.8-Max 2.4T 스펙 — 프리뷰 홍보성, 오픈웨이트 미배포.

원문 발췌

DeepSeek V4 (HF 공식 모델카드 deepseek-ai/DeepSeek-V4-Pro): "License: MIT ... Total Parameters: 1.6 trillion ... Activated Parameters: 49 billion ... Context Length: one million tokens ... hybrid attention mechanism combining Compressed Sparse Attention (CSA) and Heavily Compressed Attention (HCA) ... Manifold-Constrained Hyper-Connections (mHC)"

DeepSeek V4 (공식 API 문서 news260424): "1.6T total / 49B active params" (Pro), "284B total / 13B active params" (Flash), "1M context is now the default across all official DeepSeek services", MIT.

gpt-oss (HF 공식 블로그): "GPT OSS 120B: Total 117B, Active 5.1B, Context 128K, single 80GB H100 (mxfp4). GPT OSS 20B: Total 21B, Active 3.6B, Context 128K, 16GB RAM (mxfp4), ~48GB bf16. token-choice MoE + SwiGLU, alternate full-context / sliding 128-token window attention, learned attention sinks. 4-bit mxfp4 on MoE weights only. Apache 2.0 + small complementary use policy."

Llama (Wikipedia): "Llama 4 is the most recent officially released model. There is no confirmed Llama 5 release. Release Date: April 5, 2025. Scout 17B active/109B total, Maverick 17B active/400B total, Behemoth announced but not released (288B active, ~2T total). License: Source-available (Llama 4 Community License Agreement). No Llama 5 has been announced or released."

Qwen3.5 (검색 종합 + HF Qwen/Qwen3.5-397B-A17B): "397B-A17B MoE, 17B active, Apache 2.0, native 262,144 context, hybrid Gated DeltaNet + full-attention, FP8/GPTQ-Int4 quants on HF, 9 sizes 0.8B–397B, 201 languages."

Mistral (HF 공식 조직 페이지 mistralai): "Mistral Large 3 (675B) Instruct-2512/Eagle/NVFP4. Mistral Medium 3.5 (128B). Mistral Small 4 (119B). Ministral 3 (8-9B). Leanstral 1.5 (119B)." — 라이선스/컨텍스트는 조직 페이지에 미표기.

Kimi K3 (검색 종합): "2.8T MoE, 16 of 896 experts per token, 1M context, native image input, Modified MIT License, full weights expected 2026-07-27, not yet fully released as of 2026-07-17."