
DeepSeek 是杭州深度求索开发的开放权重大模型家族,涵盖 V4、R3、V3 等系列。当前最新开放权重主干 DeepSeek V4 于 2026 年 4 月发布预览、8 月全面开放权重,含 Pro(1.6T 总参/49B 激活)与 Flash(285B 总参/13B 激活)双变体,MIT 许可,1M 上下文窗口,是开放权重领域参数规模最大、上下文最长、许可最宽松的旗舰家族之一。
产品概述
DeepSeek 由杭州深度求索人工智能基础技术研究有限公司(DeepSeek AI)开发,是 2025-2026 年开放权重领域最具影响力的模型家族之一。官网研究页显示,DeepSeek 已发布的研究模型包括 DeepSeek V4、DeepSeek V3.2、DeepSeek V3、DeepSeek R1、DeepSeek Coder V2、DeepSeek VL 等 。
版本演进(具体以官网实时信息为准):
- DeepSeek R1(2025 年 1 月):MIT 许可,开源社区引爆”DeepSeek 时刻”
- DeepSeek V3 / V3.1 / V3.2(2024 年 12 月 – 2025 年 12 月):MIT 许可
- DeepSeek V4 预览(2026 年 4 月 24 日):发布 V4-Pro 与 V4-Flash 双变体预览,MIT 许可
- DeepSeek V4 正式开放权重(2026 年 8 月):V4-Flash-0731 生产版于 7 月 31 日开放权重;V4-Pro-0813 于 8 月 13 日开放权重,均 MIT 许可
当前最新开放权重主干 DeepSeek V4 核心参数 :
| 变体 | 总参数量 | 激活参数 | 上下文 | 许可 |
|---|---|---|---|---|
| V4-Pro | 1.6T | 49B | 1M | MIT |
| V4-Flash | 285B | 13B | 1M | MIT |
架构创新 :
- 混合注意力架构:压缩稀疏注意力(CSA)+ 重度压缩注意力(HCA),1M 上下文下 KV 缓存降至 V3.2 的 10%
- 流形约束超连接(mHC):将残差映射约束在双随机矩阵流形上,提升信号传播稳定性
- Muon 优化器:加快收敛、改善训练稳定性
- 多令牌预测(MTP):保留自 V3 起的 MTP 策略
许可策略(关键):
DeepSeek V4 的官方模型卡明确:通过开源仓库分发的资产(包括模型权重和代码)均基于 MIT 许可 。这意味着开发者可以:下载权重在自有硬件运行、在专有数据上微调、向付费客户提供商业服务、将输出蒸馏到更小模型——且无需向 DeepSeek 支付任何费用 。
💡 与 Llama 4 的”Custom License + 月活 >7 亿需审批”不同,DeepSeek V4 的 MIT 许可是真正无门槛的宽松许可,这是 DeepSeek 在开放权重领域最核心的差异化优势。
核心能力
- 1M 超长上下文:默认 1M token 上下文窗口,384K 最大输出,可一次性处理《三体》三部曲级别的文本量
- MoE 稀疏激活:V4-Pro 1.6T 总参仅激活 49B,V4-Flash 285B 总参仅激活 13B,推理成本接近激活参数规模的稠密模型
- 三种推理模式:Non-think(快速直觉响应)、Think High(审慎逻辑分析)、Think Max(最大算力扩展推理)
- Agent 编程:第三方评测显示 V4-Pro 在 SWE-bench Verified 上得分 80.6%,是开放权重最高分之一
- 工具调用与 JSON 输出:API 支持 tool calls、JSON mode、FIM completion、chat-prefix completion
- 多格式 API 兼容:同时兼容 OpenAI ChatCompletions 与 Anthropic API 格式
- 国产算力适配:V4 是首个在华为昇腾超节点上完成推理验证的 DeepSeek 旗舰模型
优势亮点
- MIT 最宽松许可:权重与代码双双 MIT,商用、修改、再分发、蒸馏均无门槛——这是与 Llama、Qwen-Max 等”自定义许可”最本质的区别
- 1M 上下文普惠:将百万级上下文从闭源专属变为开放权重标配
- 极致性价比:V4-Pro 非峰值输出 $0.87/百万 token,V4-Flash 输出 $0.28/百万 token,约为同能力闭源模型的 1/30-1/100
- 参数规模最大:V4-Pro 1.6T 总参是 2026 年开放权重中参数规模最大的模型之一
- 架构效率突破:混合注意力让 V4-Pro 每 token 推理 FLOPs 降至 V3.2 的 27%,KV 缓存降至 10%
- Agent 生态原生适配:与 OpenClaw、OpenCode、Hermes 等主流 Agent 框架深度集成
- 开放权重常态化:从 R1 到 V4,DeepSeek 每一代旗舰都以 MIT 许可开放权重,建立了”开放即常态”的品牌认知
局限
- 纯文本模态:V4-Pro 与 V4-Flash 均为文本输入,不支持视觉、音频、视频(不同于 Qwen3.8-27B、Gemma 4 的多模态)
- 自托管硬件门槛高:V4-Pro 1.6T 需多卡 H100/A100 集群;V4-Flash 285B 也需至少单卡 H100(80GB)或多卡消费级 GPU 量化部署
- 与顶级闭源仍有差距:DeepSeek 技术报告承认 V4 在综合能力上较 GPT-5.4 与 Gemini-3.1-Pro “略微落后”,差距约 3-6 个月
- 峰值定价优势收窄:2026 年 8 月 16 日起 API 采用峰值/非峰值双轨定价,峰值时段 V4-Pro 输出达 $3.96/百万 token,价格优势较发布初期明显减弱
- 旧 API 端点退役:deepseek-chat 与 deepseek-reasoner 已于 2026 年 7 月 24 日停用,需迁移至 V4 系列
- Flash 版复杂推理较弱:V4-Flash 13B 激活参数在复杂推理任务上不及 V4-Pro,需配置更大的”思考预算”来弥补
适用人群
- 需自托管前沿推理的企业:MIT 许可允许自由部署、修改、商用,数据与模型权重 100% 自主可控
- Agent 编程平台开发者:V4-Pro 在 SWE-bench Verified 等编程基准上表现强劲,适合构建编程 Agent
- 长文档/代码库分析团队:1M 上下文可一次性处理超长文档、整个代码库
- 成本敏感的高并发场景:V4-Flash 在高并发批量任务中性价比突出,API 成本约为闭源同能力模型的 1/30
- 国产算力适配需求方:V4 已完成华为昇腾验证,是国产 AI 芯片上的前沿开放权重选项
- 蒸馏与二次开发团队:MIT 许可明确允许将 V4 输出蒸馏到更小模型,为下游模型训练提供合法数据源
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| V4-Flash 推理(FP8 量化) | 单卡 H100 80GB 或 2×RTX 4090 24GB |
| V4-Flash 全精度 | 单卡 H100 80GB 或 4×A100 40GB |
| V4-Pro 推理(量化) | 多卡 H100/H200 集群(建议 8 卡) |
| V4-Pro 全精度 | 8×H100+ 或等效国产算力(华为昇腾 910B 集群) |
💡 V4 采用 FP4(专家权重)+ FP8(其他权重)的混合精度,部署时需推理引擎支持混合精度量化
2. 获取模型权重
从 Hugging Face 拉取官方权重(MIT 许可):
# V4-Pro(865GB 下载) huggingface-cli download deepseek-ai/DeepSeek-V4-Pro # V4-Flash(约 160GB 下载) huggingface-cli download deepseek-ai/DeepSeek-V4-Flash
3. 通过推理引擎部署
vLLM(推荐,支持 V4 的混合注意力与 MoE):
vllm serve deepseek-ai/DeepSeek-V4-Flash \ --tensor-parallel-size 1 \ --max-model-len 1000000
SGLang:
sglang serve --model-path deepseek-ai/DeepSeek-V4-Pro \ --tp 8 \ --context-length 1000000
4. API 调用示例
V4 API 兼容 OpenAI 格式 :
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# 非思考模式
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "解释 MoE 架构"}],
stream=False
)
# 思考模式
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "证明哥德巴赫猜想的进展"}],
extra_body={"thinking": True}
)
⚠️ 注意:2026 年 8 月 16 日起,API 采用峰值/非峰值双轨定价。如需控制成本,建议在非峰值时段调度批处理任务,并利用缓存命中(cache hit)机制
5. 国产化部署建议
V4 已完成华为昇腾验证,在国产算力上的部署路径:
- 华为昇腾:使用 Ascend CANN + MindIE 推理引擎,参考华为官方 V4 适配指南
- 天数智芯 / 沐曦 / 燧原:参照各厂商的 PyTorch 插件 + vLLM 分支部署
相关导航


OLMo

Mistral

Gemma

Llama

GPT-OSS

