DeepSeek翻译站点

3周前更新 14 0 0

DeepSeek 开放权重大模型家族,MIT 许可,1M 上下文。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20
DeepSeekDeepSeek

DeepSeek 是杭州深度求索开发的开放权重大模型家族,涵盖 V4、R3、V3 等系列。当前最新开放权重主干 DeepSeek V4 于 2026 年 4 月发布预览、8 月全面开放权重,含 Pro(1.6T 总参/49B 激活)与 Flash(285B 总参/13B 激活)双变体,MIT 许可,1M 上下文窗口,是开放权重领域参数规模最大、上下文最长、许可最宽松的旗舰家族之一。

 

产品概述

DeepSeek 由杭州深度求索人工智能基础技术研究有限公司(DeepSeek AI)开发,是 2025-2026 年开放权重领域最具影响力的模型家族之一。官网研究页显示,DeepSeek 已发布的研究模型包括 DeepSeek V4、DeepSeek V3.2、DeepSeek V3、DeepSeek R1、DeepSeek Coder V2、DeepSeek VL 等 。

 

版本演进(具体以官网实时信息为准):

  • DeepSeek R1(2025 年 1 月):MIT 许可,开源社区引爆”DeepSeek 时刻”
  • DeepSeek V3 / V3.1 / V3.2(2024 年 12 月 – 2025 年 12 月):MIT 许可
  • DeepSeek V4 预览(2026 年 4 月 24 日):发布 V4-Pro 与 V4-Flash 双变体预览,MIT 许可
  • DeepSeek V4 正式开放权重(2026 年 8 月):V4-Flash-0731 生产版于 7 月 31 日开放权重;V4-Pro-0813 于 8 月 13 日开放权重,均 MIT 许可

 

当前最新开放权重主干 DeepSeek V4 核心参数​ :

变体 总参数量 激活参数 上下文 许可
V4-Pro 1.6T 49B 1M MIT
V4-Flash 285B 13B 1M MIT

 

架构创新​ :

  • 混合注意力架构:压缩稀疏注意力(CSA)+ 重度压缩注意力(HCA),1M 上下文下 KV 缓存降至 V3.2 的 10%
  • 流形约束超连接(mHC):将残差映射约束在双随机矩阵流形上,提升信号传播稳定性
  • Muon 优化器:加快收敛、改善训练稳定性
  • 多令牌预测(MTP):保留自 V3 起的 MTP 策略

 

许可策略(关键):

DeepSeek V4 的官方模型卡明确:通过开源仓库分发的资产(包括模型权重和代码)均基于 MIT 许可​ 。这意味着开发者可以:下载权重在自有硬件运行、在专有数据上微调、向付费客户提供商业服务、将输出蒸馏到更小模型——且无需向 DeepSeek 支付任何费用 。

💡 与 Llama 4 的”Custom License + 月活 >7 亿需审批”不同,DeepSeek V4 的 MIT 许可是真正无门槛的宽松许可,这是 DeepSeek 在开放权重领域最核心的差异化优势。

 

核心能力

  • 1M 超长上下文:默认 1M token 上下文窗口,384K 最大输出,可一次性处理《三体》三部曲级别的文本量
  • MoE 稀疏激活:V4-Pro 1.6T 总参仅激活 49B,V4-Flash 285B 总参仅激活 13B,推理成本接近激活参数规模的稠密模型
  • 三种推理模式:Non-think(快速直觉响应)、Think High(审慎逻辑分析)、Think Max(最大算力扩展推理)
  • Agent 编程:第三方评测显示 V4-Pro 在 SWE-bench Verified 上得分 80.6%,是开放权重最高分之一
  • 工具调用与 JSON 输出:API 支持 tool calls、JSON mode、FIM completion、chat-prefix completion
  • 多格式 API 兼容:同时兼容 OpenAI ChatCompletions 与 Anthropic API 格式
  • 国产算力适配:V4 是首个在华为昇腾超节点上完成推理验证的 DeepSeek 旗舰模型

 

优势亮点

  • MIT 最宽松许可:权重与代码双双 MIT,商用、修改、再分发、蒸馏均无门槛——这是与 Llama、Qwen-Max 等”自定义许可”最本质的区别
  • 1M 上下文普惠:将百万级上下文从闭源专属变为开放权重标配
  • 极致性价比:V4-Pro 非峰值输出 $0.87/百万 token,V4-Flash 输出 $0.28/百万 token,约为同能力闭源模型的 1/30-1/100
  • 参数规模最大:V4-Pro 1.6T 总参是 2026 年开放权重中参数规模最大的模型之一
  • 架构效率突破:混合注意力让 V4-Pro 每 token 推理 FLOPs 降至 V3.2 的 27%,KV 缓存降至 10%
  • Agent 生态原生适配:与 OpenClaw、OpenCode、Hermes 等主流 Agent 框架深度集成
  • 开放权重常态化:从 R1 到 V4,DeepSeek 每一代旗舰都以 MIT 许可开放权重,建立了”开放即常态”的品牌认知

 

局限

  • 纯文本模态:V4-Pro 与 V4-Flash 均为文本输入,不支持视觉、音频、视频(不同于 Qwen3.8-27B、Gemma 4 的多模态)
  • 自托管硬件门槛高:V4-Pro 1.6T 需多卡 H100/A100 集群;V4-Flash 285B 也需至少单卡 H100(80GB)或多卡消费级 GPU 量化部署
  • 与顶级闭源仍有差距:DeepSeek 技术报告承认 V4 在综合能力上较 GPT-5.4 与 Gemini-3.1-Pro “略微落后”,差距约 3-6 个月
  • 峰值定价优势收窄:2026 年 8 月 16 日起 API 采用峰值/非峰值双轨定价,峰值时段 V4-Pro 输出达 $3.96/百万 token,价格优势较发布初期明显减弱
  • 旧 API 端点退役:deepseek-chat 与 deepseek-reasoner 已于 2026 年 7 月 24 日停用,需迁移至 V4 系列
  • Flash 版复杂推理较弱:V4-Flash 13B 激活参数在复杂推理任务上不及 V4-Pro,需配置更大的”思考预算”来弥补

 

适用人群

  • 需自托管前沿推理的企业:MIT 许可允许自由部署、修改、商用,数据与模型权重 100% 自主可控
  • Agent 编程平台开发者:V4-Pro 在 SWE-bench Verified 等编程基准上表现强劲,适合构建编程 Agent
  • 长文档/代码库分析团队:1M 上下文可一次性处理超长文档、整个代码库
  • 成本敏感的高并发场景:V4-Flash 在高并发批量任务中性价比突出,API 成本约为闭源同能力模型的 1/30
  • 国产算力适配需求方:V4 已完成华为昇腾验证,是国产 AI 芯片上的前沿开放权重选项
  • 蒸馏与二次开发团队:MIT 许可明确允许将 V4 输出蒸馏到更小模型,为下游模型训练提供合法数据源

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
V4-Flash 推理(FP8 量化) 单卡 H100 80GB 或 2×RTX 4090 24GB
V4-Flash 全精度 单卡 H100 80GB 或 4×A100 40GB
V4-Pro 推理(量化) 多卡 H100/H200 集群(建议 8 卡)
V4-Pro 全精度 8×H100+ 或等效国产算力(华为昇腾 910B 集群)

💡 V4 采用 FP4(专家权重)+ FP8(其他权重)的混合精度,部署时需推理引擎支持混合精度量化

 

2. 获取模型权重

从 Hugging Face 拉取官方权重(MIT 许可):

# V4-Pro(865GB 下载)
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro

# V4-Flash(约 160GB 下载)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash

 

3. 通过推理引擎部署

vLLM(推荐,支持 V4 的混合注意力与 MoE)

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 1 \
  --max-model-len 1000000

SGLang

sglang serve --model-path deepseek-ai/DeepSeek-V4-Pro \
  --tp 8 \
  --context-length 1000000

 

4. API 调用示例

V4 API 兼容 OpenAI 格式 :

from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

# 非思考模式
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "解释 MoE 架构"}],
    stream=False
)

# 思考模式
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "证明哥德巴赫猜想的进展"}],
    extra_body={"thinking": True}
)

⚠️ 注意:2026 年 8 月 16 日起,API 采用峰值/非峰值双轨定价。如需控制成本,建议在非峰值时段调度批处理任务,并利用缓存命中(cache hit)机制

 

5. 国产化部署建议

V4 已完成华为昇腾验证,在国产算力上的部署路径:

  • 华为昇腾:使用 Ascend CANN + MindIE 推理引擎,参考华为官方 V4 适配指南
  • 天数智芯 / 沐曦 / 燧原:参照各厂商的 PyTorch 插件 + vLLM 分支部署

相关导航