Kimi翻译站点

3周前更新 16 0 0

月之暗面 Kimi 开放权重大模型家族,K3 为 2.8T 参数 MoE 旗舰。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

Kimi 是月之暗面(Moonshot AI)开发的开放权重大模型家族。截至 2026 年 8 月,最新开放权重主线为 Kimi K3——2.8T 总参/104B 激活 MoE,原生视觉理解,1M 上下文窗口,采用自定义 Kimi K3 License(类似 MIT 但含 MaaS 营收门槛);上一代 K2.6/K2.7 Code 采用 Modified MIT 许可。K3 是开放权重中首个迈入 3T 参数级别的模型,在 Agent 编程、长上下文推理上达到前沿水平,是开放权重 Agent 编程的标杆。

 

产品概述

Kimi 由北京月之暗面科技有限公司(Moonshot AI)开发,自 2024 年 Kimi 模型首次发布以来,已成为国产开放权重大模型家族中”Agent 编程 + 超长上下文”路线的代表。

 

版本演进(具体以官网实时信息为准):

  • Kimi K2(2025 年):1T 参数 MoE,开放权重线起点,2026 年 5 月 25 日下线
  • Kimi K2.5(2025 年):1T 总参/32B 激活,Agent、代码、视觉理解开源 SOTA;2026 年 8 月 31 日全平台正式下线
  • Kimi K2.6(2026 年 4 月 20 日):1T 总参/32B 激活 MoE,Modified MIT 许可,256K 上下文,支持视觉与文本输入、思考/非思考模式、对话与 Agent 任务
  • Kimi K2.7 Code(2026 年 6 月):Coding 专用模型,256K 上下文,较 K2.6 等效任务少消耗约 30% 思考 token
  • Kimi K3(2026 年 7 月 16 日 API 上线,7 月 27 日开放权重):当前最新开放权重主线。2.8T 总参/104B 激活 MoE,Kimi K3 自定义许可,1M 上下文,原生视觉理解

 

当前最新开放权重主线 Kimi K3 核心参数​ :

  • 架构:MoE,896 个路由专家,每 token 激活 16 个
  • 总参数量:2.8T(开放权重中首个 3T 级别模型)
  • 激活参数:104B
  • 上下文:1M tokens
  • 模态:原生视觉理解,视觉编码器 MoonViT-V2
  • 注意力机制:Kimi Delta Attention(KDA)覆盖 93 层中的 69 层,剩余 24 层为 Gated Latent Attention;引入 Attention Residuals(注意力残差)与 Stable Latent MoE
  • 许可:Kimi K3 License(自定义,类 MIT 但含 MaaS 营收门槛)
  • 效率:官方宣称相比 K2 提升约 2.5 倍扩展效率

 

许可策略(关键):

Kimi 家族许可分层——这是 2026 年开放权重领域”分层授权”趋势的典型样本:

  • Kimi K2.6 / K2.7 Code:Modified MIT 许可,商用、自托管、微调、再分发均允许
  • Kimi K3:Kimi K3 License(自定义,类 MIT 但有附加条款):
    • 允许使用、复制、修改、分发、部署、微调、构建衍生作品、再许可、出售
    • MaaS 条款:以”模型即服务”方式运营、且连续 12 个月收入超 2000 万美元的许可方,需与 Moonshot 另签商业协议
    • 署名条款:月活超 1 亿或月收入超 2000 万美元的商业产品,必须在界面显著展示”Kimi K3″标识
    • 纯内部使用、通过 Moonshot 官方产品或认证推理伙伴访问、将模型嵌入特定功能/工具中,均不受上述限制

💡 与 DeepSeek V4(MIT)、Qwen3.8-27B(Apache-2.0)、Gemma 4(Apache-2.0)、Phi-4(MIT)等”无条件宽松许可”不同,Kimi K3 是”类 MIT + 营收门槛”的分层许可。对 99% 的中小团队、内部使用、SaaS 应用层构建者而言功能上等同于 MIT;唯一被锁定的是”已形成规模、将 K3 权重二次打包成 API 对外售卖的中大型 MaaS 厂商”——这正是 Moonshot 阻断算力巨头低价转售、守护官方 API 定价权的核心策略 。

 

核心能力

  • 2.8T 参数 MoE 前沿能力:开放权重中首个 3T 级别模型,Artificial Analysis 综合智能指数 57 分,全球第三,仅次于 Claude Fable 5 与 GPT-5.6 Sol,显著超越其他开放权重模型(GLM-5.2 为 51、DeepSeek V4 Pro 为 44)
  • 1M 长上下文:K3 原生 1M 上下文;K2.6/K2.7 Code 为 256K 上下文
  • 原生多模态:K3 原生视觉理解(MoonViT-V2 编码器),支持图像输入;K2.6 同样支持视觉与文本输入
  • Agent 原生训练:K3 在 GDPval-AA v2 达 1668 Elo(K2.6 为 1190),AutomationBench-AA 53%(全球首次);工具调用、浏览、多步规划为原生能力而非后加
  • Agent 编程 SOTA:K3 在 SWE Marathon 登顶第一,Design Arena 前端生成登顶第一
  • 思考/非思考统一模式:K3 单一模型内统一思考与非思考模式,无需切换模型
  • KDA 注意力机制:Kimi Delta Attention 覆盖 93 层中的 69 层,将推理时的 KV 缓存与显存占用大幅压缩,是 K3 能在 1M 上下文下运行的关键架构创新
  • 视频与多模态输入(K2.6):K2.6 支持原生视频输入(mp4/mov/avi/webm)
  • 主流框架 Day 0 支持:vLLM(含 KDA prefill cache)、SGLang 均已支持 K3

 

优势亮点

  • 开放权重首个 3T 模型:2.8T 总参让 K3 成为开放权重中参数规模最大的模型,104B 激活参数带来接近 100B 级稠密模型的推理质量
  • Agent 编程登顶:SWE Marathon 第一、GDPval-AA v2 1668 Elo、AutomationBench-AA 53%,是开放权重中 Agent 编程能力最强的模型
  • 1M 上下文 + KDA 效率:KDA 注意力机制让 1M 上下文在工程上可行,是开放权重中长上下文 Agent 的最佳选择
  • 西方主流产品集成:发布 3 周内即登陆 GitHub Copilot(Pro 及以上版本 GA)、Perplexity 等西方主流产品,Fireworks AI 托管供 GitHub Copilot 调用
  • 分层许可精准豁免:Kimi K3 License 对 99% 的中小团队、内部使用、SaaS 应用层构建者等同 MIT;仅锁定大规模 MaaS 转售商,是”开放 + 商业可持续”的新范式
  • 国产算力突破英伟达生态:K3 测试环境同时覆盖 NVIDIA H200 与其他供应商 GPGPU,部署能力不局限于英伟达
  • K2.6/K2.7 仍是 Modified MIT:上一代开放权重线采用 Modified MIT,对不愿接受 K3 自定义许可的团队仍是干净的开放权重选项
  • 官方 API 兼容 OpenAI/Anthropic:kimi-k3 API 支持 OpenAI/Anthropic 兼容接口,迁移零成本

 

局限

  • K3 许可非无条件宽松:Kimi K3 License 对大规模 MaaS(连续 12 个月收入 >2000 万美元)有另签商业协议要求,月活 >1 亿或月收入 >2000 万美元的产品需界面展示”Kimi K3″标识——企业法务需审阅具体条款
  • 自托管硬件门槛极高:K3 权重仓库约 1.56TB、96 个权重分片;官方推理配方给出 8 卡到多节点起点,实验性最低 8×H100 80GB,生产环境需 64+ 加速器 ;社区实测 8×H100 仅能实验性加载,4×B200(1-bit)或 8×B200(原生 4-bit)才是现实自托管起点
  • 幻觉率风险:独立测试发现 K3 有 51% 的幻觉率,未在 Moonshot 官方基准图中披露;RAG、客服、法律/金融等事实准确性敏感场景需自行基准测试
  • 纯文本为主:K3 虽原生视觉理解,但不支持音频/视频输入;复杂多模态任务不及 Qwen3.8-27B、Gemma 4 12B 等统一多模态模型
  • 西方基础设施支持较弱:Moonshot 相较 DeepSeek/阿里规模更小,西方基础设施(如某些推理引擎优化)支持滞后
  • API 定价较高:K3 API 输入 $3/百万 token、输出 $15/百万 token,高于 DeepSeek V4 Pro(输出 $0.87-$3.96)与 DeepSeek V3.2(输出 $0.42)
  • K2 系列逐步下线:kimi-k2 已于 2026 年 5 月 25 日下线;kimi-k2.5 与 moonshot-v1 系列将于 2026 年 8 月 31 日全平台正式下线,需迁移至 K3
  • 中文文档优先:Moonshot 文档中文优先,英文文档滞后于版本发布

 

适用人群

  • Agent 编程与自动化团队:K3 在 SWE Marathon、GDPval-AA、AutomationBench-AA 等 Agent 基准登顶,是开放权重中构建编程 Agent、自动化工作流的首选
  • 长上下文 Agent 开发者:1M 上下文 + KDA 效率 + 原生工具调用,适合长轨迹多步 Agent 任务
  • 需 MIT 类许可的中小团队:K2.6/K2.7 Code 的 Modified MIT 对中小团队功能等同于 MIT;K3 对 99% 的非大规模 MaaS 场景也等同 MIT
  • 数据中心级自托管团队:具备 8×H100 或 4×B200 以上硬件资源的团队,可完全本地部署 K3
  • 通过托管 API 快速验证的团队:GitHub Copilot、OpenRouter、Fireworks AI、Moonshot API 均提供 K3 托管端点,无需自托管即可验证业务价值
  • 国产算力适配需求方:K3 已突破英伟达生态,在其他供应商 GPGPU 上完成测试

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
K2.6(Q4 量化) 8×A100/H100 80GB(约 247GB 显存)
K2.7 Code(Q4 量化) 8×A100/H100 80GB
K3 实验性加载(1-bit) 8×H100 80GB(实验性,不实用)
K3 现实自托管起点(1-bit) 4×B200
K3 原生 4-bit(MXFP4) 8×B200 或 8×H200
K3 生产环境 64+ 加速器(数据中心级)

⚠️ K3 权重仓库约 1.56TB、96 个权重分片,任何单机方案都应注明是否量化、裁剪、流式或只做概念验证——”消费级硬件运行 K3″在当前技术条件下不可行

 

2. 获取模型权重

从 Hugging Face 拉取官方权重:

# K3(Kimi K3 License,自定义许可)
huggingface-cli download moonshotai/Kimi-K3

# K2.6(Modified MIT)
huggingface-cli download moonshotai/Kimi-K2.6

# K2.7 Code(Modified MIT)
huggingface-cli download moonshotai/Kimi-K2.7-Code

 

3. 通过 vLLM 部署(K3 官方推荐)

# 安装最新 vLLM(含 KDA prefill cache 支持)
pip install -U vllm

# 启动 K3 服务(需 8×H100 80GB 起步)
vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \
  --enable-reasoning

💡 H100 可能需要 MXFP4 权重转换步骤;B200 原生支持 MXFP4

 

4. 通过 SGLang 部署

sglang serve --model-path moonshotai/Kimi-K3 \
  --tp 8 \
  --context-length 1000000

 

5. 通过 Hugging Face Transformers 推理(K2.6)

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "moonshotai/Kimi-K2.6"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name, torch_dtype="auto", device_map="auto"
)

 

6. K2.6 量化部署(消费级硬件唯一可行方案)

K2.6 1T 参数经 1.8-bit 极端量化后约 247GB 显存,需 8×A100/H100 80GB 集群 。社区 GGUF Q4 版本预期在权重发布后 24 小时内出现,但实际消费级硬件运行仍极其困难。

 

7. 云端 API 调用(推荐大多数团队)

Moonshot API(OpenAI 兼容)

from openai import OpenAI

client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.cn/v1"
)

# K3 API
response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码"}]
)

其他托管平台

  • OpenRouteropenrouter.ai/moonshotai/kimi-k3,定价 $3 输入/$15 输出每百万 token
  • GitHub Copilot:Pro 及以上版本模型选择器内置 K3(由 Fireworks AI 托管)
  • Fireworks AI、Together AI、Groq:K3 托管推理预期 48 小时内上线

 

8. Ollama 使用说明

# 注意:ollama pull kimi-k3:cloud 并非本地推理
# 该标签将提示转发至 Moonshot 基础设施,需付费 Ollama 账户
# 真正的本地推理取决于 llama.cpp 对 K3 架构的支持进度
ollama pull kimi-k3:cloud

⚠️ Ollama 的 kimi-k3:cloud 标签是云端转发而非本地推理,提示词会离开本机。真正的本地 K3 推理需等待 llama.cpp 对 K3 架构(KDA、896 专家 MoE)的支持落地

 

9. 部署前必检清单

  • 确认仓库位于 huggingface.co/moonshotai/Kimi-K3(官方组织,非复制仓库)
  • 商用部署前阅读 LICENSE 文件,确认 Kimi K3 License 具体条款
  • 确保 1.2TB+ 空闲存储(下载 + 推理缓存)
  • 如果是 MaaS 业务且连续 12 个月收入 >2000 万美元,需与 Moonshot 另签商业协议
  • 如果是月活 >1 亿或月收入 >2000 万美元的产品,需在界面显著展示”Kimi K3″标识
  • 事实准确性敏感场景(RAG、客服、法律/金融),自行运行幻觉率基准测试(独立测试发现 51% 幻觉率)

 

相关导航