
MiniMax 是 MiniMax AI 开发的开放权重大模型家族。截至 2026 年 8 月,最新开放权重主线 M3 于 2026 年 6 月 1 日发布,约 428B 总参/23B 激活 MoE,采用自研 MSA 稀疏注意力架构,1M 上下文,原生支持文本/图像/视频输入,是开放权重中首个同时具备前沿编程、1M 上下文与原生多模态三大能力的模型,采用 MiniMax Community License(自定义许可)。
产品概述
MiniMax 由 MiniMax AI(稀宇科技)开发,自 2025 年 M2 系列起步,是国产开放权重大模型家族中”前沿编程 + 超长上下文 + 原生多模态”路线的代表。公司成立于 2022 年初,定位 AGI 基础研究,自研多模态通用大模型具备代码、Agent、超长上下文处理能力 。
版本演进(具体以官网实时信息为准):
- MiniMax M2(2025 年 10 月):MIT 许可,开放权重起点
- MiniMax M2.5 / M2.7(2025-2026 年):许可转为 Modified MIT,商业使用需 MiniMax 书面授权
- MiniMax M3(2026 年 6 月 1 日发布):当前最新开放权重主线。开放权重领域首个将前沿编程、1M 上下文、原生多模态三者合一的模型
当前主线 MiniMax M3 核心参数 :
- 架构:MoE + MiniMax Sparse Attention(MSA),128 个专家(top-4 + 1 shared),60 层(前 3 层稠密)
- 总参数量:约 428B
- 激活参数:约 23B/token
- 上下文:1M tokens(API 保障最低 512K)
- 最大输出:524,288 tokens(硬上限),官方推荐 131,072 tokens
- 模态:原生多模态,文本/图像/视频输入,文本输出
- 推理模式:自适应思考 / 关闭思考双模式
- 许可:MiniMax Community License(自定义许可)
- API 兼容:OpenAI 兼容 + Anthropic 兼容双格式
- 权重体积:BF16 约 854GB,MXFP8 约 440GB
MSA 架构创新 :
- MiniMax Sparse Attention:全新的稀疏注意力架构,将 1M 上下文下的每 token 计算量降至前代模型的 1/20
- 9× prefill / 15× decode 加速:在 1M 上下文长度下,prefill 阶段提速 9 倍以上,decode 阶段提速 15 倍以上
- KV 外聚集 Q:以 KV block 为外循环聚合命中的 queries,每个 block 仅读取一次且内存访问连续,算术强度较开源 Flash-Sparse-Attention 与 flash-moba 提升 4 倍以上
- 能力无损:在多项消融实验中,MSA 在绝大部分能力上匹配全注意力
Step 0 原生多模态训练 :
M3 从训练第零步即进行多模态混合训练,文本与视觉语义空间高度对齐——多模态是”刻在模型骨子里的原生能力”,而非后期贴上去的视觉适配器。
许可策略(关键):
M3 采用 MiniMax Community License(自定义许可,非 OSI 开源):
- 非商业使用:免费,可自由使用、复制、修改、合并、分发
- 商业使用:需在产品相关网站、用户界面、博客、关于页或文档中醒目展示 “Built with MiniMax M3” 标识
- 年收入 > 2000 万美元的商业产品:需联系 MiniMax 获取事先书面授权
- 年收入 ≤ 2000 万美元:仅需在 api@minimax.io 发送一次性通知
- 禁止军事用途、剥削未成年人、生成有害虚假信息、仇恨言论等
- 无地域限制
💡 与 DeepSeek V4(MIT)、Qwen3.8-27B(Apache-2.0)、Gemma 4(Apache-2.0)、Phi-4(MIT)等”无条件宽松许可”不同,MiniMax M3 是”自定义社区许可”——对 99% 的中小团队功能上可用,但商业使用有署名义务与营收门槛。这是 MiniMax 继 M2.7 之后延续的许可策略:以开放权重扩大生态,同时守护官方 API 定价权 。
核心能力
- 前沿编程与 Agent:M3 在 SWE-Bench Pro 达 59.0%,超越 GPT-5.5(58.6%)与 Gemini 3.1 Pro(54.2%),逼近 Opus 4.7(64.3%);Terminal-Bench 2.1 达 66.0%;MCP Atlas 达 74.2%
- 1M 超长上下文:基于 MSA 架构实现 1M token 上下文窗口,是长程 Agent、长程 Coding、长视频理解的基础设施
- 原生多模态:Step 0 多模态混合训练,文本/图像/视频统一处理,OmniDocBench 多模态基准超越 Gemini 3.1 Pro
- 长程自主任务:官方演示 M3 连续 12 小时自主复现 ICLR 2025 杰出论文,产出 18 次 commit 与 23 张实验图表;24 小时优化 CUDA 算子实现 9.4× 加速
- 双推理模式:自适应思考 / 关闭思考双模式,相同定价,灵活应对不同任务复杂度
- 工具调用与 Agent 协作:具备自主任务拆解、工具调用与多步推理能力,目标是”直接可交付的代码”而非”能跑但需要人改”
- SVG 生成:SVG-Bench 达 63.7%,超越 Opus 4.7(62.3%)、GPT-5.5(58.2%)、Gemini 3.1 Pro(59.2%)
- 自主浏览与信息检索:BrowseComp 达 83.5%,超越 Opus 4.7(79.3)
- 主流框架 Day 0 支持:vLLM(v0.24.0+ 稳定支持 )、SGLang、Transformers、KTransformers、Unsloth、ATOM 均已支持
优势亮点
- 三项前沿能力首次合一:M3 是开放权重中首个同时具备前沿编程、1M 上下文、原生多模态的模型,此前这三项能力仅有闭源前沿模型(Opus 4.7、GPT-5.5、Gemini 3.1 Pro)具备
- MSA 架构效率突破:1M 上下文下每 token 计算量降至前代 1/20,prefill 9× 加速、decode 15× 加速,让 1M 上下文在工程上真正可用
- 极致 API 性价比:API 定价 $0.30/百万输入 token、$1.20/百万输出 token(512K 以内),约为 Claude Opus 4.8 的 1/6 价 ;$0.60/$2.40(512K 以上)
- 国产算力 Day 0 适配:摩尔线程 MTT S5000 已完成 Day-0 极速适配,是国产 AI 芯片上的前沿开放权重选项
- 双 API 兼容:同时兼容 OpenAI 与 Anthropic API 格式,迁移零成本
- 真实工程级编程:M3 不只生成代码,更能”协作”——通过交互式用户模拟器框架训练,能主动澄清需求、调整方案、跨上下文分配任务、基于中间结果多轮迭代
- 权重开放 + 模型卡详尽:Hugging Face 仓库提供完整权重、配置、分词器,下载量上月 17.3 万次
局限
- 许可非宽松开源:MiniMax Community License 要求商业产品署名 “Built with MiniMax M3″,年收入 > 2000 万美元需事先书面授权——与 DeepSeek V4(MIT)形成最本质差异
- 自托管硬件门槛极高:BF16 权重约 854GB,MXFP8 约 440GB ;社区 4-bit 量化不等同于完整 M3 体验,需匹配特定 GPU 架构(NVIDIA Blackwell NVFP4 / AMD MI350 MXFP4)
- 独立评测智能指数不及顶级:Artificial Analysis 给出的 Intelligence Index 为 45.4,Coding Index 58.6,Agentic Index 36.1 ,与 DeepSeek V4、Kimi K3、GLM-5.3 等开放权重旗舰仍有差距
- 部分基准不及同档闭源:Terminal-Bench 2.1(66.0 vs Opus 4.7 66.1、GPT-5.5 78.2)、OSWorld-verified(70% vs Opus 4.7 82.8)等基准上仍不及顶级闭源
- 纯文本输出:M3 支持文本/图像/视频输入,但输出仅为文本,不支持图像/视频生成(图像/视频生成需使用 MiniMax 的 Hailuo 2.3 / Image 等产品线)
- 基准多为厂商自测:SWE-Bench Pro 59.0% 等核心数据由 MiniMax 技术报告发布,第三方独立评测截至 2026 年 8 月仍在陆续出炉
- 旧版本许可回溯:M2/M2.5/M2.7 已从 MIT 转为 Modified MIT 或自定义许可 ,早期用户的许可预期需重新确认
适用人群
- 长程编程与 Agent 开发团队:1M 上下文 + SWE-Bench Pro 59.0% + 原生多模态,是开放权重中处理完整代码库、长视频理解、多文件重构的最佳选择
- 多模态长文档分析:M3 原生多模态 + 1M 上下文,可一次性处理长视频、包含图表的 PDF、完整技术文档
- 成本敏感的高并发场景:API 定价 $0.30/$1.20 每百万 token,约为同级闭源模型的 1/6,长上下文场景性价比突出
- 可接受自定义许可的商业产品:年收入 ≤ 2000 万美元的商业产品,署名 “Built with MiniMax M3” 后即可商用
- 国产算力适配需求方:摩尔线程 MTT S5000 Day-0 适配,是国产 AI 芯片上的前沿多模态开放权重
- 数据中心级自托管团队:具备多卡 H100/B200 或国产智算集群的团队,可完全本地部署 M3
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| M3 BF16 全精度 | 多卡 H100/H200 集群(权重约 854GB) |
| M3 MXFP8(NVIDIA Blackwell) | 多卡 B200,使用 NVIDIA ModelOpt 转换的 NVFP4 checkpoint(约 440GB) |
| M3 MXFP8(AMD MI350/MI355) | 多卡 AMD MI355,使用 AMD Quark 转换的 MXFP4 checkpoint(约 440GB) |
| M3 社区 4-bit 量化 | 社区 GGUF/AWQ/GPTQ 转换版,需验证多模态/工具调用/MSA 完整性 |
⚠️ M3 权重约 854GB(BF16),任何单机方案都应注明量化方式与引擎兼容性。消费级硬件运行 M3 在当前技术条件下不可行,社区量化可能改变多模态支持、工具调用解析、MSA 执行等行为
2. 获取模型权重
从 Hugging Face 拉取官方权重:
# BF16 版本(约 854GB) hf download MiniMaxAI/MiniMax-M3 --local-dir /srv/models/MiniMax-M3 # MXFP8 量化版本(约 440GB,推荐) hf download MiniMaxAI/MiniMax-M3-MXFP8 --local-dir /srv/models/MiniMax-M3-MXFP8 # 使用 vLLM 官方推荐的下载方式 python3 -m pip install -U "huggingface_hub[cli]" huggingface-cli download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3
💡 不要同时下载 BF16 和 MXFP8 来对比文件名,两者合计超过 1TB 存储空间
3. 通过 vLLM 部署(推荐生产环境)
vLLM v0.24.0+ 已稳定支持 M3 :
# 安装 vLLM pip install vllm # 启动 M3 服务 vllm serve MiniMaxAI/MiniMax-M3 \ --tensor-parallel-size 8 \ --max-model-len 1000000 \ --enable-reasoning # 或使用 MXFP8 量化版本(Blackwell 架构) vllm serve MiniMaxAI/MiniMax-M3-MXFP8 \ --tensor-parallel-size 8 \ --max-model-len 1000000
4. 通过 SGLang 部署
sglang serve --model-path MiniMaxAI/MiniMax-M3 \ --tp 8 \ --context-length 1000000
5. 通过 Hugging Face Transformers 推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "MiniMaxAI/MiniMax-M3"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype="auto", device_map="auto"
)
6. 云端 API 调用(推荐大多数团队)
MiniMax 官方 API(OpenAI 兼容):
from openai import OpenAI
client = OpenAI(
api_key="your-minimax-api-key",
base_url="https://api.minimax.io/v1"
)
response = client.chat.completions.create(
model="MiniMax-M3",
messages=[
{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": "https://example.com/video.mp4"}},
{"type": "text", "text": "总结这段视频的内容"}
]
}
]
)
Anthropic 兼容格式亦支持,便于从 Claude 生态迁移。
第三方托管平台:
- OpenRouter:$0.30/$1.20 每百万 token
- Novita、Together AI、Fireworks、Featherless AI、DeepInfra 等平台均已上线 M3
7. 国产算力部署
摩尔线程 MTT S5000 已完成 Day-0 极速适配 :
# 使用摩尔线程提供的 vLLM 镜像 docker pull registry.mthreads.com/mcconline/inference/vllm:v0.20.0-ph1-4.3.5-torch2.9-20260605-mtcc51
8. 推理参数推荐
MiniMax 官方推荐推理参数 :
- temperature = 1.0
- top_p = 0.95
9. 部署前必检清单
- 确认仓库位于
huggingface.co/MiniMaxAI/MiniMax-M3(官方组织) - 商用部署前阅读 MiniMax Community License,确认署名与营收门槛条款
- 确保 1TB+ 空闲存储(BF16 + MXFP8 转换空间)
- 多卡部署使用高带宽 GPU 互联,TP=8 跨慢速 PCIe 链接可能拟合但性能差
- 起步配置:32K 或 128K 上下文上限、单请求、短输出,测量峰值显存后再扩容
- 本地 OpenAI 兼容端口绑定 loopback,直至配置鉴权、TLS、请求限制与日志策略
⚠️ 自托管不免除许可义务——MiniMax Community License 对商业使用的署名与授权要求同样适用于自托管部署 。年收入 > 2000 万美元的产品必须获取 MiniMax 事先书面授权。
相关导航


Apertus

Qwen
Open-Sora

Mistral

Stable Diffusion

DeepSeek

