MiniMax翻译站点

3周前更新 15 0 0

MiniMax 开放权重大模型家族,M3 是首个三项前沿能力兼备的开放模型。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

MiniMax 是 MiniMax AI 开发的开放权重大模型家族。截至 2026 年 8 月,最新开放权重主线 M3 于 2026 年 6 月 1 日发布,约 428B 总参/23B 激活 MoE,采用自研 MSA 稀疏注意力架构,1M 上下文,原生支持文本/图像/视频输入,是开放权重中首个同时具备前沿编程、1M 上下文与原生多模态三大能力的模型,采用 MiniMax Community License(自定义许可)。

 

产品概述

MiniMax 由 MiniMax AI(稀宇科技)开发,自 2025 年 M2 系列起步,是国产开放权重大模型家族中”前沿编程 + 超长上下文 + 原生多模态”路线的代表。公司成立于 2022 年初,定位 AGI 基础研究,自研多模态通用大模型具备代码、Agent、超长上下文处理能力 。

 

版本演进(具体以官网实时信息为准):

  • MiniMax M2(2025 年 10 月):MIT 许可,开放权重起点
  • MiniMax M2.5 / M2.7(2025-2026 年):许可转为 Modified MIT,商业使用需 MiniMax 书面授权
  • MiniMax M3(2026 年 6 月 1 日发布):当前最新开放权重主线。开放权重领域首个将前沿编程、1M 上下文、原生多模态三者合一的模型

 

当前主线 MiniMax M3 核心参数​ :

  • 架构:MoE + MiniMax Sparse Attention(MSA),128 个专家(top-4 + 1 shared),60 层(前 3 层稠密)
  • 总参数量:约 428B
  • 激活参数:约 23B/token
  • 上下文:1M tokens(API 保障最低 512K)
  • 最大输出:524,288 tokens(硬上限),官方推荐 131,072 tokens
  • 模态:原生多模态,文本/图像/视频输入,文本输出
  • 推理模式:自适应思考 / 关闭思考双模式
  • 许可:MiniMax Community License(自定义许可)
  • API 兼容:OpenAI 兼容 + Anthropic 兼容双格式
  • 权重体积:BF16 约 854GB,MXFP8 约 440GB

 

MSA 架构创新​ :

  • MiniMax Sparse Attention:全新的稀疏注意力架构,将 1M 上下文下的每 token 计算量降至前代模型的 1/20
  • 9× prefill / 15× decode 加速:在 1M 上下文长度下,prefill 阶段提速 9 倍以上,decode 阶段提速 15 倍以上
  • KV 外聚集 Q:以 KV block 为外循环聚合命中的 queries,每个 block 仅读取一次且内存访问连续,算术强度较开源 Flash-Sparse-Attention 与 flash-moba 提升 4 倍以上
  • 能力无损:在多项消融实验中,MSA 在绝大部分能力上匹配全注意力

 

Step 0 原生多模态训练​ :

M3 从训练第零步即进行多模态混合训练,文本与视觉语义空间高度对齐——多模态是”刻在模型骨子里的原生能力”,而非后期贴上去的视觉适配器。

 

许可策略(关键):

M3 采用 MiniMax Community License(自定义许可,非 OSI 开源):

  • 非商业使用:免费,可自由使用、复制、修改、合并、分发
  • 商业使用:需在产品相关网站、用户界面、博客、关于页或文档中醒目展示 “Built with MiniMax M3” 标识
  • 年收入 > 2000 万美元的商业产品:需联系 MiniMax 获取事先书面授权
  • 年收入 ≤ 2000 万美元:仅需在 api@minimax.io 发送一次性通知
  • 禁止军事用途、剥削未成年人、生成有害虚假信息、仇恨言论等
  • 无地域限制

💡 与 DeepSeek V4(MIT)、Qwen3.8-27B(Apache-2.0)、Gemma 4(Apache-2.0)、Phi-4(MIT)等”无条件宽松许可”不同,MiniMax M3 是”自定义社区许可”——对 99% 的中小团队功能上可用,但商业使用有署名义务与营收门槛。这是 MiniMax 继 M2.7 之后延续的许可策略:以开放权重扩大生态,同时守护官方 API 定价权 。

 

核心能力

  • 前沿编程与 Agent:M3 在 SWE-Bench Pro 达 59.0%,超越 GPT-5.5(58.6%)与 Gemini 3.1 Pro(54.2%),逼近 Opus 4.7(64.3%);Terminal-Bench 2.1 达 66.0%;MCP Atlas 达 74.2%
  • 1M 超长上下文:基于 MSA 架构实现 1M token 上下文窗口,是长程 Agent、长程 Coding、长视频理解的基础设施
  • 原生多模态:Step 0 多模态混合训练,文本/图像/视频统一处理,OmniDocBench 多模态基准超越 Gemini 3.1 Pro
  • 长程自主任务:官方演示 M3 连续 12 小时自主复现 ICLR 2025 杰出论文,产出 18 次 commit 与 23 张实验图表;24 小时优化 CUDA 算子实现 9.4× 加速
  • 双推理模式:自适应思考 / 关闭思考双模式,相同定价,灵活应对不同任务复杂度
  • 工具调用与 Agent 协作:具备自主任务拆解、工具调用与多步推理能力,目标是”直接可交付的代码”而非”能跑但需要人改”
  • SVG 生成:SVG-Bench 达 63.7%,超越 Opus 4.7(62.3%)、GPT-5.5(58.2%)、Gemini 3.1 Pro(59.2%)
  • 自主浏览与信息检索:BrowseComp 达 83.5%,超越 Opus 4.7(79.3)
  • 主流框架 Day 0 支持:vLLM(v0.24.0+ 稳定支持 )、SGLang、Transformers、KTransformers、Unsloth、ATOM 均已支持

 

优势亮点

  • 三项前沿能力首次合一:M3 是开放权重中首个同时具备前沿编程、1M 上下文、原生多模态的模型,此前这三项能力仅有闭源前沿模型(Opus 4.7、GPT-5.5、Gemini 3.1 Pro)具备
  • MSA 架构效率突破:1M 上下文下每 token 计算量降至前代 1/20,prefill 9× 加速、decode 15× 加速,让 1M 上下文在工程上真正可用
  • 极致 API 性价比:API 定价 $0.30/百万输入 token、$1.20/百万输出 token(512K 以内),约为 Claude Opus 4.8 的 1/6 价 ;$0.60/$2.40(512K 以上)
  • 国产算力 Day 0 适配:摩尔线程 MTT S5000 已完成 Day-0 极速适配,是国产 AI 芯片上的前沿开放权重选项
  • 双 API 兼容:同时兼容 OpenAI 与 Anthropic API 格式,迁移零成本
  • 真实工程级编程:M3 不只生成代码,更能”协作”——通过交互式用户模拟器框架训练,能主动澄清需求、调整方案、跨上下文分配任务、基于中间结果多轮迭代
  • 权重开放 + 模型卡详尽:Hugging Face 仓库提供完整权重、配置、分词器,下载量上月 17.3 万次

 

局限

  • 许可非宽松开源:MiniMax Community License 要求商业产品署名 “Built with MiniMax M3″,年收入 > 2000 万美元需事先书面授权——与 DeepSeek V4(MIT)形成最本质差异
  • 自托管硬件门槛极高:BF16 权重约 854GB,MXFP8 约 440GB ;社区 4-bit 量化不等同于完整 M3 体验,需匹配特定 GPU 架构(NVIDIA Blackwell NVFP4 / AMD MI350 MXFP4)
  • 独立评测智能指数不及顶级:Artificial Analysis 给出的 Intelligence Index 为 45.4,Coding Index 58.6,Agentic Index 36.1 ,与 DeepSeek V4、Kimi K3、GLM-5.3 等开放权重旗舰仍有差距
  • 部分基准不及同档闭源:Terminal-Bench 2.1(66.0 vs Opus 4.7 66.1、GPT-5.5 78.2)、OSWorld-verified(70% vs Opus 4.7 82.8)等基准上仍不及顶级闭源
  • 纯文本输出:M3 支持文本/图像/视频输入,但输出仅为文本,不支持图像/视频生成(图像/视频生成需使用 MiniMax 的 Hailuo 2.3 / Image 等产品线)
  • 基准多为厂商自测:SWE-Bench Pro 59.0% 等核心数据由 MiniMax 技术报告发布,第三方独立评测截至 2026 年 8 月仍在陆续出炉
  • 旧版本许可回溯:M2/M2.5/M2.7 已从 MIT 转为 Modified MIT 或自定义许可 ,早期用户的许可预期需重新确认

 

适用人群

  • 长程编程与 Agent 开发团队:1M 上下文 + SWE-Bench Pro 59.0% + 原生多模态,是开放权重中处理完整代码库、长视频理解、多文件重构的最佳选择
  • 多模态长文档分析:M3 原生多模态 + 1M 上下文,可一次性处理长视频、包含图表的 PDF、完整技术文档
  • 成本敏感的高并发场景:API 定价 $0.30/$1.20 每百万 token,约为同级闭源模型的 1/6,长上下文场景性价比突出
  • 可接受自定义许可的商业产品:年收入 ≤ 2000 万美元的商业产品,署名 “Built with MiniMax M3” 后即可商用
  • 国产算力适配需求方:摩尔线程 MTT S5000 Day-0 适配,是国产 AI 芯片上的前沿多模态开放权重
  • 数据中心级自托管团队:具备多卡 H100/B200 或国产智算集群的团队,可完全本地部署 M3

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
M3 BF16 全精度 多卡 H100/H200 集群(权重约 854GB)
M3 MXFP8(NVIDIA Blackwell) 多卡 B200,使用 NVIDIA ModelOpt 转换的 NVFP4 checkpoint(约 440GB)
M3 MXFP8(AMD MI350/MI355) 多卡 AMD MI355,使用 AMD Quark 转换的 MXFP4 checkpoint(约 440GB)
M3 社区 4-bit 量化 社区 GGUF/AWQ/GPTQ 转换版,需验证多模态/工具调用/MSA 完整性

⚠️ M3 权重约 854GB(BF16),任何单机方案都应注明量化方式与引擎兼容性。消费级硬件运行 M3 在当前技术条件下不可行,社区量化可能改变多模态支持、工具调用解析、MSA 执行等行为

 

2. 获取模型权重

从 Hugging Face 拉取官方权重:

# BF16 版本(约 854GB)
hf download MiniMaxAI/MiniMax-M3 --local-dir /srv/models/MiniMax-M3

# MXFP8 量化版本(约 440GB,推荐)
hf download MiniMaxAI/MiniMax-M3-MXFP8 --local-dir /srv/models/MiniMax-M3-MXFP8

# 使用 vLLM 官方推荐的下载方式
python3 -m pip install -U "huggingface_hub[cli]"
huggingface-cli download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3

💡 不要同时下载 BF16 和 MXFP8 来对比文件名,两者合计超过 1TB 存储空间

 

3. 通过 vLLM 部署(推荐生产环境)

vLLM v0.24.0+ 已稳定支持 M3 :

# 安装 vLLM
pip install vllm

# 启动 M3 服务
vllm serve MiniMaxAI/MiniMax-M3 \
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \
  --enable-reasoning

# 或使用 MXFP8 量化版本(Blackwell 架构)
vllm serve MiniMaxAI/MiniMax-M3-MXFP8 \
  --tensor-parallel-size 8 \
  --max-model-len 1000000

 

4. 通过 SGLang 部署

sglang serve --model-path MiniMaxAI/MiniMax-M3 \
  --tp 8 \
  --context-length 1000000

 

5. 通过 Hugging Face Transformers 推理

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "MiniMaxAI/MiniMax-M3"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name, torch_dtype="auto", device_map="auto"
)

 

6. 云端 API 调用(推荐大多数团队)

MiniMax 官方 API(OpenAI 兼容)

from openai import OpenAI

client = OpenAI(
    api_key="your-minimax-api-key",
    base_url="https://api.minimax.io/v1"
)

response = client.chat.completions.create(
    model="MiniMax-M3",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "video_url", "video_url": {"url": "https://example.com/video.mp4"}},
                {"type": "text", "text": "总结这段视频的内容"}
            ]
        }
    ]
)

Anthropic 兼容格式亦支持,便于从 Claude 生态迁移。

第三方托管平台

  • OpenRouter:$0.30/$1.20 每百万 token
  • Novita、Together AI、Fireworks、Featherless AI、DeepInfra 等平台均已上线 M3

 

7. 国产算力部署

摩尔线程 MTT S5000 已完成 Day-0 极速适配 :

# 使用摩尔线程提供的 vLLM 镜像
docker pull registry.mthreads.com/mcconline/inference/vllm:v0.20.0-ph1-4.3.5-torch2.9-20260605-mtcc51

 

8. 推理参数推荐

MiniMax 官方推荐推理参数 :

  • temperature = 1.0
  • top_p = 0.95

 

9. 部署前必检清单

  • 确认仓库位于 huggingface.co/MiniMaxAI/MiniMax-M3(官方组织)
  • 商用部署前阅读 MiniMax Community License,确认署名与营收门槛条款
  • 确保 1TB+ 空闲存储(BF16 + MXFP8 转换空间)
  • 多卡部署使用高带宽 GPU 互联,TP=8 跨慢速 PCIe 链接可能拟合但性能差
  • 起步配置:32K 或 128K 上下文上限、单请求、短输出,测量峰值显存后再扩容
  • 本地 OpenAI 兼容端口绑定 loopback,直至配置鉴权、TLS、请求限制与日志策略

⚠️ 自托管不免除许可义务——MiniMax Community License 对商业使用的署名与授权要求同样适用于自托管部署 。年收入 > 2000 万美元的产品必须获取 MiniMax 事先书面授权。

 

相关导航