
Mistral 是法国 Mistral AI 开发的开放权重大模型家族,截至 2026 年 8 月最新开放权重主线包含 Mistral Large 3(675B 总参/41B 激活 MoE,Apache-2.0)、Mistral Small 4(119B 总参/6.5B 激活 MoE,Apache-2.0)与 Mistral Medium 3.5(128B 稠密,Modified MIT)。家族普遍采用 Apache-2.0 许可,是欧洲数据主权合规下最成熟的开放权重选项,欧盟 AI Act 合规友好。
产品概述
Mistral AI 由前 DeepMind 与 Meta AI Llama 作者团队于 2023 年 4 月在巴黎创立,是欧洲最具影响力的 AI 实验室 。Mistral 的开放权重线以”高效+欧盟数据主权”为核心理念,是欧洲合规团队自托管大模型的首选 。
版本演进(具体以官网实时信息为准):
- Mistral 7B(2023 年 9 ):7.3B 稠密,Apache-2.0,开创欧洲开放权重先河
- Mixtral 8x7B / 8x22B(2023 年 12 月 – 2024 年 4 月):MoE 架构,Apache-2.0
- Mistral Large 2(2024 年 7 月):123B 稠密,但采用 Mistral Research License(非 Apache-2.0),社区批评后 Mistral 调整策略
- Mistral Large 3(2025 年 12 月):675B 总参/41B 激活 MoE,回到 Apache-2.0,是 Mistral 开放权重线的战略性回归
- Ministral 3 系列(2025 年 12 月):3B/8B/14B 稠密,Apache-2.0,端侧与边缘部署
- Mistral Small 4(2026 年 3 月):119B 总参/6.5B 激活 MoE,Apache-2.0,统一推理、视觉、编程三大能力
- Mistral Medium 3.5(2026 年 4 月):128B 稠密,Modified MIT 许可,Mistral 当前编程与 Agent 能力最强的开放权重模型
当前最新开放权重主干核心参数 :
| 模型 | 架构 | 总参/激活 | 上下文 | 许可 | 模态 |
|---|---|---|---|---|---|
| Mistral Large 3 | MoE | 675B / 41B | 256K | Apache-2.0 | 文本+视觉 |
| Mistral Small 4 | MoE | 119B / 6.5B | 256K | Apache-2.0 | 文本+视觉 |
| Mistral Medium 3.5 | 稠密 | 128B | 256K | Modified MIT | 文本+视觉 |
| Ministral 3 14B | 稠密 | 14B | 256K | Apache-2.0 | 文本+视觉 |
| Ministral 3 8B | 稠密 | 8B | 256K | Apache-2.0 | 文本+视觉 |
| Ministral 3 3B | 稠密 | 3B | 256K | Apache-2.0 | 文本+视觉 |
架构创新(Mistral Small 4) :
- 统一架构:首次将推理(Magistral)、视觉(Pixtral)、编程(Devstral)三条产品线合并为单一模型
- 128 专家 MoE:每 token 仅激活 4/128 专家,总计 6.5B 激活参数
- 可配置推理深度:通过
reasoning_effort参数调节推理强度 - 单 H100 可运行:压缩后可在单张 H100 上部署
许可策略(关键):
Mistral 开放权重线以 Apache-2.0 为主,但需注意:
- Mistral Large 3、Small 4、Ministral 3 全系列:Apache-2.0 ✅
- Mistral Medium 3.5:Modified MIT(含营收门槛),商用需审阅条款
- Mistral 7B、Mixtral 系列:Apache-2.0
💡 Mistral 对自身模型的描述是”open-weight”而非”open-source”——OSI 开源 AI 定义 1.0 要求训练数据也可查,Mistral 开放权重但不公开训练数据,严格意义上不属于 OSI 认证开源。但对 99% 的用户而言,Apache-2.0 版本在功能上与开源无异 。
核心能力
- MoE 高效推理:Large 3 每 token 激活 41B、Small 4 激活 6.5B,大模型知识容量+小模型推理成本
- 原生多模态:Large 3 与 Small 4 均原生支持图像理解(2.5B 视觉编码器)
- 统一推理/视觉/编程(Small 4):单一模型替代原先 Magistral + Pixtral + Devstral 三条产品线
- 256K 长上下文:家族主流 256K 上下文窗口
- 多语种(欧洲语言优势):Large 3 多语种能力覆盖 80+ 语言,法语、德语、西班牙语、意大利语、葡萄牙语等欧洲语言深度优化
- Agent 工具调用:原生 function calling,Mistral Medium 3.5 在 Agent 编程上接近前沿水平
- 可配置推理深度:通过
reasoning_effort参数(xhigh/medium/low)按任务复杂度调节 - 端侧部署(Ministral 3):3B/8B 版本可在笔记本、边缘设备运行
优势亮点
- Apache-2.0 为主许可:Large 3、Small 4、Ministral 3 全系列 Apache-2.0,商用无门槛
- 欧盟数据主权合规:La Plateforme 在欧洲数据中心处理数据,受欧盟司法管辖;开放权重版本可完全本地部署,满足最严格的数据主权要求
- 欧洲语言最强:在法语、德语、西语、意语、葡语等欧洲语言上,Large 3 是 API 可访问的最强选项
- 效率极致(Small 4):119B 总参仅激活 6.5B,单 H100 可运行,推理成本约为同能力稠密模型的 1/10
- 统一架构创新(Small 4):首次将推理+视觉+编程合并为单一模型,部署运维成本降低 40%,吞吐量提升 3 倍
- 性价比突出:Large 3 输出定价 $6/百万 token,比 GPT-5.4 便宜 60%、比 Claude Opus 4.6 便宜 92%
- 生态成熟:Ollama、vLLM、SGLang、llama.cpp 均首发支持;Mistral 自己的 La Plateforme 提供托管 API
局限
- Medium 3.5 许可受限:最新最强的开放权重模型采用 Modified MIT 许可(含营收门槛),大规模商用需审阅条款
- 上下文天花板 256K:Mistral 家族最大上下文为 256K,不及 DeepSeek V4 的 1M、Llama 4 Scout 的 10M
- 前沿能力不及最新闭源:与 GPT-5.4、Gemini-3.1-Pro、Claude Opus 4.6 等仍有差距;编程基准上不及 DeepSeek V4 Pro、Qwen 3.8-27B
- 非 OSI 严格开源:Mistral 开放权重但不公开训练数据,严格 OSI 定义下不算”开源”
- Small 4 Agent 能力中庸:第三方测试显示 Small 4 在 OpenClaw Agent 任务上仅约 17% 准确率,与同规模 Nemotron 相当,不及前沿 Agent 模型
- 视觉能力非专攻:Large 3 不针对视觉任务优化,复杂图像理解不及 Gemini、GPT-5 等专用多模态模型
- 美国/中国语种覆盖不及 Qwen:Qwen 支持 200+ 语言,Mistral 多语种深度集中在欧洲语言
适用人群
- 欧盟企业与数据主权敏感组织:La Plateforme 欧洲数据中心 + 开放权重本地部署,满足 EU AI Act 合规
- 欧洲语言业务:法语、德语、西语、意语、葡语等欧洲语言应用的首选
- 成本敏感的高并发场景:Small 4 的 6.5B 激活参数带来极致推理性价比
- 需统一推理/视觉/编程的团队:Small 4 单一模型替代三条产品线,运维成本大幅降低
- 端侧与边缘部署:Ministral 3 的 3B/8B 版本可部署在笔记本、边缘设备
- Apache-2.0 合规商业化:Large 3、Small 4 的 Apache-2.0 许可让法务审核零障碍
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| Ministral 3 3B | 笔记本 CPU 或树莓派 |
| Ministral 3 8B | 单卡 RTX 3060 8GB 或 Mac M2 16GB |
| Ministral 3 14B(Q4 量化) | 单卡 RTX 4090 24GB |
| Mistral Small 4(NVFP4 量化) | 单卡 H100 80GB |
| Mistral Small 4(BF16 全精度) | 2×H100 80GB |
| Mistral Large 3(Int4 量化) | 4×H100 80GB |
| Mistral Large 3(BF16 全精度) | 8×H100/H200 80GB |
| Mistral Medium 3.5(BF16) | 2-4×H100 80GB |
2. 通过 Ollama 一键运行(推荐入门)
# Ministral 3 端侧系列 ollama pull ministral:3b ollama pull ministral:8b ollama pull ministral:14b # Mistral Small 4 ollama pull mistral-small4 # Mistral Large 3 ollama pull mistral-large3 # 运行交互式对话 ollama run ministral:8b
3. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM pip install vllm # 启动 Mistral Small 4 服务 vllm serve mistralai/Mistral-Small-4-119B-2603 \ --tensor-parallel-size 1 \ --max-model-len 262144 # 多卡部署 Mistral Large 3 vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512 \ --tensor-parallel-size 8 \ --max-model-len 262144
4. 通过 Hugging Face Transformers 推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "mistralai/Mistral-Small-4-119B-2603"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype="auto", device_map="auto"
)
# 可配置推理深度
messages = [{"role": "user", "content": "解释 MoE 架构"}]
# Small 4 支持 reasoning_effort 参数
5. 量化部署(消费级硬件)
Mistral Small 4 的 NVFP4 版本已发布,单 H100 可运行 :
# 使用 vLLM 加载 NVFP4 量化版本 vllm serve mistralai/Mistral-Small-4-119B-2603-NVFP4 \ --tensor-parallel-size 1 \ --max-model-len 262144
6. Docker 部署
# vLLM + Mistral Small 4 docker run --runtime nvidia --gpus all \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -p 8000:8000 \ vllm/vllm-openai:latest \ --model mistralai/Mistral-Small-4-119B-2603
7. 云端 API 调用(不想自托管)
通过 Mistral La Plateforme(欧洲数据中心):
from openai import OpenAI
client = OpenAI(
api_key="your-mistral-api-key",
base_url="https://api.mistral.ai/v1"
)
response = client.chat.completions.create(
model="mistral-large-latest",
messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)
8. 微调
Mistral 系列已被主流微调框架支持:
- LoRA / QLoRA:常用微调方式
- Axolotl / TorchTune:原生支持 Mistral 架构
- Unsloth:对 Small 4、Large 3 有专项优化
⚠️ 部署前务必审阅具体版本的许可——Mistral Large 3、Small 4、Ministral 3 为 Apache-2.0;Mistral Medium 3.5 为 Modified MIT(含营收门槛),大规模商用需授权
相关导航


FLUX

DeepSeek
Open-Sora

Llama

GPT-OSS
Phi

