
Phi 是微软开发的小语言模型(SLM)开放权重家族,以”数据质量胜过参数规模”为核心理念。当前 Phi-4 系列包含 14B 旗舰、3.8B mini、5.6B 多模态、15B 推理视觉等多尺寸,全系 MIT 许可,通过 Azure AI Foundry、Hugging Face、Ollama 免费提供。Phi-4 14B 版在 MMLU、MATH、HumanEval 等基准上以小博大,4-bit 量化后可在 8GB 显存消费级 GPU 运行,是边缘端与端侧部署的标杆。
产品概述
Phi 由 Microsoft Research 开发,是微软的”小语言模型(SLM)”系列,创建初衷是为开发者提供”直接在设备上实现 AI 而无需云连接”的工具 。自 2023 年 Phi-1(1.3B)起步,Phi 家族秉持一个核心赌注:精心筛选的合成训练数据可以让小模型胜过大得多的对手 。
版本演进(具体以官网实时信息为准):
- Phi-1 / Phi-1.5 / Phi-2(2023 年):1.3B-2.7B,聚焦代码与推理
- Phi-3 / Phi-3.5(2024 年):3.8B 为主力,引入多模态与端侧优化
- Phi-4 14B(2024 年 12 月 12 日发布):当前家族旗舰稠密模型,MIT 许可,16K 上下文
- Phi-4-mini(3.8B)与 Phi-4-multimodal(5.6B)(2025 年 2 月 26 日发布):mini 支持 128K 上下文与函数调用;multimodal 支持文本+音频+图像输入,ASR 词错率 6.14% 登顶 HuggingFace OpenASR 排行榜
- Phi-4-reasoning / reasoning-plus(14B)(2025 年 4-5 月):基于 o3-mini 生成的推理链进行监督微调,plus 版追加基于结果的强化学习
- Phi-4-reasoning-vision-15B(2026 年 3 月 4 日发布):最新成员,15B 多模态推理模型,MIT 许可,支持 UI 理解、科学问题求解
当前示例:Phi-4 14B 核心参数 :
- 架构:14B 稠密 decoder-only Transformer
- 训练:9.8T tokens,1920 张 H100-80G 训练 21 天
- 上下文:16K tokens
- 许可:MIT
- 发布:2024 年 12 月 12 日(Azure AI Foundry 研究预览),2025 年 1 月 8 日 Hugging Face 开放权重
- 语言:约 8% 多语种,其余主要为英语
许可策略(关键):
Phi 家族全系 MIT 许可 ——这是与 DeepSeek V4 并列的最宽松许可:
- 允许商用、修改、合并、发布、再许可、销售
- 仅需保留许可与版权声明
- 无月活限制、无营收门槛、无商业审批
- Microsoft 从 Phi-3 起采用 MIT,并延续至 Phi-4 全系列,明确将 Phi 定位为”基础设施级组件”
💡 与 Llama 4(Custom License)、Qwen3.8-Max(Custom License)不同,Phi 的 MIT 许可是真正无门槛的 OSI 认证开源,法务审核零障碍——这是 Phi 在企业端侧部署场景中最核心的差异化优势。
核心能力
- 小模型高性能:Phi-4 14B 在 MMLU 84.8、MATH 80.4、HumanEval 82.6、GPQA 56.1 等基准上以小博大,推理与数学能力超越参数规模大数倍的模型
- 全硬件谱系覆盖:从 3.8B mini 端侧到 15B 多模态推理,覆盖 IoT、手机、笔记本、工作站全场景
- 原生多模态(Phi-4-multimodal):5.6B 统一处理文本、音频、图像输入,ASR 词错率 6.14% 登顶 OpenASR 排行榜
- 长上下文(Phi-4-mini):128K 上下文 + 函数调用,是端侧 Agent 的最佳选择
- 推理链优化(Phi-4-reasoning):基于 o3-mini 生成的推理链监督微调,在多个推理基准上超越 DeepSeek-R1-Distill-Llama-70B
- 视觉推理(Phi-4-reasoning-vision-15B):15B 多模态推理,支持 UI 理解、科学问题求解
- 设备端部署:Phi 模型通过 MIT 许可开放,专为”直接在设备上实现 AI 而无需云连接”设计
- ONNX Runtime 全平台:提供 CPU/GPU/DirectML 的 INT4 量化版本,覆盖服务器、桌面、移动 CPU
优势亮点
- MIT 最宽松许可:商用、修改、再分发、销售均无门槛,是企业合规最友好的开放权重家族
- “数据质量胜过规模”理念验证:Phi-4 14B 以小博大,证明精心筛选的合成数据训练可以让小模型胜过大模型
- 端侧部署标杆:Phi-4 14B 4-bit 量化后仅需 8GB 显存,可在消费级 GPU 运行;Phi-4-mini 3.8B 更是端侧与 IoT 的首选
- 多模态统一(5.6B):文本+音频+图像统一处理,ASR 性能登顶 OpenASR 排行榜
- 推理能力突出:Phi-4-reasoning 系列在推理基准上超越参数规模大数倍的蒸馏模型
- 全平台部署支持:Hugging Face Transformers、vLLM、SGLang、llama.cpp、ONNX Runtime、Ollama、Azure AI Foundry、GitHub Models、NVIDIA API Catalog 全平台覆盖
- 微软生态原生集成:Azure AI Foundry 一键部署、Windows 原生 ONNX 支持、.NET 生态深度适配
- 量化生态完善:ONNX Runtime 提供 CPU/GPU/DirectML 的 INT4 量化版本,从服务器到手机 CPU 均可高效运行
局限
- 16K 上下文天花板(Phi-4 14B):远低于 DeepSeek V4 的 1M、Llama 4 Scout 的 10M、Mistral Large 3 的 256K;Phi-4-mini 虽支持 128K,但模型容量限制长上下文实际质量
- 主要语言为英语:Phi-4 训练数据约 8% 为多语种,其余主要为英语 ,多语种能力不及 Qwen 3.8(200+ 语言)、Mistral(80+ 欧洲语言)
- 参数规模限制前沿能力:最大开放权重模型为 15B(reasoning-vision),在综合基准上与 DeepSeek V4 Pro(1.6T)、Qwen3.8-Max(2.4T)、Llama 4 Maverick(400B)存在明显差距
- 视觉能力非专攻:Phi-4-multimodal 虽支持图像输入,但在复杂视觉基准上不及 Gemini、GPT-5 等专用多模态模型
- 推理模型过度思考:Phi-4-reasoning 系列基于长链推理训练,简单任务延迟较高,需根据场景选择是否使用 reasoning 版本
- 最新版本许可需确认:Phi-4-reasoning-vision-15B 采用”宽松开源协议”,具体条款以官方声明为准,部署前需查阅模型卡
适用人群
- 端侧与边缘 AI 开发者:Phi-4-mini 3.8B 是 IoT、手机、嵌入式设备的首选;14B 4-bit 量化后单卡 RTX 4060 即可运行
- 数据主权敏感的企业:MIT 许可 + 完全本地部署,满足医疗、金融、政企的合规要求
- 需 MIT 合规的商业产品:与 DeepSeek V4、Gemma 4、Mistral Large 3、Qwen3.8-27B 并列”最干净许可”阵营
- 推理与数学应用:Phi-4 14B 在数学(MATH 80.4)、推理(GPQA 56.1)任务上以小博大
- 多模态端侧应用:Phi-4-multimodal 5.6B 统一处理文本/音频/图像,ASR 性能 SOTA
- Windows/.NET 生态开发者:Azure AI Foundry 一键部署,ONNX Runtime 原生 Windows 支持
- 成本敏感的高并发场景:小模型推理成本仅为大模型的 1/10-1/100
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| Phi-4-mini 3.8B(Q4 量化) | 树莓派 5 / 手机 / 笔记本 CPU |
| Phi-4-multimodal 5.6B(Q4 量化) | 单卡 RTX 3060 8GB 或 Mac M2 16GB |
| Phi-4 14B(Q4 量化) | 单卡 RTX 4060 8GB 或 RTX 4090 24GB |
| Phi-4 14B(BF16 全精度) | 单卡 A100 80GB 或 2×RTX 4090 24GB |
| Phi-4-reasoning-vision-15B | 单张 40GB+ 显存 GPU(如 A100 80GB、H100 80GB) |
| ONNX Runtime CPU INT4 | 任意现代 CPU(含移动端) |
2. 通过 Ollama 一键运行(推荐入门)
# Phi-4 14B ollama pull phi4 ollama run phi4 # Phi-4-mini ollama pull phi4-mini
3. 通过 Hugging Face Transformers 推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "microsoft/phi-4"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype="auto", device_map="auto"
)
messages = [{"role": "user", "content": "解释 MoE 架构"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
4. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM
pip install vllm
# 启动 Phi-4 服务
vllm serve "microsoft/phi-4" --max-model-len 16384
# OpenAI 兼容调用
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{"model": "microsoft/phi-4", "messages": [{"role": "user", "content": "法国的首都是哪里?"}]}'
5. 通过 SGLang 部署
pip install sglang python3 -m sglang.launch_server \ --model-path "microsoft/phi-4" \ --host 0.0.0.0 \ --port 30000
6. 通过 ONNX Runtime 部署(端侧与跨平台首选)
CPU / 移动端 INT4 量化:
# 下载 INT4 CPU 量化模型 huggingface-cli download microsoft/Phi-4-reasoning-onnx \ --include cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/* \ --local-dir . # 安装 ONNX Runtime GenAI pip install --pre onnxruntime-genai # 运行 python model-qa.py -m cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4 -e cpu
GPU / DirectML 部署:
# CUDA huggingface-cli download microsoft/Phi-4-reasoning-onnx --include gpu/* --local-dir . pip install --pre onnxruntime-genai-cuda python model-qa.py -m gpu/gpu-int4-rtn-block-32 -e cuda # DirectML(Windows 原生) pip install onnxruntime-genai-directml python model-qa.py -m gpu/gpu-int4-rtn-block-32 -e dml
💡 ONNX Runtime 提供 CPU/GPU/DirectML 的 INT4 量化版本,覆盖服务器、Windows/Linux/Mac 桌面、移动 CPU 全平台——这是 Phi 在端侧部署上最独特的优势
7. 通过 llama.cpp 量化部署
# 转换并量化 python convert_hf_to_gguf.py microsoft/phi-4 --outfile phi-4-Q4_K_M.gguf # 运行(约 8GB 显存) ./llama-cli -m phi-4-Q4_K_M.gguf -p "你的提示词" -n 512
8. Azure AI Foundry 云端部署
from openai import OpenAI
client = OpenAI(
api_key="your-azure-api-key",
base_url="https://your-resource.openai.azure.com/openai/deployments/phi-4"
)
response = client.chat.completions.create(
model="phi-4",
messages=[{"role": "user", "content": "你好"}]
)
9. Docker 部署
# Docker Model Runner docker model run hf.co/microsoft/phi-4 # vLLM Docker docker run --runtime nvidia --gpus all \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -p 8000:8000 \ vllm/vllm-openai:latest \ --model microsoft/phi-4
10. 微调
Phi 系列支持 LoRA/QLoRA 微调:
- Unsloth:对 Phi-4 有专项优化,内存效率比原生 Trainer 高 2-5 倍
- Axolotl / TorchTune:原生支持 Phi 架构
- Azure AI Foundry:提供托管微调服务
⚠️ 部署前请注意:Phi-4 主要语言为英语,多语种任务需评估;16K 上下文限制长文档处理;具体版本的许可条款以 Hugging Face 模型卡为准(Phi-4 全系 MIT,但 Phi-4-reasoning-vision-15B 的”宽松许可”具体条款需查阅官方声明)
相关导航


DeepSeek

Mistral

Copilot

Llama

Stable Diffusion
Open-Sora

