
GPT-OSS 是 OpenAI 于 2025 年 8 月 5 日发布的开放权重大模型家族,是 OpenAI 自 2019 年 GPT-2 以来首次开放模型权重。当前开放权重主线包含 gpt-oss-120b(117B 总参/5.1B 激活)与 gpt-oss-20b(21B 总参/3.6B 激活)双变体,均采用 MoE 架构与 Apache-2.0 许可,原生 MXFP4 量化让 120b 可单卡 H100 运行、20b 可在 16GB 显存消费级硬件运行,是开放权重中”Apache-2.0 + 强推理 + 智能体原生”的代表。
产品概述
GPT-OSS 由 OpenAI 开发,于 2025 年 8 月 5 日发布,是 OpenAI 自 2019 年 GPT-2 以来首次开放模型权重——这一动作被视为开放权重领域的标志性事件:”OpenAI 自己的开放模型,运行在你的桌子上”成为数据主权论证的转折点 。
当前开放权重主线双变体核心参数 :
| 变体 | 层数 | 总参数量 | 激活参数 | 专家数 | 上下文 | 硬件门槛 |
|---|---|---|---|---|---|---|
| gpt-oss-120b | 36 | 117B | 5.1B | 128(每 token 激活 4) | 128K | 单卡 H100 80GB |
| gpt-oss-20b | 24 | 21B | 3.6B | 32(每 token 激活 4) | 128K | 16GB 显存/内存 |
架构创新:
- MoE 混合专家:120b 每 token 仅激活 5.1B 参数,20b 仅激活 3.6B,推理成本接近激活参数规模的稠密模型
- 原生 MXFP4 量化:OpenAI 出厂即以 MXFP4(4.25-bit block 格式)量化 MoE 权重 ,这是 120b 能在单卡 80GB GPU、20b 能在 16GB 消费级硬件运行的关键
- Harmony 聊天格式:自定义 harmony 响应格式,通过特殊 token 与 channels(analysis 用于 CoT、commentary 用于函数调用、final 用于用户可见答案)划分消息边界
- 分组多头查询注意力:组大小为 8,提升推理与内存效率
- 旋转位置嵌入(RoPE):原生支持最长 128K 上下文
许可策略(关键):
GPT-OSS 采用 Apache-2.0 许可 + OpenAI 补充使用政策 :
- Apache-2.0 赋予用户:自由下载、修改、微调、再分发、商用,无 copyleft 限制、无专利风险、无营收门槛、无月活限制
- 这是与 DeepSeek V4(MIT)、Qwen3.8-27B(Apache-2.0)、Gemma 4(Apache-2.0)、Phi-4(MIT)并列的”最干净许可”
- OpenAI 附加了一份 USAGE_POLICY.md 使用政策文件,对有害用途、恶意行为等施加行为约束 ——这是 Apache-2.0 许可之上的补充条款,部署前需审阅
- 与 Llama 4(Custom License + 7 亿月活条款)、Kimi K3(自定义许可 + MaaS 门槛)、MiniMax M3(自定义社区许可 + 署名义务)形成最本质差异:GPT-OSS 的权重许可本身是真正的 Apache-2.0
💡 GPT-OSS 的 Apache-2.0 是 OpenAI 对社区呼声的回应——”权重一旦发布就不会撤回”,它让”本地 AI 是否真的够好”这个问题的答案变成了”OpenAI 自己的开放模型,运行在你的桌子上”
核心能力
- 强推理与可调推理强度:支持 Low/Medium/High 三档推理级别,通过系统提示关键字配置 ;提高推理级别会增加平均思维链长度,准确性呈对数线性提升
- 完整思维链(CoT)可见:Gain complete access to model’s reasoning process,便于调试与增加输出可信度
- 智能体原生训练:基于与 OpenAI o3 相似的 CoT RL 技术后训练,原生支持函数调用、网页浏览、Python 代码执行、结构化输出
- MoE 高效推理:120b 每 token 激活 5.1B、20b 激活 3.6B,大模型知识容量+小模型推理成本
- 128K 长上下文:原生支持最长 128K 上下文长度
- MXFP4 量化友好:出厂即 MXFP4 量化,跳过社区量化环节,部署即高精度
- 主流框架 Day 0 支持:Hugging Face Transformers、vLLM、llama.cpp、Ollama、LM Studio、SGLang 全平台首发支持
- Harmony 格式自动化:使用 Transformers chat template 时自动应用 harmony 格式;vLLM、Ollama 等工作流有 OpenAI Cookbook 专用指南
优势亮点
- Apache-2.0 最宽松许可:OpenAI 首次以 Apache-2.0 开放权重,商用、修改、再分发无门槛——与 DeepSeek V4(MIT)并列”最干净许可”阵营
- 消费级硬件可运行 20b:gpt-oss-20b 在 16GB 显存/内存即可运行,是”大多数人已经拥有的硬件上能运行的最强能力模型”
- 单卡 H100 运行 120b:117B 总参的旗舰模型可部署于单张 80GB GPU(H100/A100/AMD MI300X),是数据中心自托管的甜点
- 接近 o4-mini 的推理能力:厂商基准显示 gpt-oss-120b 多项测试媲美甚至超越 o4-mini,gpt-oss-20b 与 o3-mini 相当
- 智能体工作流原生:函数调用、网页浏览、Python 执行、结构化输出均为一等公民,附官方 gpt-oss-mcp-server
- OpenAI 生态无缝迁移:兼容 OpenAI API 格式,从闭源 API 迁移至自托管零成本
- 多平台托管可用:Hugging Face、Ollama、AWS Bedrock、SageMaker、NVIDIA RTX AI PC、GB200 NVL72 全平台上线;NVIDIA 报告 GB200 NVL72 上 GPT-OSS 系列吞吐达 150 万 tokens/秒
- 权重不可逆:一旦发布即永久开放,”权重不会撤回”成为数据主权论证的转折点
局限
- 纯文本模态:GPT-OSS 仅为文本输入/输出,不支持图像、音频、视频 ——多模态需求需选用 Qwen3.8-27B、Gemma 4 12B、MiniMax M3 等
- 128K 上下文天花板:不及 DeepSeek V4(1M)、Kimi K3(1M)、MiniMax M3(1M)、Llama 4 Scout(10M),长文档/代码库分析场景受限
- 英文中心训练:预训练数据以英语为主,聚焦 STEM、编码、通用知识;多语种能力不及 Qwen(200+ 语言)、Mistral(80+ 欧洲语言)
- 知识截止 2024 年 6 月:训练数据截止 2024 年 6 月,时事与最新知识需依赖浏览工具
- 幻觉率高于 o4-mini:SimpleQA 与 PersonQA 评估中幻觉率高于 OpenAI o4-mini,较小模型倾向产生更多幻觉,需依赖外部信息检索降低
- Harmony 格式强制:模型必须使用 harmony 响应格式,否则”不会正确工作” ;直接使用 model.generate 需手动应用 harmony 模板,是社区最常见的”模型变傻” bug 来源
- 补充使用政策的合规约束:Apache-2.0 许可之上叠加 OpenAI USAGE_POLICY.md,对有害用途施加行为约束,企业部署前需审阅
- 与最新开放权重旗舰有差距:在 Artificial Analysis 等第三方榜单上,GPT-OSS-120b 的智能指数不及 2026 年的 DeepSeek V4 Pro、Kimi K3、GLM-5.3 等最新开放权重
- 20b 版本能力有限:gpt-oss-20b 定位低延迟与端侧场景,复杂推理、编程任务上不及 120b
适用人群
- 需 Apache-2.0 合规的商业产品:与 DeepSeek V4、Qwen3.8-27B、Gemma 4、Phi-4 并列”最干净许可”阵营,法务审核零障碍
- 消费级硬件本地部署:gpt-oss-20b 在 16GB 显存/内存即可运行,是”大多数人已经拥有的硬件上能运行的最强能力模型”
- 单卡数据中心自托管:gpt-oss-120b 单卡 H100 80GB 即可运行,是中端自托管团队的最佳选择
- 推理与智能体应用开发者:原生函数调用、网页浏览、Python 执行、结构化输出,附官方 MCP Server
- 从 OpenAI API 迁移的团队:兼容 OpenAI API 格式,迁移零成本,可将云端依赖转为本地主权
- 数据主权敏感的企业:Apache-2.0 权重 + 完全本地部署,满足医疗、金融、政企合规要求
- 需可调推理强度的场景:Low/Medium/High 三档推理级别,灵活平衡延迟与质量
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| gpt-oss-20b(MXFP4) | 单卡 RTX 4060 Ti 16GB / RTX 3090 24GB / Mac 16GB+ 统一内存 |
| gpt-oss-20b(BF16 全精度) | 单卡 A100 80GB |
| gpt-oss-120b(MXFP4) | 单卡 H100 80GB / A100 80GB / AMD MI300X 80GB |
| gpt-oss-120b(BF16 全精度) | 单卡 H100 80GB(极限)或多卡 |
| gpt-oss-120b 高吞吐 | NVIDIA GB200 NVL72(报告吞吐 150 万 tokens/秒) |
2. 通过 Ollama 一键运行(推荐入门)
# 拉取并运行 20b(消费级硬件) ollama pull gpt-oss:20b ollama run gpt-oss:20b # 拉取并运行 120b(需单卡 H100) ollama pull gpt-oss:120b ollama run gpt-oss:120b
3. 通过 Hugging Face Transformers 推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "openai/gpt-oss-20b"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype="auto", device_map="auto"
)
# Transformers chat template 会自动应用 harmony 格式
messages = [{"role": "user", "content": "解释 transformer 注意力机制"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
💡 如果使用 model.generate 直接调用而非 chat template,必须手动应用 harmony 格式,否则模型”不会正确工作”
4. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM pip install vllm # 启动 gpt-oss-120b 服务 vllm serve openai/gpt-oss-120b \ --tensor-parallel-size 1 \ --max-model-len 131072 # 启动 gpt-oss-20b 服务(消费级硬件) vllm serve openai/gpt-oss-20b \ --tensor-parallel-size 1 \ --max-model-len 131072
5. 通过 llama.cpp 部署
# llama.cpp 原生支持 GPT-OSS 的 MXFP4 格式 ./llama-cli -m gpt-oss-20b-MXFP4.gguf -p "你的提示词" -n 512
6. 云端 API 调用(不想自托管)
OpenAI 官方 API(OpenAI 兼容):
from openai import OpenAI
client = OpenAI(api_key="your-openai-api-key")
# 注意:通过 OpenAI 官方 API 调用 gpt-oss 是按 API 计费的托管服务
# 自托管请使用上述 vLLM/Ollama 方案
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "你好"}]
)
第三方托管平台:
- AWS Bedrock / SageMaker:已上线 GPT-OSS 模型
- Google Cloud Model Garden:gpt-oss-120b-maas / gpt-oss-20b-maas,2025 年 8 月 13 日 GA
- NVIDIA RTX AI PC:本地推理优化构建
7. 配置可调推理强度
在系统提示中通过关键字配置推理级别 :
Reasoning: low # 快速响应,适合通用对话 Reasoning: medium # 平衡速度与细节 Reasoning: high # 深度分析,CoT 更长,延迟更高
8. 智能体工具调用
GPT-OSS 原生支持函数调用、网页浏览、Python 代码执行。OpenAI 在官方仓库中提供了 gpt-oss-mcp-server 目录,开箱即用的 Model Context Protocol Server :
# 使用 OpenAI Cookbook 的 gpt-oss 工具调用指南 # 详见 cookbook.openai.com/topic/gpt-oss
9. 部署前必检清单
- 确认仓库位于
huggingface.co/openai/gpt-oss-120b与huggingface.co/openai/gpt-oss-20b(官方组织) - 审阅 USAGE_POLICY.md 补充使用政策,确认商业部署合规
- 使用 Transformers chat template 或手动应用 harmony 格式,否则模型”不会正确工作”
- 120b 部署确保单卡 80GB 显存(H100/A100/MI300X);20b 确保 16GB 显存/内存
- 生产环境建议使用 vLLM 获得更高吞吐;NVIDIA GB200 NVL72 上 GPT-OSS 系列可达 150 万 tokens/秒吞吐
相关导航


DeepSeek

Apertus

Gemma

OLMo

Llama

MiniMax

