GPT-OSS翻译站点

3周前更新 17 0 0

OpenAI 自 GPT-2 以来首次开放权重,Apache-2.0 许可。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

GPT-OSS 是 OpenAI 于 2025 年 8 月 5 日发布的开放权重大模型家族,是 OpenAI 自 2019 年 GPT-2 以来首次开放模型权重。当前开放权重主线包含 gpt-oss-120b(117B 总参/5.1B 激活)与 gpt-oss-20b(21B 总参/3.6B 激活)双变体,均采用 MoE 架构与 Apache-2.0 许可,原生 MXFP4 量化让 120b 可单卡 H100 运行、20b 可在 16GB 显存消费级硬件运行,是开放权重中”Apache-2.0 + 强推理 + 智能体原生”的代表。

 

产品概述

GPT-OSS 由 OpenAI 开发,于 2025 年 8 月 5 日发布,是 OpenAI 自 2019 年 GPT-2 以来首次开放模型权重——这一动作被视为开放权重领域的标志性事件:”OpenAI 自己的开放模型,运行在你的桌子上”成为数据主权论证的转折点 。

 

当前开放权重主线双变体核心参数​ :

变体 层数 总参数量 激活参数 专家数 上下文 硬件门槛
gpt-oss-120b 36 117B 5.1B 128(每 token 激活 4) 128K 单卡 H100 80GB
gpt-oss-20b 24 21B 3.6B 32(每 token 激活 4) 128K 16GB 显存/内存

 

架构创新

  • MoE 混合专家:120b 每 token 仅激活 5.1B 参数,20b 仅激活 3.6B,推理成本接近激活参数规模的稠密模型
  • 原生 MXFP4 量化:OpenAI 出厂即以 MXFP4(4.25-bit block 格式)量化 MoE 权重 ,这是 120b 能在单卡 80GB GPU、20b 能在 16GB 消费级硬件运行的关键
  • Harmony 聊天格式:自定义 harmony 响应格式,通过特殊 token 与 channels(analysis 用于 CoT、commentary 用于函数调用、final 用于用户可见答案)划分消息边界
  • 分组多头查询注意力:组大小为 8,提升推理与内存效率
  • 旋转位置嵌入(RoPE):原生支持最长 128K 上下文

 

许可策略(关键):

GPT-OSS 采用 Apache-2.0 许可​ + OpenAI 补充使用政策 :

  • Apache-2.0 赋予用户:自由下载、修改、微调、再分发、商用,无 copyleft 限制、无专利风险、无营收门槛、无月活限制
  • 这是与 DeepSeek V4(MIT)、Qwen3.8-27B(Apache-2.0)、Gemma 4(Apache-2.0)、Phi-4(MIT)并列的”最干净许可”
  • OpenAI 附加了一份 USAGE_POLICY.md 使用政策文件,对有害用途、恶意行为等施加行为约束 ——这是 Apache-2.0 许可之上的补充条款,部署前需审阅
  • 与 Llama 4(Custom License + 7 亿月活条款)、Kimi K3(自定义许可 + MaaS 门槛)、MiniMax M3(自定义社区许可 + 署名义务)形成最本质差异:GPT-OSS 的权重许可本身是真正的 Apache-2.0

💡 GPT-OSS 的 Apache-2.0 是 OpenAI 对社区呼声的回应——”权重一旦发布就不会撤回”,它让”本地 AI 是否真的够好”这个问题的答案变成了”OpenAI 自己的开放模型,运行在你的桌子上”

 

核心能力

  • 强推理与可调推理强度:支持 Low/Medium/High 三档推理级别,通过系统提示关键字配置 ;提高推理级别会增加平均思维链长度,准确性呈对数线性提升
  • 完整思维链(CoT)可见:Gain complete access to model’s reasoning process,便于调试与增加输出可信度
  • 智能体原生训练:基于与 OpenAI o3 相似的 CoT RL 技术后训练,原生支持函数调用、网页浏览、Python 代码执行、结构化输出
  • MoE 高效推理:120b 每 token 激活 5.1B、20b 激活 3.6B,大模型知识容量+小模型推理成本
  • 128K 长上下文:原生支持最长 128K 上下文长度
  • MXFP4 量化友好:出厂即 MXFP4 量化,跳过社区量化环节,部署即高精度
  • 主流框架 Day 0 支持:Hugging Face Transformers、vLLM、llama.cpp、Ollama、LM Studio、SGLang 全平台首发支持
  • Harmony 格式自动化:使用 Transformers chat template 时自动应用 harmony 格式;vLLM、Ollama 等工作流有 OpenAI Cookbook 专用指南

 

优势亮点

  • Apache-2.0 最宽松许可:OpenAI 首次以 Apache-2.0 开放权重,商用、修改、再分发无门槛——与 DeepSeek V4(MIT)并列”最干净许可”阵营
  • 消费级硬件可运行 20b:gpt-oss-20b 在 16GB 显存/内存即可运行,是”大多数人已经拥有的硬件上能运行的最强能力模型”
  • 单卡 H100 运行 120b:117B 总参的旗舰模型可部署于单张 80GB GPU(H100/A100/AMD MI300X),是数据中心自托管的甜点
  • 接近 o4-mini 的推理能力:厂商基准显示 gpt-oss-120b 多项测试媲美甚至超越 o4-mini,gpt-oss-20b 与 o3-mini 相当
  • 智能体工作流原生:函数调用、网页浏览、Python 执行、结构化输出均为一等公民,附官方 gpt-oss-mcp-server
  • OpenAI 生态无缝迁移:兼容 OpenAI API 格式,从闭源 API 迁移至自托管零成本
  • 多平台托管可用:Hugging Face、Ollama、AWS Bedrock、SageMaker、NVIDIA RTX AI PC、GB200 NVL72 全平台上线;NVIDIA 报告 GB200 NVL72 上 GPT-OSS 系列吞吐达 150 万 tokens/秒
  • 权重不可逆:一旦发布即永久开放,”权重不会撤回”成为数据主权论证的转折点

 

局限

  • 纯文本模态:GPT-OSS 仅为文本输入/输出,不支持图像、音频、视频 ——多模态需求需选用 Qwen3.8-27B、Gemma 4 12B、MiniMax M3 等
  • 128K 上下文天花板:不及 DeepSeek V4(1M)、Kimi K3(1M)、MiniMax M3(1M)、Llama 4 Scout(10M),长文档/代码库分析场景受限
  • 英文中心训练:预训练数据以英语为主,聚焦 STEM、编码、通用知识;多语种能力不及 Qwen(200+ 语言)、Mistral(80+ 欧洲语言)
  • 知识截止 2024 年 6 月:训练数据截止 2024 年 6 月,时事与最新知识需依赖浏览工具
  • 幻觉率高于 o4-mini:SimpleQA 与 PersonQA 评估中幻觉率高于 OpenAI o4-mini,较小模型倾向产生更多幻觉,需依赖外部信息检索降低
  • Harmony 格式强制:模型必须使用 harmony 响应格式,否则”不会正确工作” ;直接使用 model.generate 需手动应用 harmony 模板,是社区最常见的”模型变傻” bug 来源
  • 补充使用政策的合规约束:Apache-2.0 许可之上叠加 OpenAI USAGE_POLICY.md,对有害用途施加行为约束,企业部署前需审阅
  • 与最新开放权重旗舰有差距:在 Artificial Analysis 等第三方榜单上,GPT-OSS-120b 的智能指数不及 2026 年的 DeepSeek V4 Pro、Kimi K3、GLM-5.3 等最新开放权重
  • 20b 版本能力有限:gpt-oss-20b 定位低延迟与端侧场景,复杂推理、编程任务上不及 120b

 

适用人群

  • 需 Apache-2.0 合规的商业产品:与 DeepSeek V4、Qwen3.8-27B、Gemma 4、Phi-4 并列”最干净许可”阵营,法务审核零障碍
  • 消费级硬件本地部署:gpt-oss-20b 在 16GB 显存/内存即可运行,是”大多数人已经拥有的硬件上能运行的最强能力模型”
  • 单卡数据中心自托管:gpt-oss-120b 单卡 H100 80GB 即可运行,是中端自托管团队的最佳选择
  • 推理与智能体应用开发者:原生函数调用、网页浏览、Python 执行、结构化输出,附官方 MCP Server
  • 从 OpenAI API 迁移的团队:兼容 OpenAI API 格式,迁移零成本,可将云端依赖转为本地主权
  • 数据主权敏感的企业:Apache-2.0 权重 + 完全本地部署,满足医疗、金融、政企合规要求
  • 需可调推理强度的场景:Low/Medium/High 三档推理级别,灵活平衡延迟与质量

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
gpt-oss-20b(MXFP4) 单卡 RTX 4060 Ti 16GB / RTX 3090 24GB / Mac 16GB+ 统一内存
gpt-oss-20b(BF16 全精度) 单卡 A100 80GB
gpt-oss-120b(MXFP4) 单卡 H100 80GB / A100 80GB / AMD MI300X 80GB
gpt-oss-120b(BF16 全精度) 单卡 H100 80GB(极限)或多卡
gpt-oss-120b 高吞吐 NVIDIA GB200 NVL72(报告吞吐 150 万 tokens/秒)

 

2. 通过 Ollama 一键运行(推荐入门)

# 拉取并运行 20b(消费级硬件)
ollama pull gpt-oss:20b
ollama run gpt-oss:20b

# 拉取并运行 120b(需单卡 H100)
ollama pull gpt-oss:120b
ollama run gpt-oss:120b

 

3. 通过 Hugging Face Transformers 推理

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "openai/gpt-oss-20b"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype="auto", device_map="auto"
)

# Transformers chat template 会自动应用 harmony 格式
messages = [{"role": "user", "content": "解释 transformer 注意力机制"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))

💡 如果使用 model.generate 直接调用而非 chat template,必须手动应用 harmony 格式,否则模型”不会正确工作”

 

4. 通过 vLLM 部署(推荐生产环境)

# 安装 vLLM
pip install vllm

# 启动 gpt-oss-120b 服务
vllm serve openai/gpt-oss-120b \
  --tensor-parallel-size 1 \
  --max-model-len 131072

# 启动 gpt-oss-20b 服务(消费级硬件)
vllm serve openai/gpt-oss-20b \
  --tensor-parallel-size 1 \
  --max-model-len 131072

 

5. 通过 llama.cpp 部署

# llama.cpp 原生支持 GPT-OSS 的 MXFP4 格式
./llama-cli -m gpt-oss-20b-MXFP4.gguf -p "你的提示词" -n 512

 

6. 云端 API 调用(不想自托管)

OpenAI 官方 API(OpenAI 兼容)

from openai import OpenAI

client = OpenAI(api_key="your-openai-api-key")

# 注意:通过 OpenAI 官方 API 调用 gpt-oss 是按 API 计费的托管服务
# 自托管请使用上述 vLLM/Ollama 方案
response = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "你好"}]
)

第三方托管平台

  • AWS Bedrock / SageMaker:已上线 GPT-OSS 模型
  • Google Cloud Model Garden:gpt-oss-120b-maas / gpt-oss-20b-maas,2025 年 8 月 13 日 GA
  • NVIDIA RTX AI PC:本地推理优化构建

 

7. 配置可调推理强度

在系统提示中通过关键字配置推理级别 :

Reasoning: low    # 快速响应,适合通用对话
Reasoning: medium # 平衡速度与细节
Reasoning: high   # 深度分析,CoT 更长,延迟更高

 

8. 智能体工具调用

GPT-OSS 原生支持函数调用、网页浏览、Python 代码执行。OpenAI 在官方仓库中提供了 gpt-oss-mcp-server 目录,开箱即用的 Model Context Protocol Server :

# 使用 OpenAI Cookbook 的 gpt-oss 工具调用指南
# 详见 cookbook.openai.com/topic/gpt-oss

 

9. 部署前必检清单

  • 确认仓库位于 huggingface.co/openai/gpt-oss-120bhuggingface.co/openai/gpt-oss-20b(官方组织)
  • 审阅 USAGE_POLICY.md 补充使用政策,确认商业部署合规
  • 使用 Transformers chat template 或手动应用 harmony 格式,否则模型”不会正确工作”
  • 120b 部署确保单卡 80GB 显存(H100/A100/MI300X);20b 确保 16GB 显存/内存
  • 生产环境建议使用 vLLM 获得更高吞吐;NVIDIA GB200 NVL72 上 GPT-OSS 系列可达 150 万 tokens/秒吞吐

 

相关导航