OLMo 是美国 Allen AI 研究院开发的完全开源大模型家族,截至 2026 年 8 月最新主线为 OLMo 3/3.1 系列,含 7B 与 32B 稠密模型,全系 Apache-2.0 许可。与仅开放权重的”open-weight”模型不同,OLMo 同时开放训练数据(Dolma 3)、训练代码(OLMo-core)、各阶段检查点与评估工具(OLMES),是开放权重领域中”真正可复现”的标杆,为科研审计与可信部署提供完整模型流。
产品概述
OLMo 由美国艾伦人工智能研究院(Allen Institute for AI, AI2)开发,是”fully open”(完全开放)理念的奠基者——不仅开放模型权重,更开放训练数据、训练代码、中间检查点与评估工具链 。
版本演进(具体以官网实时信息为准):
- OLMo 1(2024 年):AI2 首个完全开源大模型家族,确立”权重+数据+代码”全开放范式
- OLMo 2(2024 年 11 月):32B 版本在完全开源模型中达到 SOTA
- OLMo 3(2025 年 11 月 20 日发布):当前最新完全开源主线。7B 与 32B 稠密模型,Apache-2.0 许可,65K 上下文,多阶段训练流程
- OLMo 3.1(2025 年 12 月 12 日更新):在 OLMo 3 基础上延长 RL 训练 21 天、使用 224 GPU,发布 OLMo 3.1 Think 32B 与 OLMo 3.1 Instruct 32B,是当前完全开源 32B 级别最强模型
- OLMo Hybrid(2026 年):7B 混合 RNN 架构,预训练数据效率约为 OLMo 3 的 2 倍,长上下文推理效率提升 75 倍
当前主线 OLMo 3 核心参数 :
| 变体 | 训练 Token | 层数 | 隐藏维度 | 上下文 | 许可 |
|---|---|---|---|---|---|
| OLMo 3 7B | 5.93T | 32 | 4096 | 65,536 | Apache-2.0 |
| OLMo 3 32B | 5.50T | 64 | 5120 | 65,536 | Apache-2.0 |
变体矩阵:
- OLMo 3-Base(7B/32B):基础模型,编程、阅读理解、数学、长上下文场景的强力基座
- OLMo 3-Think(7B/32B):旗舰推理模型,显式输出中间推理步骤,为深度研究与 RL 实验量身打造
- OLMo 3-Instruct(7B):对话与快速响应导向的后训练模型,支持多轮、指令遵循、工具调用
- OLMo 3-RL Zero(7B):完全开放的 RL 训练路径,含 Math/Code/IF/General 四个领域检查点系列
“完全开放”的具体含义(OLMo 与仅”开放权重”模型的根本区别):
- 权重:Apache-2.0 许可开放 7B/32B 全变体
- 训练数据:Dolma 3 全量语料库约 9.3T tokens 开放,含 Dolma 3 Mix(5.9T 预训练混合)、Dolma 3 Dolmino(100B 中训练数学/代码/阅读)、Dolma 3 Longmino(50B 长上下文)
- 训练代码:OLMo-core 分布式训练框架(支持 1024 H100 集群,7.7K tokens/秒/设备吞吐量)
- 中间检查点:预训练各阶段、SFT/DPO/RLVR 各阶段模型快照全开放,开发者可基于任意节点分叉
- 评估工具:OLMES 可复现评估工具包、OlmoTrace 输出追溯工具(可将模型输出追溯至训练数据原文)
- 数据处理工具:datamap-rs(Rust 数据清洗)、duplodocus(模糊去重)、decon(测试集污染移除)
许可策略(关键):
OLMo 3 全系采用 Apache-2.0 许可——这是与 DeepSeek V4(MIT)、Qwen3.8-27B(Apache-2.0)、Gemma 4(Apache-2.0)、Phi-4(MIT)、GPT-OSS(Apache-2.0)并列的最宽松许可:
- 权重、代码、检查点:Apache-2.0
- 训练数据 Dolma 3:Open Data Commons Attribution License v1.0(ODC-By),允许研究、教育及商用
- 无营收门槛、无月活限制、无商业审批、无署名义务
- 真正符合 OSI 开源 AI 定义 1.0(权重+数据双重开放)
💡 与 Llama 4(Custom License)、Kimi K3(自定义许可)、MiniMax M3(自定义社区许可)形成最本质差异:OLMo 不仅是”open-weight”,更是”open-source”——AI2 的口号是”The model flow is the full lifecycle of an LM”,即开放完整模型生命周期而非仅终点 。这种”完全开放”让 OLMo 成为大模型训练机制研究的黄金基座。
核心能力
- 完全可复现训练:权重+数据+代码+检查点+评估工具五重开放,可从头复现 OLMo 3 全流程
- 多阶段训练透明:预训练(5.93T/5.50T tokens)→ 中训练(Dolmino 100B)→ 长上下文扩展(Longmino 50B)→ SFT → DPO → RLVR,每阶段快照开放
- 强推理(Think 变体):OLMo 3.1 Think 32B 通过延长 21 天 RL 训练,在 AIME 提升 5+ 分、ZebraLogic 提升 4+ 分、IFEVAL 提升 4+ 分、IFBench 提升 20+ 分
- 指令遵循与工具调用(Instruct 变体):OLMo 3-Instruct 7B 在指令遵循、工具调用等任务中与同规模 Qwen 3 系列竞争
- 65K 长上下文:Base 模型在约 65K tokens 长度内保持性能,适合长文档处理
- OLMo Hybrid 架构探索:7B 混合 RNN 模型,预训练数据效率约为 OLMo 3 的 2 倍,长上下文推理效率提升 75 倍
- OlmoTrace 输出追溯:可将模型输出高亮追溯至训练数据原文,审计幻觉、检测污染、研究 scaling law
- 主流框架支持:Transformers 4.57.0+、vLLM、Ollama、LM Studio、llama.cpp 均已支持;LM Studio 上 7B 约 6GB、32B Think 约 19GB
优势亮点
- 真正的 OSI 认证开源:权重与训练数据双重 Apache-2.0/ODC-By 开放,是唯一符合 OSI 开源 AI 定义 1.0 的主流大模型家族
- 完全可复现黄金标准:AI2 公开 OLMo-core 训练代码、OLMES 评估工具、各阶段检查点,学术界可低成本复现 SOTA 训练流程
- OlmoTrace 审计能力:模型输出可溯源至训练数据原文,是幻觉审计、污染检测、scaling law 研究的独家能力
- Apache-2.0 最宽松许可:商用、修改、再分发无门槛,与 DeepSeek V4(MIT)并列”最干净许可”阵营
- 训练效率极致:OLMo 3-Think 32B 在训练 tokens 少约 6 倍的情况下,缩小了与 Qwen 3 32B 等最佳开放权重模型的差距
- 科研与教学首选:完全开放的模型流让 OLMo 成为大模型训练课程、RL 算法研究、AI 安全研究的黄金基座
- 工具链完整开源:OLMo-core、datamap-rs、duplodocus、decon、OLMES 全部开源,开箱即用
- 非营利机构背书:AI2 为非营利研究机构,OLMo 的开放承诺不受商业利益摇摆影响
局限
- 规模天花板 32B:OLMo 3 最大仅 32B 稠密模型,在综合基准上与 DeepSeek V4 Pro(1.6T)、Kimi K3(2.8T)、GLM-5.3(744B)等开放权重旗舰有明显差距
- 65K 上下文限制:不及 DeepSeek V4/Kimi K3/MiniMax M3 的 1M 上下文、Llama 4 Scout 的 10M 上下文
- 纯文本模态:OLMo 3 仅为文本模型,不支持视觉、音频、视频输入;多模态需求需选用 Qwen3.8-27B、Gemma 4 12B 等
- 英文为主:预训练数据以英语为核心,多语种能力不及 Qwen(200+ 语言)、Mistral(80+ 欧洲语言)
- 前沿能力不及顶级闭源:OLMo 3.1 Think 32B 虽是完全开源最强 32B 推理模型,但与 Opus 4.8、GPT-5.6、Gemini 3.1 Pro 等闭源前沿仍有显著差距
- 自托管 32B 仍需中高端硬件:BF16 全精度 32B 约需单卡 A100 80GB;7B 版本可在消费级硬件运行
- 数据许可细微差别:训练数据 Dolma 3 采用 ODC-By 许可(非 Apache-2.0),虽允许商用但需署名,与权重的 Apache-2.0 略有差异
适用人群
- 大模型训练研究者:OLMo 的完整模型流是复现 SOTA 训练、研究 scaling law、验证 RL 算法的黄金基座
- AI 安全与审计团队:OlmoTrace 可将模型输出追溯至训练数据原文,是幻觉审计、污染检测的独家能力
- 需要数据主权与合规的企业:Apache-2.0 权重 + ODC-By 数据 + 完全本地部署,满足医疗、金融、政企最严格的合规要求
- 学术机构与教学:完全开放的代码、数据、检查点、评估工具,是大模型课程的理想教材
- 需 Apache-2.0 合规的商业产品:与 DeepSeek V4、Qwen3.8-27B、Gemma 4、Phi-4、GPT-OSS 并列”最干净许可”阵营
- RL 算法研究者:OLMo 3-RL Zero 系列提供 Math/Code/IF/General 四个领域的完整 RLVR 检查点,是 RL 研究的绝佳起点
- 端侧与边缘部署:7B 版本 6GB 内存即可运行,LM Studio 上可直接加载
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| OLMo 3 7B(Q4 量化) | 笔记本 CPU 或 6GB 显存 GPU |
| OLMo 3 7B(BF16 全精度) | 单卡 RTX 3060 8GB 或 Mac M2 16GB |
| OLMo 3 32B(Q4 量化) | 单卡 A100 80GB 或 4×RTX 4090 24GB |
| OLMo 3 32B(BF16 全精度) | 单卡 A100 80GB |
| OLMo 3.1 32B Think(BF16) | 单卡 A100 80GB 或 2×RTX 4090 24GB |
| 从头复现训练 | 需 OLMo-core 框架,可扩展至 1024×H100 集群 |
2. 通过 Transformers 推理(官方推荐,需 transformers>=4.57.0)
from transformers import AutoModelForCausalLM, AutoTokenizer
# OLMo 3 7B
model_id = "allenai/Olmo-3-7B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype="auto", device_map="auto"
)
messages = [{"role": "user", "content": "解释 transformer 架构"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
# 8-bit 量化加速
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.float16, load_in_8bit=True
)
3. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM pip install vllm # 启动 OLMo 3 7B Instruct 服务 vllm serve allenai/Olmo-3-7B-Instruct \ --tensor-parallel-size 1 \ --max-model-len 65536 # 启动 OLMo 3.1 32B Think 服务 vllm serve allenai/Olmo-3.1-32B-Think \ --tensor-parallel-size 1 \ --max-model-len 65536
4. 通过 Ollama / LM Studio 运行(端侧推荐)
# Ollama 暂未原生支持 OLMo 3,可通过 LM Studio 加载 GGUF # LM Studio 中搜索 "olmo3",7B 约 6GB、32B Think 约 19GB
5. 获取训练数据(完全开放的核心价值)
# Dolma 3 Mix(5.9T 预训练数据) huggingface-cli download allenai/dolma3_mix-150B-1025 # 150B 样本用于分析 huggingface-cli download allenai/dolma3_mix-5.5T-1125 # 完整 5.5T 预训练数据 # Dolma 3 Dolmino(100B 中训练数学/代码/阅读) huggingface-cli download allenai/dolma3_dolmino_mix-100B-1125 # Dolma 3 Longmino(50B 长上下文) huggingface-cli download allenai/dolma3_longmino_mix-50B-1025 # Dolci 后训练数据集 huggingface-cli download allenai/olmo-3-post-training
6. 使用 OLMo-core 从头训练
# 克隆 OLMo-core 训练框架 git clone https://github.com/allenai/olmo-core cd olmo-core # 启动分布式训练(示例:8×H100) torchrun --nproc_per_node=8 \ scripts/train.py \ --config configs/olmo3-7b.yaml
7. 基于中间检查点分叉训练
# 加载特定训练阶段的检查点
from transformers import AutoModelForCausalLM
# 预训练阶段 1 检查点
model = AutoModelForCausalLM.from_pretrained(
"allenai/Olmo-3-1125-32B",
revision="stage1-step10000"
)
# 中训练阶段检查点
model = AutoModelForCausalLM.from_pretrained(
"allenai/Olmo-3-1125-32B",
revision="stage2-ingredient1-stepXXX"
)
8. RLVR 微调(使用 Open Instruct)
# 使用 open-instruct 后训练管道 git clone https://github.com/allenai/open-instruct cd open-instruct # 运行 RLVR 训练脚本 bash ./scripts/train/olmo3/rlvr_script.sh --learning_rate=1e-3
9. OlmoTrace 输出追溯(独家审计能力)
通过 OlmoTrace 工具,可将模型输出高亮追溯至训练数据原文:
# 参见 AI2 官方 OlmoTrace 文档 # 用于审计幻觉、检测污染、研究 scaling laws
10. Docker 部署
# vLLM + OLMo 3 docker run --runtime nvidia --gpus all \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -p 8000:8000 \ vllm/vllm-openai:latest \ --model allenai/Olmo-3-7B-Instruct
11. 部署前必检清单
- 确认仓库位于
huggingface.co/allenai/Olmo-3-7B-Instruct与allenai/Olmo-3.1-32B-Think(官方组织) - 商用部署时训练数据 Dolma 3 需遵守 ODC-By 署名要求(权重本身 Apache-2.0 无署名义务)
- 确保 transformers>=4.57.0(OLMo 3 最低要求)
- 32B 模型 BF16 全精度需单卡 A100 80GB;7B 模型消费级硬件即可运行
- 如需复现训练,使用 OLMo-core 框架与公开的 Dolma 3 数据集
相关导航

Qwen

Mistral

DeepSeek

SEA-LION

Gemma

MOCHI

