
Llama 是 Meta 开发的开放权重大模型家族,截至 2026 年 8 月最新开放权重主线为 Llama 4 系列。Llama 4 是 Meta 首个 MoE 架构、首个原生多模态的开放权重家族,含 Scout(109B 总参/17B 激活,10M 上下文)与 Maverick(400B 总参/17B 激活,1M 上下文)双变体,采用 Llama 4 Community License。Llama 是生态最成熟、微调资源最丰富、社区教程最多的开放权重家族,但许可并非 OSI 认证开源。
产品概述
Llama 由 Meta(原 Facebook)开发,自 2023 年 2 月首次发布以来,已成为全球部署最广泛的开放权重大模型家族 。需要明确的是:Llama 是”开放权重”(open-weight)而非 OSI 严格定义的”开源”——权重可免费下载自托管,但分发受 Meta 自定义社区许可约束 。
版本演进(具体以官网实时信息为准):
- Llama 3 / 3.1 / 3.2 / 3.3(2024 年 4 月 – 2025 年 1 月):稠密架构,Llama 3.1 提供 8B/70B/405B,Llama 3.2 提供 1B/3B 端侧与 11B/90B 多模态,Llama 3.3 提供 70B
- Llama 4 Scout / Maverick(2025 年 4 月 5 日发布):Meta 首个 MoE + 原生多模态家族,开放权重主线
- Llama 4.5(2026 年 6 月):Scout 与 Maverick 的中周期刷新,增量能力升级、Agent 工具调用稳定性改进、512K 上下文支持
- Llama 5(2026 年 5 月,第三方报道):含 8B 稠密与 Scout 109B-A17B MoE,采用新 Llama 5 Community License;但 Meta 官网”Latest Models”仍主推 Llama 4 系列
当前最新开放权重主线 Llama 4 核心参数 :
| 变体 | 总参数量 | 激活参数 | 专家数 | 上下文 | 模态 |
|---|---|---|---|---|---|
| Scout | 109B | 17B | 16 | 10M | 文本+图像 |
| Maverick | 400B | 17B | 128 | 1M | 文本+图像 |
架构创新:
- MoE 混合专家:每 token 仅激活 17B 参数,推理成本接近 17B 稠密模型,却拥有 109B/400B 的知识容量
- Early Fusion 早期融合:文本与视觉编码器在预训练阶段即融合,实现原生多模态
- 10M 超长上下文:Scout 训练时即支持 10M token 上下文,是开放权重中上下文最长的模型
- Chunked Attention 分块注意力:提升长上下文效率
许可策略(关键):
Llama 4 采用 Llama 4 Community License(自定义许可,非 OSI 开源):
- 允许商用与微调
- 月活 > 7 亿的产品需与 Meta 单独签订许可
- 多模态模型在欧盟地区的使用存在额外限制
- 需遵守 Llama 4 Acceptable Use Policy
- 对于 99.9% 的开发者与中小企业,该许可在功能上等同于 Apache-2.0;但对于超大规模平台,是一道硬性墙
💡 与 DeepSeek V4(MIT)、Qwen 3.8(27B 为 Apache-2.0)不同,Llama 的许可是”开放权重但非严格开源”——这是 Llama 家族最本质的差异化特征,也是收录时必须明确提示用户的点。
核心能力
- MoE 高效推理:Scout 与 Maverick 每 token 仅激活 17B 参数,大模型知识容量+小模型推理成本
- 原生多模态:基于 Early Fusion,文本与图像在预训练阶段融合,Maverick 在 MMMU 73.4、ChartQA 90.0 等多模态基准上表现强劲
- 10M 超长上下文(Scout):开放权重中上下文最长的模型,适合整库代码分析、长篇文档 QA、长轨迹 Agent
- 1M 上下文(Maverick):平衡长上下文与推理质量
- 推理与编程:Maverick 在 MMLU Pro 80.5、GPQA Diamond 69.8 等基准上达到开放权重第一梯队
- Agent 工具调用:Llama 4.5 显著改进了 Agent 工具调用稳定性
- 全场景覆盖:从 Llama 3.2 的 1B 端侧模型到 Maverick 400B 旗舰,尺寸矩阵完整
- 生态最成熟:Ollama、vLLM、SGLang、llama.cpp、LM Studio 等工具首发支持;Axolotl、TorchTune、Unsloth 等微调框架原生适配
优势亮点
- 生态最成熟:Ollama、LM Studio、vLLM、llama.cpp 全支持;数千个社区微调版本;教程资源最丰富
- 10M 上下文唯一开放权重选项:Scout 的 10M 上下文是开放权重中绝无仅有的超长上下文能力
- MoE 效率标杆:17B 激活参数让 400B 总参模型在 4×H100 上即可运行(Maverick BF16 约 800GB 显存)
- 原生多模态:Early Fusion 架构让文本与图像处理统一,无需外接视觉编码器
- Meta 持续投入:从 Llama 2 到 Llama 4.5,Meta 每季度均有更新,社区信心强
- 商用友好(对绝大多数用户):月活 < 7 亿的产品可自由商用、微调、自托管
- 硬件适配广泛:从树莓派(Llama 3.2 1B)到多卡 H100 集群,全硬件谱系覆盖
局限
- 许可非 OSI 开源:Llama 4 Community License 有 7 亿月活条款、欧盟多模态限制、署名要求——严格意义上不是”开源”
- 旗舰自托管成本高:Maverick BF16 全精度需 ~800GB 显存(16×H100),消费级硬件仅能运行量化版或较小版本
- 前沿能力不及最新闭源:与 GPT-5.4、Gemini-3.1-Pro、Claude Opus 4.8 等最新闭源模型仍有差距;在编程等任务上 DeepSeek V4 Pro、Qwen 3.8-27B 也已超越 Maverick
- Behemoth 未开放权重:2T 参数的 Behemoth 仍处于”预览/搁置”状态,开放权重的最高天花板由 Maverick 设定
- 10M 上下文实际质量衰减:第三方测试确认 Scout 在数百万 token 长度上可用,但复杂推理任务在超过几十万 token 后质量明显下降
- Llama 4 首发”基准虚高”质疑:社区共识认为 Llama 4 首发时基准分数与实际使用体验存在落差
- Meta 前沿重心转向闭源:2026 年 4 月起 Meta 的前沿研究已转向闭源的 Muse Spark 系列,Llama 开放权重线进入”维护模式”
适用人群
- 需要成熟生态的团队:Ollama/vLLM/微调框架全支持,遇到问题最容易找到解决方案
- 长文档/代码库分析需求:Scout 的 10M 上下文是开放权重中处理超长文本的最佳选择
- 多模态应用开发者:Early Fusion 架构让文本+图像处理统一且高效
- 月活 < 7 亿的商用产品:Llama 4 Community License 在功能上等同于 Apache-2.0
- 从 Llama 3 升级的存量用户:Llama 4 与 Llama 3 工具链高度兼容,迁移成本低
- 欧盟以外地区的多模态应用:需注意欧盟对多模态模型的额外限制
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| Llama 3.2 1B/3B(端侧) | 树莓派 5 / 手机 / 笔记本 CPU |
| Llama 3.1 8B(Q4 量化) | 单卡 RTX 3060 8GB 或 Mac M2 16GB |
| Llama 3.3 70B(Q4 量化) | 单卡 A100 80GB 或 4×RTX 4090 |
| Llama 4 Scout(Int4 量化) | 单卡 H100 80GB(Meta 官方验证) |
| Llama 4 Maverick(BF16 全精度) | 4×H100 80GB(~800GB 显存) |
| Llama 4 Maverick(Int4 量化) | 2×H100 80GB |
2. 通过 Ollama 一键运行(推荐入门)
# Llama 3 系列 ollama pull llama3.1:8b ollama pull llama3.3:70b ollama run llama3.1:8b # Llama 4 系列(以 Scout 为例,需先接受许可) ollama pull llama4-scout ollama run llama4-scout
💡 Ollama 会自动处理模型下载与量化,无需手动配置 CUDA
3. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM pip install vllm # 启动 Llama 3.1 8B 服务(需 --trust-remote-code) vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct \ --port 8000 \ --trust-remote-code \ --gpu-memory-utilization 0.9 # 多卡部署 Llama 3.3 70B vllm serve meta-llama/Meta-Llama-3.3-70B-Instruct \ --tensor-parallel-size 2 \ --port 8000
⚠️ Llama 模型权重需
--trust-remote-code标志,否则会导致模型加载失败
4. 通过 Hugging Face Transformers 推理
import os
from openai import OpenAI
# vLLM 提供 OpenAI 兼容接口
client = OpenAI(
api_key=os.environ["OPENAI_API_KEY"],
base_url="http://localhost:8000/v1"
)
response = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "解释 MoE 架构"}]
)
print(response.choices[0].message.content)
5. 量化部署(消费级硬件)
使用 llama.cpp 转换并量化:
# 将 HF 模型转为 GGUF 格式 python convert_hf_to_gguf.py Meta-Llama-3.1-8B-Instruct --outfile llama-3.1-8b-Q4_K_M.gguf # Q4_K_M 量化运行(约 5GB 显存) ./llama-cli -m llama-3.1-8b-Q4_K_M.gguf -p "你的提示词" -n 512 --ctx-size 4096
常见量化方案:
- Q8_0:~1 byte/param,95%+ 质量保留,适合研究
- Q4_K_M:~0.5 bytes/param,85-90% 质量保留,通用推荐
- Q2_K:~0.25 bytes/param,70-80% 质量保留,极限硬件
6. Docker 部署
# Ollama via Docker docker run -d -v ollama:/root/.ollama -p 11434:11434 \ --name ollama ollama/ollama # vLLM via Docker docker run --runtime nvidia --gpus all \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -p 8000:8000 \ vllm/vllm-openai:latest \ --model meta-llama/Meta-Llama-3.1-8B-Instruct
7. 云端 API 调用(不想自托管)
通过 Together AI、Fireworks、Groq 等托管平台:
- Scout:输入 ~$3/百万 token,输出 ~$7.5/百万 token
- Maverick:输入 ~$8/百万 token,输出 ~$20/百万 token
8. 微调
Llama 4 架构已被 Axolotl、TorchTune、Unsloth 等框架支持(截至 2026 年 4 月):
- LoRA / QLoRA:常用微调方式
- 全参微调:由于总参数大(Scout 109B、Maverick 400B),成本高昂
⚠️ 部署前务必审阅具体版本的 Llama Community License——月活 > 7 亿的产品需与 Meta 单独签订许可;欧盟地区对多模态模型有额外限制
相关导航


Mistral

Apertus

Meta AI

GPT-OSS

DeepSeek

DeepSeek

