Llama翻译站点

3周前更新 17 0 0

Meta 开放权重大模型家族,MoE 架构+原生多模态。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

Llama 是 Meta 开发的开放权重大模型家族,截至 2026 年 8 月最新开放权重主线为 Llama 4 系列。Llama 4 是 Meta 首个 MoE 架构、首个原生多模态的开放权重家族,含 Scout(109B 总参/17B 激活,10M 上下文)与 Maverick(400B 总参/17B 激活,1M 上下文)双变体,采用 Llama 4 Community License。Llama 是生态最成熟、微调资源最丰富、社区教程最多的开放权重家族,但许可并非 OSI 认证开源。

 

产品概述

Llama 由 Meta(原 Facebook)开发,自 2023 年 2 月首次发布以来,已成为全球部署最广泛的开放权重大模型家族 。需要明确的是:Llama 是”开放权重”(open-weight)而非 OSI 严格定义的”开源”——权重可免费下载自托管,但分发受 Meta 自定义社区许可约束 。

 

版本演进(具体以官网实时信息为准):

  • Llama 3 / 3.1 / 3.2 / 3.3(2024 年 4 月 – 2025 年 1 月):稠密架构,Llama 3.1 提供 8B/70B/405B,Llama 3.2 提供 1B/3B 端侧与 11B/90B 多模态,Llama 3.3 提供 70B
  • Llama 4 Scout / Maverick(2025 年 4 月 5 日发布):Meta 首个 MoE + 原生多模态家族,开放权重主线
  • Llama 4.5(2026 年 6 月):Scout 与 Maverick 的中周期刷新,增量能力升级、Agent 工具调用稳定性改进、512K 上下文支持
  • Llama 5(2026 年 5 月,第三方报道):含 8B 稠密与 Scout 109B-A17B MoE,采用新 Llama 5 Community License;但 Meta 官网”Latest Models”仍主推 Llama 4 系列

 

当前最新开放权重主线 Llama 4 核心参数​ :

变体 总参数量 激活参数 专家数 上下文 模态
Scout 109B 17B 16 10M 文本+图像
Maverick 400B 17B 128 1M 文本+图像

 

架构创新

  • MoE 混合专家:每 token 仅激活 17B 参数,推理成本接近 17B 稠密模型,却拥有 109B/400B 的知识容量
  • Early Fusion 早期融合:文本与视觉编码器在预训练阶段即融合,实现原生多模态
  • 10M 超长上下文:Scout 训练时即支持 10M token 上下文,是开放权重中上下文最长的模型
  • Chunked Attention 分块注意力:提升长上下文效率

 

许可策略(关键):

Llama 4 采用 Llama 4 Community License(自定义许可,非 OSI 开源):

  • 允许商用与微调
  • 月活 > 7 亿的产品需与 Meta 单独签订许可
  • 多模态模型在欧盟地区的使用存在额外限制
  • 需遵守 Llama 4 Acceptable Use Policy
  • 对于 99.9% 的开发者与中小企业,该许可在功能上等同于 Apache-2.0;但对于超大规模平台,是一道硬性墙

💡 与 DeepSeek V4(MIT)、Qwen 3.8(27B 为 Apache-2.0)不同,Llama 的许可是”开放权重但非严格开源”——这是 Llama 家族最本质的差异化特征,也是收录时必须明确提示用户的点。

 

核心能力

  • MoE 高效推理:Scout 与 Maverick 每 token 仅激活 17B 参数,大模型知识容量+小模型推理成本
  • 原生多模态:基于 Early Fusion,文本与图像在预训练阶段融合,Maverick 在 MMMU 73.4、ChartQA 90.0 等多模态基准上表现强劲
  • 10M 超长上下文(Scout):开放权重中上下文最长的模型,适合整库代码分析、长篇文档 QA、长轨迹 Agent
  • 1M 上下文(Maverick):平衡长上下文与推理质量
  • 推理与编程:Maverick 在 MMLU Pro 80.5、GPQA Diamond 69.8 等基准上达到开放权重第一梯队
  • Agent 工具调用:Llama 4.5 显著改进了 Agent 工具调用稳定性
  • 全场景覆盖:从 Llama 3.2 的 1B 端侧模型到 Maverick 400B 旗舰,尺寸矩阵完整
  • 生态最成熟:Ollama、vLLM、SGLang、llama.cpp、LM Studio 等工具首发支持;Axolotl、TorchTune、Unsloth 等微调框架原生适配

 

优势亮点

  • 生态最成熟:Ollama、LM Studio、vLLM、llama.cpp 全支持;数千个社区微调版本;教程资源最丰富
  • 10M 上下文唯一开放权重选项:Scout 的 10M 上下文是开放权重中绝无仅有的超长上下文能力
  • MoE 效率标杆:17B 激活参数让 400B 总参模型在 4×H100 上即可运行(Maverick BF16 约 800GB 显存)
  • 原生多模态:Early Fusion 架构让文本与图像处理统一,无需外接视觉编码器
  • Meta 持续投入:从 Llama 2 到 Llama 4.5,Meta 每季度均有更新,社区信心强
  • 商用友好(对绝大多数用户):月活 < 7 亿的产品可自由商用、微调、自托管
  • 硬件适配广泛:从树莓派(Llama 3.2 1B)到多卡 H100 集群,全硬件谱系覆盖

 

局限

  • 许可非 OSI 开源:Llama 4 Community License 有 7 亿月活条款、欧盟多模态限制、署名要求——严格意义上不是”开源”
  • 旗舰自托管成本高:Maverick BF16 全精度需 ~800GB 显存(16×H100),消费级硬件仅能运行量化版或较小版本
  • 前沿能力不及最新闭源:与 GPT-5.4、Gemini-3.1-Pro、Claude Opus 4.8 等最新闭源模型仍有差距;在编程等任务上 DeepSeek V4 Pro、Qwen 3.8-27B 也已超越 Maverick
  • Behemoth 未开放权重:2T 参数的 Behemoth 仍处于”预览/搁置”状态,开放权重的最高天花板由 Maverick 设定
  • 10M 上下文实际质量衰减:第三方测试确认 Scout 在数百万 token 长度上可用,但复杂推理任务在超过几十万 token 后质量明显下降
  • Llama 4 首发”基准虚高”质疑:社区共识认为 Llama 4 首发时基准分数与实际使用体验存在落差
  • Meta 前沿重心转向闭源:2026 年 4 月起 Meta 的前沿研究已转向闭源的 Muse Spark 系列,Llama 开放权重线进入”维护模式”

 

适用人群

  • 需要成熟生态的团队:Ollama/vLLM/微调框架全支持,遇到问题最容易找到解决方案
  • 长文档/代码库分析需求:Scout 的 10M 上下文是开放权重中处理超长文本的最佳选择
  • 多模态应用开发者:Early Fusion 架构让文本+图像处理统一且高效
  • 月活 < 7 亿的商用产品:Llama 4 Community License 在功能上等同于 Apache-2.0
  • 从 Llama 3 升级的存量用户:Llama 4 与 Llama 3 工具链高度兼容,迁移成本低
  • 欧盟以外地区的多模态应用:需注意欧盟对多模态模型的额外限制

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
Llama 3.2 1B/3B(端侧) 树莓派 5 / 手机 / 笔记本 CPU
Llama 3.1 8B(Q4 量化) 单卡 RTX 3060 8GB 或 Mac M2 16GB
Llama 3.3 70B(Q4 量化) 单卡 A100 80GB 或 4×RTX 4090
Llama 4 Scout(Int4 量化) 单卡 H100 80GB(Meta 官方验证)
Llama 4 Maverick(BF16 全精度) 4×H100 80GB(~800GB 显存)
Llama 4 Maverick(Int4 量化) 2×H100 80GB

 

2. 通过 Ollama 一键运行(推荐入门)

# Llama 3 系列
ollama pull llama3.1:8b
ollama pull llama3.3:70b
ollama run llama3.1:8b

# Llama 4 系列(以 Scout 为例,需先接受许可)
ollama pull llama4-scout
ollama run llama4-scout

💡 Ollama 会自动处理模型下载与量化,无需手动配置 CUDA

 

3. 通过 vLLM 部署(推荐生产环境)

# 安装 vLLM
pip install vllm

# 启动 Llama 3.1 8B 服务(需 --trust-remote-code)
vllm serve meta-llama/Meta-Llama-3.1-8B-Instruct \
  --port 8000 \
  --trust-remote-code \
  --gpu-memory-utilization 0.9

# 多卡部署 Llama 3.3 70B
vllm serve meta-llama/Meta-Llama-3.3-70B-Instruct \
  --tensor-parallel-size 2 \
  --port 8000

⚠️ Llama 模型权重需 --trust-remote-code 标志,否则会导致模型加载失败

 

4. 通过 Hugging Face Transformers 推理

import os
from openai import OpenAI

# vLLM 提供 OpenAI 兼容接口
client = OpenAI(
    api_key=os.environ["OPENAI_API_KEY"],
    base_url="http://localhost:8000/v1"
)

response = client.chat.completions.create(
    model="meta-llama/Meta-Llama-3.1-8B-Instruct",
    messages=[{"role": "user", "content": "解释 MoE 架构"}]
)
print(response.choices[0].message.content)

 

5. 量化部署(消费级硬件)

使用 llama.cpp 转换并量化:

# 将 HF 模型转为 GGUF 格式
python convert_hf_to_gguf.py Meta-Llama-3.1-8B-Instruct --outfile llama-3.1-8b-Q4_K_M.gguf

# Q4_K_M 量化运行(约 5GB 显存)
./llama-cli -m llama-3.1-8b-Q4_K_M.gguf -p "你的提示词" -n 512 --ctx-size 4096

常见量化方案

  • Q8_0:~1 byte/param,95%+ 质量保留,适合研究
  • Q4_K_M:~0.5 bytes/param,85-90% 质量保留,通用推荐
  • Q2_K:~0.25 bytes/param,70-80% 质量保留,极限硬件

 

6. Docker 部署

# Ollama via Docker
docker run -d -v ollama:/root/.ollama -p 11434:11434 \
  --name ollama ollama/ollama

# vLLM via Docker
docker run --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model meta-llama/Meta-Llama-3.1-8B-Instruct

 

7. 云端 API 调用(不想自托管)

通过 Together AI、Fireworks、Groq 等托管平台:

  • Scout:输入 ~$3/百万 token,输出 ~$7.5/百万 token
  • Maverick:输入 ~$8/百万 token,输出 ~$20/百万 token

 

8. 微调

Llama 4 架构已被 Axolotl、TorchTune、Unsloth 等框架支持(截至 2026 年 4 月):

  • LoRA / QLoRA:常用微调方式
  • 全参微调:由于总参数大(Scout 109B、Maverick 400B),成本高昂

⚠️ 部署前务必审阅具体版本的 Llama Community License——月活 > 7 亿的产品需与 Meta 单独签订许可;欧盟地区对多模态模型有额外限制

相关导航