
Gemma 是 Google DeepMind 开发的开放权重大模型家族,源自 Gemini 同源技术。截至 2026 年 8 月最新主线 Gemma 4 于 2026 年 4 月发布、6 月扩充 12B 统一多模态版本,全系 Apache-2.0 许可,覆盖从手机端侧(E2B/E4B)到工作站(26B MoE/31B Dense)的全硬件谱系,原生支持文本、图像、视频、音频多模态输入,是真正的 Apache-2.0 端侧开放权重标杆。
产品概述
Gemma 由 Google DeepMind 开发,是”与 Gemini 同源技术、但开放权重可本地运行”的模型家族 。自 2024 年 2 月 Gemma 1 首发以来,Gemmaverse 已积累超 4 亿次下载、10 万+ 社区衍生模型 。
版本演进(具体以官网实时信息为准):
- Gemma 1(2024 年 2 月):2B/7B 稠密,初代开放权重
- Gemma 2(2024 年 6 月):2B/9B/27B,PaliGemma 视觉语言变体
- Gemma 3 / 3n(2025 年 3 月/6 月):270M-27B 尺寸矩阵;3n 系列加入原生音频
- Gemma 4(2026 年 4 月 2 日发布):当前最新开放权重主线。Apache-2.0 许可(取代此前的定制 Gemma License),含 E2B、E4B、26B MoE、31B Dense 四个尺寸
- Gemma 4 12B(2026 年 6 月 3 日新增):统一多模态架构(无编码器),填补 E4B 与 26B 之间的笔记本电脑部署档位
当前最新主线 Gemma 4 核心参数 :
| 变体 | 架构 | 有效/总参 | 上下文 | 模态 | 目标平台 |
|---|---|---|---|---|---|
| E2B | 端侧 | 2.3B effective / 5.1B 总参 | 128K | 文本+图像+视频+音频 | 手机、树莓派 |
| E4B | 端侧 | 4.5B effective / 8B 总参 | 128K | 文本+图像+视频+音频 | 手机、笔记本 |
| 12B | 统一多模态 | 12B(无编码器) | 256K | 文本+图像+视频+音频 | 笔记本电脑 |
| 26B A4B | MoE | 26B 总参 / 3.8B 激活 | 256K | 文本+图像+视频 | 桌面、小服务器 |
| 31B | 稠密 | 31B | 256K | 文本+图像+视频 | 单卡 H100 / 大服务器 |
架构创新:
- 源自 Gemini 3 技术:Gemma 4 是基于 Gemini 3 同源技术训练的开放权重版本
- 统一多模态架构(12B):移除独立的视觉/音频编码器,原始信号直接投影入 LLM 主干,降低延迟与显存
- MoE 高效推理(26B A4B):每 token 仅激活 3.8B 参数
- 多令牌预测(MTP):Gemma 4 引入 MTP 草稿模型,移动 GPU 解码提速最高 2.2 倍,移动 CPU 提速最高 1.5 倍
- 端侧 2-bit 量化:E2B 在树莓派 5 上 2-bit 量化后仅占 1.5GB RAM
许可策略(关键):
Gemma 4 全系采用 Apache-2.0 许可——这是 Gemma 家族历史上首次真正”OSI 认证开源”,取代了此前定制 Gemma License 的”可下载但不算开源”状态 。Apache-2.0 赋予用户:
- 商用、修改、再分发无门槛
- 无需 Google 审批,无月活限制
- 专利授权保护
- 与 Mistral Large 3/Small 4、Qwen 3.8-27B 同为最干净的开放权重许可
💡 Gemma 4 的 Apache-2.0 是 Google 对社区反馈的直接回应——此前 Gemma 2/3 使用定制许可,被 OSI 认定为”open-weight 而非 open-source”;Gemma 4 彻底消除这一争议,成为与 Llama 4(Custom License)最本质的差异化 。
核心能力
- 全硬件谱系覆盖:从树莓派(E2B 2-bit 量化 1.5GB RAM)到单卡 H100(31B Dense)
- 原生多模态:全系支持文本、图像、视频输入;E2B/E4B/12B 额外支持音频输入
- 256K 长上下文:26B/31B/12B 支持 256K 上下文,E2B/E4B 支持 128K
- Agent 原生支持:原生 function calling、结构化 JSON 输出、系统指令,可构建自主 Agent
- 代码生成:31B 在 LiveCodeBench 达 80.0%,支持高质量离线代码生成
- 140+ 语言覆盖:原生训练 140+ 语言,多语种应用友好
- 高级推理:31B 在 AIME 2026 达 89.2%、GPQA Diamond 84.3%、MMLU Pro 85.2%
- 统一多模态架构(12B):无编码器设计,视觉/音频原始信号直接入 LLM 主干,降低延迟
优势亮点
- 真正的 Apache-2.0 开源:Gemma 家族首次 OSI 认证开源,商用无门槛、无月活限制(区别于 Llama 4 Custom License)
- 端侧多模态唯一开放权重选项:E2B/E4B 在手机、树莓派上完全离线运行多模态推理,是开放权重中端侧能力最强的家族
- 每参数智能密度最高:31B Dense 在 LMArena 文本榜排名全球开放模型第 3,性能超过参数大 20 倍的模型
- MoE 极致效率(26B A4B):3.8B 激活参数带来接近 4B 模型的推理速度,LMArena 1441 分位列开放模型第 6
- 笔记本电脑可运行 12B 多模态:16GB 显存/统一内存即可本地运行统一多模态模型,是笔记本 AI 应用的最佳选择
- MTP 加速:移动 GPU 解码最高 2.2 倍加速,零质量损失
- Google 生态原生集成:Android AICore、Google AI Edge Gallery、LiteRT-LM、Pixel 设备深度适配
- Gemmaverse 生态成熟:4 亿+ 下载、10 万+ 衍生模型,Hugging Face / Kaggle / Ollama 全平台可获
局限
- 超长上下文不及 Llama 4 Scout:Gemma 4 最大 256K 上下文,而 Llama 4 Scout 达 10M
- 编程巅峰能力不及 DeepSeek V4 Pro:31B 在 LiveCodeBench 80.0%,而 V4 Pro 在 SWE-bench Verified 达 80.6% 且参数规模大一个量级
- 31B 自托管仍需高端硬件:BF16 全精度需单卡 H100 80GB;消费级显卡需量化
- E2B/E4B 性能天然受限:端侧模型在复杂推理任务上不及 26B/31B
- 视觉能力非专攻:虽然原生多模态,但在复杂视觉基准(MMMU Pro)上 31B 得 76.9%,不及 Gemini 3 Pro 等专用多模态模型
- MTP 并非全场景适用:E2B 在 CPU 自由生成任务上启用 MTP 可能轻微减速,需按任务选择性开启
- 旧版 Gemma 许可不干净:Gemma 1/2/3 仍为定制 Gemma License,只有 Gemma 4 是 Apache-2.0,收录时需注意版本区分
适用人群
- 端侧与边缘 AI 开发者:E2B/E4B 在手机、树莓派、IoT 设备上完全离线运行多模态推理
- 笔记本电脑本地 AI 应用:12B 统一多模态模型 16GB 显存即可运行,是 MacBook/PC 本地 AI 的最佳选择
- 数据主权敏感的企业:Apache-2.0 许可 + 完全本地部署,满足医疗、金融等合规要求
- 多模态应用开发者:全系原生多模态,从端侧到云端统一架构
- Agent 编程与工具调用场景:原生 function calling,可构建自主 Agent
- Google 生态开发者:Android AICore、Pixel 设备、Google Cloud 深度集成
- 需 Apache-2.0 合规的商业化团队:与其他 Apache-2.0 开放权重(Mistral、Qwen)形成合规组合
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| Gemma 4 E2B(2-bit 量化) | 树莓派 5 / 手机 / 1.5GB RAM |
| Gemma 4 E4B(4-bit 量化) | 笔记本 CPU 或 Mac M2 16GB |
| Gemma 4 12B | 单卡 RTX 4060 16GB 或 Mac M3 16GB 统一内存 |
| Gemma 4 26B A4B(NVFP4 量化) | 单卡 H100 80GB |
| Gemma 4 31B(BF16 全精度) | 单卡 H100 80GB |
| Gemma 4 31B(Int4 量化) | 单卡 A100 80GB 或 4×RTX 4090 24GB |
2. 通过 LiteRT-LM 部署(Google 官方主推,端侧首选)
# 安装 LiteRT-LM pip install litert-lm # 导入预转换的 Gemma 4 模型 litert-lm import \ --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \ gemma-4-E2B-it.litertlm # 启动 OpenAI 兼容的本地 API 服务 litert-lm serve --port 8000 # 命令行直接运行 litert-lm run \ --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \ gemma-4-E2B-it.litertlm \ --prompt="法国的首都是哪里?"
💡 LiteRT-LM 是 Google AI Edge 团队推出的官方端侧推理框架,支持 Android、iOS、Windows、Linux、macOS、树莓派 5、高通 Dragonwing IQ8 等全平台
3. 通过 Ollama 快速运行(推荐入门)
ollama pull gemma4 ollama run gemma4
4. 通过 Hugging Face Transformers 推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "google/gemma-4-12B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype="auto", device_map="auto"
)
# 多模态输入(12B 统一架构)
messages = [{
"role": "user",
"content": [
{"type": "image", "image": "path/to/image.jpg"},
{"type": "text", "text": "描述这张图片"}
]
}]
5. 通过 vLLM / SGLang 部署(生产环境)
# vLLM 部署 31B vllm serve google/gemma-4-31B \ --tensor-parallel-size 1 \ --max-model-len 262144 # SGLang 部署 26B MoE sglang serve --model-path google/gemma-4-26B-A4B \ --tp 1 \ --context-length 262144
6. 通过 llama.cpp 部署(CPU / Apple Silicon)
# 将 HF 模型转为 GGUF 格式 python convert_hf_to_gguf.py google/gemma-4-12B --outfile gemma-4-12b-Q4_K_M.gguf # 运行量化版本 ./llama-cli -m gemma-4-12b-Q4_K_M.gguf -p "你的提示词" -n 512
7. MLX 部署(Apple Silicon 专属)
# MLX 是 Apple Silicon 统一内存最优解 # Gemma 4 12B 在 16GB 统一内存的 MacBook 上可原生运行 mlx_lm generate --model google/gemma-4-12B-MLX --prompt "解释多模态架构"
8. 图形化一键试用
不想写代码的开发者,可使用:
- LM Studio:图形化加载 Gemma 4 12B
- Google AI Edge Gallery:Android/iOS 端官方 App
- Google AI Edge Eloquent:Mac 端集成 12B,支持 Voice Edit 会话式输入
9. Unsloth 微调
# Unsloth 对 Gemma 4 有专项优化,内存效率比原生 Trainer 高 2-5 倍
from unsloth import FastModel
model, tokenizer = FastModel.from_pretrained("google/gemma-4-12B")
# LoRA / QLoRA 微调
10. Google Cloud 生产部署
需要高可用、弹性扩缩容时:
- Model Garden (Gemini Enterprise Agent Platform):控制台一键部署 Gemma 4 为托管端点
- Cloud Run:按请求计费的 serverless 部署
- GKE:基于 Kubernetes 的容器化部署
💡 Gemma 4 全系 Apache-2.0 许可,自托管与商用均无任何限制。只有 Gemma 4 是 Apache-2.0,Gemma 1/2/3 仍为定制 Gemma License,部署旧版本时需审阅原许可条款
相关导航


Kimi

SEA-LION

Apertus

Llama

FLUX

Stable Diffusion

