
GLM 是智谱 Z.ai 开发的开放权重大模型家族,截至 2026 年 8 月最新开放权重主干 GLM-5.2 于 6 月开源,744B 总参/40B 激活 MoE,MIT 许可,1M 上下文,专注长程编程与 Agent 任务;最新 GLM-5.3 于 8 月 14 日发布 API、权重定于 8 月 28 日开源,延续同一基座,编程与网络安全能力进一步提升,是开放权重中长上下文 Agent 编程的标杆。
产品概述
GLM 由北京智谱 AI(Z.ai)开发,团队源自清华大学,自 2023 年 ChatGLM 系列起步,已成为国产开放权重大模型家族中”长上下文 + Agent 编程”路线的代表 。
版本演进(具体以官网实时信息为准):
- GLM-4.5 / 4.5-Air(2025 年 7 月):355B/106B MoE,128K 上下文,MIT 许可
- GLM-4.6 / 4.7(2025 年 9-12 月):200K 上下文,MIT 许可
- GLM-5(2026 年 2 月):744B MoE,20 万 Token 上下文,MIT 许可
- GLM-5.1(2026 年 4 月):沿用 744B 基座,MIT 许可,长程任务优化
- GLM-5.2(2026 年 6 月 16 日开源):当前最新已开放权重主干。744B 总参/40B 激活 MoE,1M 上下文,MIT 许可,Artificial Analysis 综合智能指数 51 分,与 Anthropic、OpenAI 并列前三,为开源模型 SOTA
- GLM-5.3(2026 年 8 月 14 日发布 API):沿用 GLM-5.2 基座(约 7430 亿参数 MoE),所有能力提升来自后训练 Scaling;Artificial Analysis 综合智能指数 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同档,并列开源模型第一;权重定于 2026 年 8 月 28 日开源(完成安全评估与模型加固后)
当前已开源主干 GLM-5.2 核心参数 :
- 架构:744B 总参 / 40B 激活 MoE
- 上下文:Solid 1M 无损上下文
- 最大输出:128K tokens
- 许可:MIT License(最高权限)
- 开源平台:Hugging Face、ModelScope、GitHub
- 推理框架:vLLM、SGLang、Transformers 已 Day 0 支持
- 国产算力:完成华为昇腾等国产算力平台 Day 0 适配
许可策略(关键):
GLM 家族全系 MIT License ——这是与 DeepSeek V4 并列的最宽松许可:
- 可自由下载、部署、商用、修改、蒸馏、二次分发
- 无营收门槛、无月活限制、无地域限制、无商业审批
- 智谱明确表示”技术平权无国界”
- GLM-5.3 权重也将以”宽松许可证”开源(社区预期仍为 MIT)
💡 与 Llama 4(Custom License + 7 亿月活条款)形成最本质差异——GLM 是真正无门槛的 OSI 认证开源,法务审核零障碍。GLM 与 DeepSeek V4、Qwen3.8-27B、Gemma 4、Mistral Large 3/Small 4、Phi-4 共同构成”最干净许可”开放权重阵营 。
核心能力
- 1M 无损长上下文:GLM-5.2 实现 Solid 1M 工程可用上下文,是开放权重中首批将 1M 上下文做到”无损可用”的模型
- 长程 Agent 编程:GLM-5.2 在 SWE-bench Pro 达 62.1 分,FrontierSWE 达 74.4%;GLM-5.3 在 DeepSWE-Agents 从 46.2 跃升至 66.9,Terminal-Bench 3.0 从 4.6 跃升至 28.3(开源第一)
- 网络安全能力涌现:GLM-5.3 在 CyberGym 达 84.5%(超过 Mythos 5 的 83.8%),可挖掘真实开源项目漏洞,在 269 个项目中发现 2436 个漏洞
- MoE 高效推理:744B 总参仅激活 40B,推理成本接近 40B 稠密模型
- 国产算力 Day 0 适配:华为昇腾等国产 NPU 首发支持,是国产算力上最成熟的前沿开放权重
- 主流框架原生支持:vLLM、SGLang、Transformers、llama.cpp 均已支持
- 工具调用与 Function Calling:原生支持 Agent 工具调用,与 Claude Code、OpenCode、Cline、Roo Code 等主流 Agent 框架深度适配
- 全尺寸矩阵:从 1B/2B 端侧(mGLM-1B、GLM-2B)到 9B 消费级(GLM-4-9B 系列)、32B 企业级(GLM-4-32B 系列)再到 744B 旗舰,覆盖端侧到数据中心
优势亮点
- MIT 最宽松许可:商用、修改、蒸馏、再分发均无门槛,是与 DeepSeek V4 并列的真正 OSI 认证开源
- 1M 上下文工程可用:GLM-5.2 是开放权重中首批将 1M 上下文做到”无损”的模型,可一次性处理完整代码库、整本技术书
- 长程编程 SOTA:GLM-5.3 在 Terminal-Bench 3.0 达 28.3 分(开源第一),DeepSWE-Agents 66.9 分,编程 Agent 能力超越 Claude Opus 4.8
- 网络安全差异化:GLM-5.3 的 CyberGym 84.5% 是开放权重中独有的网络安全能力,”开源的盾”定位
- 国产算力原生适配:Day 0 运行在华为昇腾等国产算力平台,是国产 AI 芯片上最成熟的前沿开放权重
- Artificial Analysis 指数开源第一:GLM-5.3 综合智能指数 60 分,与 Kimi K3 并列开源第一
- 成本优势显著:GLM-5.2 在多项长程 coding 任务上超过 GPT-5.5,而每 token 成本仅约六分之一
- 智谱清言生态:chat.z.ai、BigModel 开放平台、AutoClaw Agent、ZCode 代码工具全链路支持
局限
- GLM-5.3 权重尚未开源:截至 2026 年 8 月 20 日,GLM-5.3 仅开放 API,权重定于 8 月 28 日开源;当前自托管可用的开放权重主干为 GLM-5.2
- 纯文本模态:GLM 系列主要为文本模型,GLM-5V-Turbo 为多模态版本但非家族主线;复杂视觉任务不及 Qwen3.8-27B、Gemma 4 12B 等原生多模态模型
- 旗舰自托管门槛高:744B MoE 全精度需多卡 H100/A100 集群;消费级硬件仅能量化运行较小版本(GLM-4-9B、GLM-4-32B)
- 与顶级闭源仍有差距:GLM-5.3 综合智能指数 60 分,虽与 Claude Fable 5、GPT-5.6 Sol 同档,但智谱官方承认前沿闭源模型在部分任务上仍领先
- 英文生态不及 Llama:英文社区教程、第三方工具链丰富度仍略低于 Llama 系列
- 多语种覆盖不及 Qwen:Qwen 支持 200+ 语言,GLM 主要优化中英双语
适用人群
- 长程编程与 Agent 开发团队:1M 上下文 + SWE-bench Pro 62.1 分,是开放权重中处理完整代码库、多文件重构的最佳选择
- 网络安全与漏洞挖掘:GLM-5.3 的 CyberGym 84.5% 是开放权重独有的网络安全能力
- 需 MIT 合规的商业产品:与 DeepSeek V4、Gemma 4、Mistral Large 3、Phi-4 并列”最干净许可”阵营
- 国产算力适配需求方:Day 0 运行在华为昇腾等国产 NPU,是国产 AI 芯片上最成熟的前沿开放权重
- 成本敏感的高并发场景:每 token 成本约为同级闭源模型的 1/6,长程任务性价比突出
- 数据主权敏感的企业:MIT 许可 + 完全本地部署,满足金融、政企、科研的合规要求
安装与部署
1. 硬件需求参考
| 部署目标 | 推荐配置 |
|---|---|
| GLM-4-9B(Q4 量化) | 单卡 RTX 3060 8GB 或 Mac M2 16GB |
| GLM-4-32B(Q4 量化) | 单卡 A100 80GB 或 4×RTX 4090 24GB |
| GLM-5.2(Int4 量化) | 多卡 H100/H200 集群(建议 4-8 卡) |
| GLM-5.2(BF16 全精度) | 8×H100+ 或等效国产算力(华为昇腾 910B 集群) |
💡 GLM-5.2 采用 FP4(专家权重)+ BF16(其他权重)混合精度,部署时需推理引擎支持混合精度量化
2. 获取模型权重
从 Hugging Face 拉取官方权重(MIT 许可):
# 当前已开源主干 GLM-5.2 huggingface-cli download zai-org/GLM-5.2 # GLM-5.3 权重预计 2026 年 8 月 28 日开源后可用 # huggingface-cli download zai-org/GLM-5.3
3. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM pip install vllm # 启动 GLM-5.2 服务 vllm serve zai-org/GLM-5.2 \ --tensor-parallel-size 8 \ --max-model-len 1000000 \ --enable-reasoning
3. 通过 vLLM 部署(推荐生产环境)
# 安装 vLLM pip install vllm # 启动 GLM-5.2 服务 vllm serve zai-org/GLM-5.2 \ --tensor-parallel-size 8 \ --max-model-len 1000000 \ --enable-reasoning
4. 通过 SGLang 部署
sglang serve --model-path zai-org/GLM-5.2 \ --tp 8 \ --context-length 1000000
5. 通过 Hugging Face Transformers 推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "zai-org/GLM-5.2"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype="auto", device_map="auto"
)
messages = [{"role": "user", "content": "解释 MoE 架构"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
6. 量化部署(消费级硬件运行小版本)
# GLM-4-9B 量化运行 python convert_hf_to_gguf.py zai-org/GLM-4-9B-Chat --outfile glm-4-9b-Q4_K_M.gguf ./llama-cli -m glm-4-9b-Q4_K_M.gguf -p "你的提示词" -n 512
7. 国产算力部署
GLM 系列已 Day 0 适配华为昇腾:
- 华为昇腾:使用 Ascend CANN + MindIE 推理引擎
- 海光/寒武纪:原生适配工程已在 GitHub 开源
8. 云端 API 调用(不想自托管)
通过 Z.ai 或 BigModel 开放平台(OpenAI 兼容):
from openai import OpenAI
client = OpenAI(
api_key="your-zai-api-key",
base_url="https://api.z.ai/v1"
)
# GLM-5.2 已开源权重,API 同步可用
response = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "帮我分析这段代码"}]
)
# GLM-5.3 API(2026 年 8 月 14 日起,权重 8 月 28 日开源)
response = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "帮我挖掘这个开源项目的漏洞"}]
)
9. Claude Code / OpenCode 集成
GLM-5.2/5.3 已纳入 GLM Coding Plan,支持 Claude Code、OpenCode 等主流开发工具:
# Claude Code 配置示例 export ANTHROPIC_BASE_URL="https://api.z.ai/v1" export ANTHROPIC_MODEL="glm-5.2" claude
⚠️ 部署前请注意:当前(2026 年 8 月 20 日)可自托管的最新开放权重为 GLM-5.2;GLM-5.3 权重预计 8 月 28 日开源,具体许可条款以官方公告为准(预期为 MIT)。GLM 系列主要为文本模型,多模态需求请评估 GLM-5V-Turbo 或选用 Qwen3.8-27B、Gemma 4 等原生多模态开放权重。
相关导航


Kimi

Stable Diffusion

智谱清言
Phi

OLMo

Kimi

