GLM翻译站点

3周前更新 13 0 0

智谱 Z.ai 开放权重大模型家族,MIT 许可,1M 上下文。

所在地:
美国纽约
语言:
英文
收录时间:
2026-08-20

GLM 是智谱 Z.ai 开发的开放权重大模型家族,截至 2026 年 8 月最新开放权重主干 GLM-5.2 于 6 月开源,744B 总参/40B 激活 MoE,MIT 许可,1M 上下文,专注长程编程与 Agent 任务;最新 GLM-5.3 于 8 月 14 日发布 API、权重定于 8 月 28 日开源,延续同一基座,编程与网络安全能力进一步提升,是开放权重中长上下文 Agent 编程的标杆。

 

产品概述

GLM 由北京智谱 AI(Z.ai)开发,团队源自清华大学,自 2023 年 ChatGLM 系列起步,已成为国产开放权重大模型家族中”长上下文 + Agent 编程”路线的代表 。

 

版本演进(具体以官网实时信息为准):

  • GLM-4.5 / 4.5-Air(2025 年 7 月):355B/106B MoE,128K 上下文,MIT 许可
  • GLM-4.6 / 4.7(2025 年 9-12 月):200K 上下文,MIT 许可
  • GLM-5(2026 年 2 月):744B MoE,20 万 Token 上下文,MIT 许可
  • GLM-5.1(2026 年 4 月):沿用 744B 基座,MIT 许可,长程任务优化
  • GLM-5.2(2026 年 6 月 16 日开源):当前最新已开放权重主干。744B 总参/40B 激活 MoE,1M 上下文,MIT 许可,Artificial Analysis 综合智能指数 51 分,与 Anthropic、OpenAI 并列前三,为开源模型 SOTA
  • GLM-5.3(2026 年 8 月 14 日发布 API):沿用 GLM-5.2 基座(约 7430 亿参数 MoE),所有能力提升来自后训练 Scaling;Artificial Analysis 综合智能指数 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同档,并列开源模型第一;权重定于 2026 年 8 月 28 日开源(完成安全评估与模型加固后)

 

当前已开源主干 GLM-5.2 核心参数​ :

  • 架构:744B 总参 / 40B 激活 MoE
  • 上下文:Solid 1M 无损上下文
  • 最大输出:128K tokens
  • 许可:MIT License(最高权限)
  • 开源平台:Hugging Face、ModelScope、GitHub
  • 推理框架:vLLM、SGLang、Transformers 已 Day 0 支持
  • 国产算力:完成华为昇腾等国产算力平台 Day 0 适配

 

许可策略(关键):

GLM 家族全系 MIT License​ ——这是与 DeepSeek V4 并列的最宽松许可:

  • 可自由下载、部署、商用、修改、蒸馏、二次分发
  • 无营收门槛、无月活限制、无地域限制、无商业审批
  • 智谱明确表示”技术平权无国界”
  • GLM-5.3 权重也将以”宽松许可证”开源(社区预期仍为 MIT)

💡 与 Llama 4(Custom License + 7 亿月活条款)形成最本质差异——GLM 是真正无门槛的 OSI 认证开源,法务审核零障碍。GLM 与 DeepSeek V4、Qwen3.8-27B、Gemma 4、Mistral Large 3/Small 4、Phi-4 共同构成”最干净许可”开放权重阵营 。

 

核心能力

  • 1M 无损长上下文:GLM-5.2 实现 Solid 1M 工程可用上下文,是开放权重中首批将 1M 上下文做到”无损可用”的模型
  • 长程 Agent 编程:GLM-5.2 在 SWE-bench Pro 达 62.1 分,FrontierSWE 达 74.4%;GLM-5.3 在 DeepSWE-Agents 从 46.2 跃升至 66.9,Terminal-Bench 3.0 从 4.6 跃升至 28.3(开源第一)
  • 网络安全能力涌现:GLM-5.3 在 CyberGym 达 84.5%(超过 Mythos 5 的 83.8%),可挖掘真实开源项目漏洞,在 269 个项目中发现 2436 个漏洞
  • MoE 高效推理:744B 总参仅激活 40B,推理成本接近 40B 稠密模型
  • 国产算力 Day 0 适配:华为昇腾等国产 NPU 首发支持,是国产算力上最成熟的前沿开放权重
  • 主流框架原生支持:vLLM、SGLang、Transformers、llama.cpp 均已支持
  • 工具调用与 Function Calling:原生支持 Agent 工具调用,与 Claude Code、OpenCode、Cline、Roo Code 等主流 Agent 框架深度适配
  • 全尺寸矩阵:从 1B/2B 端侧(mGLM-1B、GLM-2B)到 9B 消费级(GLM-4-9B 系列)、32B 企业级(GLM-4-32B 系列)再到 744B 旗舰,覆盖端侧到数据中心

 

优势亮点

  • MIT 最宽松许可:商用、修改、蒸馏、再分发均无门槛,是与 DeepSeek V4 并列的真正 OSI 认证开源
  • 1M 上下文工程可用:GLM-5.2 是开放权重中首批将 1M 上下文做到”无损”的模型,可一次性处理完整代码库、整本技术书
  • 长程编程 SOTA:GLM-5.3 在 Terminal-Bench 3.0 达 28.3 分(开源第一),DeepSWE-Agents 66.9 分,编程 Agent 能力超越 Claude Opus 4.8
  • 网络安全差异化:GLM-5.3 的 CyberGym 84.5% 是开放权重中独有的网络安全能力,”开源的盾”定位
  • 国产算力原生适配:Day 0 运行在华为昇腾等国产算力平台,是国产 AI 芯片上最成熟的前沿开放权重
  • Artificial Analysis 指数开源第一:GLM-5.3 综合智能指数 60 分,与 Kimi K3 并列开源第一
  • 成本优势显著:GLM-5.2 在多项长程 coding 任务上超过 GPT-5.5,而每 token 成本仅约六分之一
  • 智谱清言生态:chat.z.ai、BigModel 开放平台、AutoClaw Agent、ZCode 代码工具全链路支持

 

局限

  • GLM-5.3 权重尚未开源:截至 2026 年 8 月 20 日,GLM-5.3 仅开放 API,权重定于 8 月 28 日开源;当前自托管可用的开放权重主干为 GLM-5.2
  • 纯文本模态:GLM 系列主要为文本模型,GLM-5V-Turbo 为多模态版本但非家族主线;复杂视觉任务不及 Qwen3.8-27B、Gemma 4 12B 等原生多模态模型
  • 旗舰自托管门槛高:744B MoE 全精度需多卡 H100/A100 集群;消费级硬件仅能量化运行较小版本(GLM-4-9B、GLM-4-32B)
  • 与顶级闭源仍有差距:GLM-5.3 综合智能指数 60 分,虽与 Claude Fable 5、GPT-5.6 Sol 同档,但智谱官方承认前沿闭源模型在部分任务上仍领先
  • 英文生态不及 Llama:英文社区教程、第三方工具链丰富度仍略低于 Llama 系列
  • 多语种覆盖不及 Qwen:Qwen 支持 200+ 语言,GLM 主要优化中英双语

 

适用人群

  • 长程编程与 Agent 开发团队:1M 上下文 + SWE-bench Pro 62.1 分,是开放权重中处理完整代码库、多文件重构的最佳选择
  • 网络安全与漏洞挖掘:GLM-5.3 的 CyberGym 84.5% 是开放权重独有的网络安全能力
  • 需 MIT 合规的商业产品:与 DeepSeek V4、Gemma 4、Mistral Large 3、Phi-4 并列”最干净许可”阵营
  • 国产算力适配需求方:Day 0 运行在华为昇腾等国产 NPU,是国产 AI 芯片上最成熟的前沿开放权重
  • 成本敏感的高并发场景:每 token 成本约为同级闭源模型的 1/6,长程任务性价比突出
  • 数据主权敏感的企业:MIT 许可 + 完全本地部署,满足金融、政企、科研的合规要求

 

安装与部署

 

1. 硬件需求参考

部署目标 推荐配置
GLM-4-9B(Q4 量化) 单卡 RTX 3060 8GB 或 Mac M2 16GB
GLM-4-32B(Q4 量化) 单卡 A100 80GB 或 4×RTX 4090 24GB
GLM-5.2(Int4 量化) 多卡 H100/H200 集群(建议 4-8 卡)
GLM-5.2(BF16 全精度) 8×H100+ 或等效国产算力(华为昇腾 910B 集群)

💡 GLM-5.2 采用 FP4(专家权重)+ BF16(其他权重)混合精度,部署时需推理引擎支持混合精度量化

 

2. 获取模型权重

从 Hugging Face 拉取官方权重(MIT 许可):

# 当前已开源主干 GLM-5.2
huggingface-cli download zai-org/GLM-5.2

# GLM-5.3 权重预计 2026 年 8 月 28 日开源后可用
# huggingface-cli download zai-org/GLM-5.3

 

3. 通过 vLLM 部署(推荐生产环境)

# 安装 vLLM
pip install vllm

# 启动 GLM-5.2 服务
vllm serve zai-org/GLM-5.2 \
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \
  --enable-reasoning

 

3. 通过 vLLM 部署(推荐生产环境)

# 安装 vLLM
pip install vllm

# 启动 GLM-5.2 服务
vllm serve zai-org/GLM-5.2 \
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \
  --enable-reasoning

 

4. 通过 SGLang 部署

sglang serve --model-path zai-org/GLM-5.2 \
  --tp 8 \
  --context-length 1000000

 

5. 通过 Hugging Face Transformers 推理

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "zai-org/GLM-5.2"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name, torch_dtype="auto", device_map="auto"
)

messages = [{"role": "user", "content": "解释 MoE 架构"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))

 

6. 量化部署(消费级硬件运行小版本)

# GLM-4-9B 量化运行
python convert_hf_to_gguf.py zai-org/GLM-4-9B-Chat --outfile glm-4-9b-Q4_K_M.gguf
./llama-cli -m glm-4-9b-Q4_K_M.gguf -p "你的提示词" -n 512

 

7. 国产算力部署

GLM 系列已 Day 0 适配华为昇腾:

  • 华为昇腾:使用 Ascend CANN + MindIE 推理引擎
  • 海光/寒武纪:原生适配工程已在 GitHub 开源

 

8. 云端 API 调用(不想自托管)

通过 Z.ai 或 BigModel 开放平台(OpenAI 兼容):

from openai import OpenAI

client = OpenAI(
    api_key="your-zai-api-key",
    base_url="https://api.z.ai/v1"
)

# GLM-5.2 已开源权重,API 同步可用
response = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "帮我分析这段代码"}]
)

# GLM-5.3 API(2026 年 8 月 14 日起,权重 8 月 28 日开源)
response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "帮我挖掘这个开源项目的漏洞"}]
)

 

9. Claude Code / OpenCode 集成

GLM-5.2/5.3 已纳入 GLM Coding Plan,支持 Claude Code、OpenCode 等主流开发工具:

# Claude Code 配置示例
export ANTHROPIC_BASE_URL="https://api.z.ai/v1"
export ANTHROPIC_MODEL="glm-5.2"
claude

⚠️ 部署前请注意:当前(2026 年 8 月 20 日)可自托管的最新开放权重为 GLM-5.2;GLM-5.3 权重预计 8 月 28 日开源,具体许可条款以官方公告为准(预期为 MIT)。GLM 系列主要为文本模型,多模态需求请评估 GLM-5V-Turbo 或选用 Qwen3.8-27B、Gemma 4 等原生多模态开放权重。

相关导航