自有算力部署
GLM-5.2 API 中转
750B 稀疏 MoE、100 万上下文、MIT 许可,为软件工程调过的开源旗舰。
上下文
1M
最大输出
131K
推理精度
BF16 / FP8
许可
MIT
GLM-5.2 是 Z.ai(智谱)2026 年 6 月发布的开源权重旗舰,约 750B 参数的稀疏 MoE 设计、每 token 激活约 40B,配合新的 IndexShare 稀疏注意力把百万上下文的推理成本压下来。上下文 100 万 token,单次最高可返回 131,072 token。权重同时提供 BF16 与 FP8,以 MIT 许可发布,商用、修改、再分发几乎没有限制。它在软件工程、多步推理和工具调用方向做了重点调优。
开源权重,部署在我们自建与自租的机房,由我们自己运维。不转售任何第三方账号额度。
规格
- 模型 ID
- glm-5.2
- 发布方
- Z.ai (Zhipu AI)
- 供给方式
- 自有算力部署
- 许可
- MIT
- 总参数
- 750B MoE
- 激活参数
- 40B
- 上下文
- 1M
- 最大输出
- 131K
- 推理精度
- BF16 / FP8
- 输入模态
- 文本
- 发布时间
- 2026-06-13
- 价格
- 见定价页
它强在哪
- 13 万 token 的单次输出
- 131K 的最大输出意味着一次生成整份技术方案、整个模块的代码、完整的翻译稿都不用切段落再拼。对批量生成类任务,少一次拼接就少一处出错的地方。
- MIT 许可,法务不用绕路
- 权重以 MIT 发布,商用、二次分发、内部微调都没有额外授权门槛。这也是我们能把它部署在自有机房、并公开权重版本的前提。
- 中文与代码都能打
- 面向中文语义与代码生成同时调优,指令跟随稳定。对主要面向中文用户、又要处理代码和结构化输出的产品,是一条性价比很高的主链路。
典型用法
- 面向中文用户的产品主链路:对话、摘要、结构化抽取
- 长篇技术文档、方案、代码的一次性生成
- 多步骤工具调用与 Agent 编排
- 需要本地化 / 私有化部署且法务要求宽松许可的场景
三步接入
改一行 base_url,再把 model 换成下面这个 ID,其余代码不动。
model: "glm-5.2"
curl https://api.nexaix.net/v1/chat/completions \
-H "Authorization: Bearer $NEXAIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarise this contract." }
]
}'import os
from openai import OpenAI
client = OpenAI(
# 只有这一行是新的
base_url="https://api.nexaix.net/v1",
api_key=os.environ["NEXAIX_API_KEY"],
)
# 下面全是你原来的代码
stream = client.chat.completions.create(
model="glm-5.2",
stream=True,
messages=[
{"role": "user", "content": "Summarise this contract."}
],
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.nexaix.net/v1", // 只有这一行是新的
apiKey: process.env.NEXAIX_API_KEY,
});
// 下面全是你原来的代码
const stream = await client.chat.completions.create({
model: "glm-5.2",
stream: true,
messages: [
{ role: "user", content: "Summarise this contract." }
],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}关于这个模型
GLM-5.2 你们跑的是 BF16 还是 FP8?
两种权重官方都有发布。我们在模型页明确标注当前线上执行的精度,变更会走更新日志。你也可以固定一批 prompt 在不同时间复测,结果分布应当稳定。
MIT 许可对我使用 API 有什么影响?
对你调用 API 没有额外义务。它的意义在于供给侧:我们可以合法地把权重部署在自己的机器上,所以不需要转售任何第三方账号额度,服务不会因为别人被封而中断。
和 GLM-5.1 比主要提升在哪?
最直观的是上下文从 20 万提升到 100 万,单次输出上限也大幅提高;另外在软件工程与多步推理方向做了重点调优。具体到你的任务,建议用自己的 eval 跑一遍对比。
