Cloudflare Workers AI GLM-5.3 上手:把 Z.ai 编码旗舰塞进边缘网络
2026-08-28,Cloudflare 把 Z.ai 的 GLM-5.3 静悄悄地上到了 Workers AI,模型 ID 是 @cf/zai-org/glm-5.3。有意思的不是"又一款国产前沿模型上 Cloudflare"——6 月 GLM-5.2 就走过一遍这个剧本。有意思的是性价比:GLM-5.3 价格完全等同 GLM-5.2(输入 $1.40/百万 token、缓存 $0.26、输出 $4.40),但 SWE-Marathon 长程任务得分翻倍,Terminal Bench 3.0 提升 6.1 倍(4.6 → 28.3,现役开源 SOTA)。
Cloudflare 在 changelog 原文里直接称 GLM-5.3 是"最强的开源权重编码模型"。配套的 arXiv 论文(2602.15763,标题 "GLM-5: from Vibe Coding to Agentic Engineering")把 GLM-5.3 定位成 GLM-5.2 的纯后训练升级——基座权重一字未动,所有提升都来自对齐工作。这对生产部署很关键:如果你已经在 Workers AI 上跑了 GLM-5.2,迁移就是改一行 model ID,单位经济学纹丝不动。
这篇测评覆盖:Workers AI 上的精确定价与 Neuron 消耗(直接摘自 /workers-ai/platform/pricing/)、付费层级门槛(GLM-5.3 在 frontier-model 列表里——10K Neurons/天的免费额度不适用)、当前速率限制图景(默认 300 RPM,frontier-RPM 表格尚未更新)、四种 API 入口(binding、REST、OpenAI 兼容、AI Gateway)、GLM-5.3 vs GLM-5.2 在 Z.ai 公布的 7 项公开基准上的对比,以及新 GLM-5.3 License 下的开源权重与自托管路径。
最后核验日期:2026-08-29。价格与基准数据均直接取自 Cloudflare changelog 与定价页;如果 Cloudflare 在未来几天把 frontier-RPM 表格更新加入 GLM-5.3,我会在 FAQ 里补充。
GLM-5.3 on Workers AI:价格、Neuron 消耗与付费门槛
Cloudflare 定价页上 GLM-5.3 与 GLM-5.2 并列在 frontier 列表里。完整一行摘自 /workers-ai/platform/pricing/:
@cf/zai-org/glm-5.3
Input tokens $1.400 per M 127,273 neurons per M
Cached input tokens $0.260 per M 23,636 neurons per M
Output tokens $4.400 per M 400,000 neurons per M
三件事要记住:
- 价格等同 GLM-5.2。Z.ai 与 Cloudflare 故意把定价压平,让现有 GLM-5.2 工作负载升级无负担。基准提升完全是同价位的附加收益。
- 缓存命中价约为输入价的五分之一。$0.26/M 缓存 vs $1.40/M 全价——重复前缀场景下打 5.4 折。如果你的 agent 循环每轮重投系统 prompt + 工具定义(Claude Code / Cursor 的典型模式),这个折扣巨大。30K token 固定 prompt 每轮缓存命中 $0.009 vs 全价 $0.042,每轮省 $0.033。
- 单 token Neuron 消耗 127,273 / 400,000(每 1K 输入/输出)。大约是 Qwen 3.8 27B(同在 Workers AI)的两倍。相同 token 数量账单更重,但 GLM-5.3 任务完成所需轮次更少,总成本反而可能更低。
付费门槛是这次对爱好者的结构性变化。定价页原文:
Some models require a paid billing method. This applies to@cf/moonshotai/kimi-k2.6,@cf/moonshotai/kimi-k2.7-code,@cf/zai-org/glm-5.2,@cf/zai-org/glm-5.3,@cf/zai-org/glm-5.3-flash,@cf/deepseek-ai/deepseek-v4-flash-0731, and@cf/deepseek-ai/deepseek-v4-pro-0813. You can access these models with either the Workers Paid plan or prepaid AI Gateway credits.
两条路:订阅 Workers Paid($5/月,含 10M Neurons + 按量超额),或不开通 Workers 订阅直接用 AI Gateway 预付费额度。AI Gateway 路径对已经在用 Cloudflare 网关路由 OpenAI/Anthropic 流量的团队友好——同一个计费关系,加一个 model ID 即可。changelog 特别提到"使用预付费额度的 frontier 模型请求享有更高速率限制",这是明确的激励信号。
速率限制:默认 300 RPM,frontier 表格待更新
Cloudflare 的 速率限制页把 GLM-5.3 列入付费 frontier 阵营,但显式"Frontier models" RPM 表格还没有它。当前表格只列了三款:
| 模型 | 标准 RPM | 预付费 AI Gateway RPM |
|---|---|---|
@cf/zai-org/glm-5.2 | 20 | 50 |
@cf/moonshotai/kimi-k2.6 | 20 | 50 |
@cf/moonshotai/kimi-k2.7-code | 20 | 50 |
@cf/zai-org/glm-5.3 (新增,预计) | 300 (Text Generation 默认) | 待定 |
实际上 GLM-5.3 当前继承 300 RPM Text Generation 默认值——远高于 GLM-5.2 的 20 RPM 标准 frontier 上限。这几乎肯定是过渡状态(Cloudflare 通常把 frontier 模型压在 20/50 RPM 以保护 GPU 供给),所以如果你的生产流量在 GLM-5.3 上跑,做好一两周内表格更新的心理准备。50 RPM 预付费额度提升路径大概率适用。
对突发调用模式的 agent 工作负载,300 RPM 默认值是个临时红利——并发 agent 集群今天可以猛打 GLM-5.3。对持续批量作业,用令牌桶限速器排个队。
基准对比:GLM-5.3 vs GLM-5.2
changelog 头条是 Z.ai Code Bench 50% 提升。公开基准的增量更显眼:
| 基准 | GLM-5.2 | GLM-5.3 | 变化 |
|---|---|---|---|
| Terminal Bench 2.1 | 81.0 | 88.2 | +7.2 |
| Terminal Bench 3.0 | 4.6 | 28.3 | +23.7(OS SOTA) |
| DeepSWE | 46.2 | 66.9 | +20.7 |
| FrontierSWE | 67.5 | 78.1 | +10.6 |
| SWE-Marathon | 19.4 | 42.5 | +23.1(2.2x) |
| CyberGym(漏洞发现) | — | 84.5 | Z.ai 对比榜第一 |
| AutomationBench | — | 48.2 | Z.ai 对比榜第一 |
三种规律要拎出来:
- 长程任务提升最大。SWE-Marathon(多时长的智能体工程任务)翻倍以上。Terminal Bench 3.0(长程终端任务)跳 6.1 倍。后训练对智能体工具使用的强调在多步规划场景下收益最显。
- 单轮编码只是温和上涨。Terminal Bench 2.1 从 81.0 到 88.2——稳健的 +9%,不是革命。如果你的工作负载是一次性代码生成(无工具循环、无多步规划),升级是 nice-to-have,不是质变。
- 漏洞发现与长程自动化是开源权重新 SOTA。CyberGym 84.5 和 AutomationBench 48.2 是安全研究与智能体自动化场景下开源模型超越闭源 API 的基准胜利。
"基座与 GLM-5.2 相同,提升全来自后训练"的定调对一个决策至关重要:如果你的 GLM-5.2 部署瓶颈在上下文理解(而非规划、工具使用、长程一致性),GLM-5.3 帮不上忙。如果瓶颈在 agent 半路卡壳或丢失目标,GLM-5.3 会是可测量的提升。
从 Worker 调用 GLM-5.3:四个入口
Cloudflare 为 Workers AI 模型提供四种 API 入口,GLM-5.3 全部支持。
1. Workers 绑定 — env.AI.run()
// wrangler.toml 绑定:[[ai_bindings]] binding = "AI"
// TypeScript Worker
export interface Env { AI: Ai }
export default {
async fetch(req: Request, env: Env): Promise<Response> {
const { prompt } = await req.json();
const resp = await env.AI.run('@cf/zai-org/glm-5.3', {
messages: [
{ role: 'system', content: '你是一位资深 TypeScript 工程师。' },
{ role: 'user', content: prompt }
],
max_tokens: 4096,
temperature: 0.7,
reasoning_effort: 'medium' // 'low' | 'medium' | 'high'
});
return Response.json(resp);
}
};
reasoning_effort 参数(low / medium / high)是 OpenAI 风格——智能体基准任务用 high,简单 Q&A 用 low。
2. REST API — 账户级端点
curl -X POST "https://api.cloudflare.com/client/v4/accounts/$CF_ACCOUNT_ID/ai/run/@cf/zai-org/glm-5.3" \
-H "Authorization: Bearer *** \
-H "Content-Type: application/json" \
-d '{
"messages": [
{"role": "user", "content": "把这个 Python 函数改成 asyncio 版本。"}
],
"max_tokens": 2048,
"stream": true
}'
适合 CI runner、Workers 运行时之外的 serverless 函数,或任何能拿 API token 的环境。
3. OpenAI 兼容 — OpenAI SDK 即插即用
from openai import OpenAI
client = OpenAI(
api_key="<你的 cloudflare api token>",
base_url="https://api.cloudflare.com/client/v4/accounts/<CF_ACCOUNT_ID>/ai/v1"
)
resp = client.chat.completions.create(
model="@cf/zai-org/glm-5.3",
messages=[
{"role": "user", "content": "写一个带单测的 TypeScript 防抖函数。"}
],
max_tokens=2048,
temperature=0.7,
)
print(resp.choices[0].message.content)
任何 OpenAI SDK(Python、Node、Go、Rust)只需替换 base_url 即可对接。唯一的坑点:model ID 必须在 OpenAI 兼容面上也带 @cf/ 前缀。
4. AI Gateway — 网关代理路由 + 缓存
// gateway.example.com 通过 Unified billing 路由到 GLM-5.3
curl -X POST "https://gateway.example.com/v1/chat/completions" \
-H "Authorization: Bearer *** \
-d '{
"model": "@cf/zai-org/glm-5.3",
"messages": [{"role": "user", "content": "讲一下 DSA 注意力机制。"}]
}'
AI Gateway 就是上面提到的预付费额度路径——把网关计费设为 "Unified billing" 并充值,然后把 OpenAI/Anthropic/Workers AI 模型通过同一端点路由,叠上缓存、限速、分析能力。
开源权重:HF 仓库、License、自托管路径
GLM-5.3 权重已发布在 huggingface.co/zai-org/GLM-5.3,使用自定义的 GLM-5.3 License。模型是带 DSA 注意力的 MoE(GlmMoeDsaForCausalLM),每 token 选 8 个专家,总参数量 ~754B,存储为 BF16 + FP8 分片 safetensors(全部片合计 ~755 GB)。
License 摘要(全文见 HF LICENSE 文件):
- 免费用于使用、修改、合并、发布、分发、再许可、销售
- 允许微调与衍生作品
- 无 copyleft——衍生作品可采用任何许可
- 唯一条件:Model-as-a-Service 提供商所属集团在任何 12 个月内收入超过 100 亿美元,商用前必须完成 Z.AI 安全审查
- "按原样"提供,无任何担保
- 安全审查联系方式:
glmlicense@z.ai
对典型 SaaS 创业团队和内部工具,License 实际是宽松的。100 亿美元收入门槛只针对最大型超大规模云厂商——这条线以下的 API 转售方都可以自托管 GLM-5.3 而无需联系 Z.AI。架构细节见 arXiv 论文 2602.15763("GLM-5: from Vibe Coding to Agentic Engineering")。
如果自托管,准备好硬核硬件需求:754B 参数 BF16 推理最少 ~1.5 TB GPU 显存,或 FP8 下 ~755 GB。8 卡 H100 节点(80 GB × 8 = 640 GB 总)装不下 BF16;满 BF16 推理需要 8 卡 B200 或 8 卡 GB300 节点;接受 FP8 量化就能塞进 8 卡 H100。对绝大多数团队,Workers AI $1.40/M 输入价比自托管摊销 GPU 成本便宜得多。
何时用 GLM-5.3,何时用 Workers AI 上的其它选择
Workers AI 的国产模型阵容现在有三款付费层编码/智能体选项:
| 模型 | 输入 $/M | 输出 $/M | 适用场景 |
|---|---|---|---|
@cf/zai-org/glm-5.3 | $1.40 | $4.40 | 长程智能体工程、多小时编码任务、漏洞研究 |
@cf/zai-org/glm-5.3-flash | $0.15 | $0.50 | 高并发交互负载、多模态输入、对成本敏感的 chat/agent 循环 |
@cf/moonshotai/kimi-k2.7-code | $0.60 | $2.50 | 代码补全、代码评审、代码搜索——32K 以下单轮编码任务比 GLM-5.3 便宜 |
@cf/qwen/qwen3.8-27b | $0.20 | $0.80 | Workers AI 上最便宜的多模态——走量不走前沿 |
价格规律:GLM-5.3 是四款中最贵的(输入价是 GLM-5.3-Flash 的 10 倍、Qwen 3.8 27B 的 7 倍),由基准增量背书。如果你的工作负载是单轮 Q&A 或简单 chat,GLM-5.3-Flash 或 Qwen 3.8 27B 是更划算的选择。如果你的工作负载正是 GLM-5.3 基准瞄准的智能体编码 / 长程自动化场景,溢价是值得的。
Z.ai 自家平台的替代路径是 GLM Coding Plan 订阅,把 GLM-5.3、GLM-5.3-Flash、GLM-5.2、GLM-5-Turbo 打包给 IDE 和智能体场景按月计费。这是 IDE 插件开发者想要固定预算下的前沿质量的正解;按 API 计费的工作负载一旦月用量超过 ~5M token,Workers AI 按 token 付费就比订阅更便宜。
常见问题
问:GLM-5.3 在 Workers Free 层免费吗?
不免费。GLM-5.3 在 Cloudflare 付费 frontier 列表里,和 GLM-5.2、GLM-5.3-Flash、Kimi K2.6、Kimi K2.7 Code、DeepSeek V4 Flash、DeepSeek V4 Pro 同列。要调用它需要 Workers Paid 套餐($5/月)或预付费 AI Gateway 额度。10K Neurons/天的免费额度不适用。
问:Workers AI 上 GLM-5.3 多少钱?
每百万输入 token $1.40,每百万缓存输入 $0.26,每百万输出 $4.40——与 GLM-5.2 同价。每 1K 输入 token 模型消耗 127,273 Neurons;每 1K 输出 token 400,000 Neurons。一次典型的 50K 输入 / 4K 输出编码任务约 $0.088。
问:Workers AI 上的模型 ID 是什么?
官方模型 ID 是 @cf/zai-org/glm-5.3(注意命名空间是 zai-org,不是 zhipu)。兄弟 Flash 变体是 @cf/zai-org/glm-5.3-flash。两者共享同样的 1,048,576 token 上下文窗口、推理、工具调用与结构化输出能力。
问:GLM-5.3 的速率限制是多少?
截至 2026-08-29,GLM-5.3 继承 Text Generation 默认 300 RPM/账户。Cloudflare 显式"Frontier models" RPM 表格(当前列出 GLM-5.2、Kimi K2.6、Kimi K2.7 Code 标准 20 RPM / 预付费 AI Gateway 50 RPM)尚未更新加入 GLM-5.3,预计上线后几天内会补充。
问:GLM-5.3 与 GLM-5.2 在编码基准上对比如何?
Z.ai 自家 Z.ai Code Bench 提升 50%。公开基准 GLM-5.3 vs GLM-5.2:Terminal Bench 2.1 88.2 vs 81.0,Terminal Bench 3.0 28.3 vs 4.6(开源 SOTA),DeepSWE 66.9 vs 46.2,FrontierSWE 78.1 vs 67.5,SWE-Marathon 42.5 vs 19.4(2 倍以上),CyberGym 84.5,AutomationBench 48.2。基座与 GLM-5.2 相同——所有提升来自后训练。
问:能自托管 GLM-5.3 吗?
可以。GLM-5.3 权重开源在 huggingface.co/zai-org/GLM-5.3(754B 参数,BF16 + FP8 分片,磁盘 ~755 GB)。模型是带 DSA 注意力的 MoE(GlmMoeDsaForCausalLM,每 token 8 专家)。许可为自定义 GLM-5.3 License——免费用于使用、修改、微调与商用部署;Model-as-a-Service 提供商所属集团在任何 12 个月内收入超过 100 亿美元,商用前必须完成 Z.AI 安全审查。
问:如何从 Worker 调用 GLM-5.3?
四个入口:(1) Workers 绑定 — env.AI.run('@cf/zai-org/glm-5.3', { messages: [...] });(2) REST API — POST https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/run/@cf/zai-org/glm-5.3;(3) OpenAI 兼容 — 对 Workers AI 端点 POST /v1/chat/completions,model='@cf/zai-org/glm-5.3';(4) AI Gateway — 同样的 model ID,网关计费设为 'Unified billing' 走预付费额度路径。
问:中国大陆访问情况?
Workers AI 端点是全球的;模型跑在 Cloudflare 300+ 城市的 GPU 池上,通过 Cloudflare 标准 anycast IP 可从中国大陆直连。GFW 内更高吞吐需求的话,Z.ai 自家平台(z.ai)托管同一 GLM-5.3 家族,外加 GLM Coding Plan 订阅,把 GLM-5.3、GLM-5.3-Flash、GLM-5.2、GLM-5-Turbo 打包给 IDE 和智能体场景。
结论
Workers AI 上的 GLM-5.3 是当前能以 $1.40/M 输入价调用的最强开源权重编码模型。对比 GLM-5.2 的基准增量——Terminal Bench 3.0 6.1 倍、SWE-Marathon 2.2 倍、CyberGym 84.5——是真实存在的,而且全部来自后训练,所以任何现有 GLM-5.2 部署的升级只需改一行 model ID。
两个真正的坑:付费门槛(10K Neurons/天免费额度不适用)和仍在变化的速率限制图景(当前 300 RPM 默认,几乎肯定在 Cloudflare 更新 frontier-RPM 表格后收紧)。已经在 Workers Paid 或有 AI Gateway 额度的团队,这是无脑升级。还在用免费层的团队,要么升级到 Paid(最低 $5/月),要么继续用 GLM-5.3-Flash / Qwen 3.8 27B——这两款依然在标准 Text Generation 300 RPM 下可用、且免费层 Neurons 可用。
最后核验:2026-08-29。来源:Cloudflare changelog,Workers AI pricing,Workers AI limits,GLM-5.3 model page,HF model card,arXiv 2602.15763。