Cloudflare Workers AI GLM-5.3 上手:把 Z.ai 编码旗舰塞进边缘网络

2026-08-28,Cloudflare 把 Z.ai 的 GLM-5.3 静悄悄地上到了 Workers AI,模型 ID 是 @cf/zai-org/glm-5.3。有意思的不是"又一款国产前沿模型上 Cloudflare"——6 月 GLM-5.2 就走过一遍这个剧本。有意思的是性价比:GLM-5.3 价格完全等同 GLM-5.2(输入 $1.40/百万 token、缓存 $0.26、输出 $4.40),但 SWE-Marathon 长程任务得分翻倍Terminal Bench 3.0 提升 6.1 倍(4.6 → 28.3,现役开源 SOTA)。

Cloudflare 在 changelog 原文里直接称 GLM-5.3 是"最强的开源权重编码模型"。配套的 arXiv 论文(2602.15763,标题 "GLM-5: from Vibe Coding to Agentic Engineering")把 GLM-5.3 定位成 GLM-5.2 的纯后训练升级——基座权重一字未动,所有提升都来自对齐工作。这对生产部署很关键:如果你已经在 Workers AI 上跑了 GLM-5.2,迁移就是改一行 model ID,单位经济学纹丝不动。

这篇测评覆盖:Workers AI 上的精确定价与 Neuron 消耗(直接摘自 /workers-ai/platform/pricing/)、付费层级门槛(GLM-5.3 在 frontier-model 列表里——10K Neurons/天的免费额度不适用)、当前速率限制图景(默认 300 RPM,frontier-RPM 表格尚未更新)、四种 API 入口(binding、REST、OpenAI 兼容、AI Gateway)、GLM-5.3 vs GLM-5.2 在 Z.ai 公布的 7 项公开基准上的对比,以及新 GLM-5.3 License 下的开源权重与自托管路径。

最后核验日期:2026-08-29。价格与基准数据均直接取自 Cloudflare changelog 与定价页;如果 Cloudflare 在未来几天把 frontier-RPM 表格更新加入 GLM-5.3,我会在 FAQ 里补充。

GLM-5.3 on Workers AI:价格、Neuron 消耗与付费门槛

Cloudflare 定价页上 GLM-5.3 与 GLM-5.2 并列在 frontier 列表里。完整一行摘自 /workers-ai/platform/pricing/

@cf/zai-org/glm-5.3
  Input tokens          $1.400 per M    127,273 neurons per M
  Cached input tokens   $0.260 per M     23,636 neurons per M
  Output tokens         $4.400 per M    400,000 neurons per M

三件事要记住:

  • 价格等同 GLM-5.2。Z.ai 与 Cloudflare 故意把定价压平,让现有 GLM-5.2 工作负载升级无负担。基准提升完全是同价位的附加收益。
  • 缓存命中价约为输入价的五分之一。$0.26/M 缓存 vs $1.40/M 全价——重复前缀场景下打 5.4 折。如果你的 agent 循环每轮重投系统 prompt + 工具定义(Claude Code / Cursor 的典型模式),这个折扣巨大。30K token 固定 prompt 每轮缓存命中 $0.009 vs 全价 $0.042,每轮省 $0.033。
  • 单 token Neuron 消耗 127,273 / 400,000(每 1K 输入/输出)。大约是 Qwen 3.8 27B(同在 Workers AI)的两倍。相同 token 数量账单更重,但 GLM-5.3 任务完成所需轮次更少,总成本反而可能更低。

付费门槛是这次对爱好者的结构性变化。定价页原文:

Some models require a paid billing method. This applies to @cf/moonshotai/kimi-k2.6, @cf/moonshotai/kimi-k2.7-code, @cf/zai-org/glm-5.2, @cf/zai-org/glm-5.3, @cf/zai-org/glm-5.3-flash, @cf/deepseek-ai/deepseek-v4-flash-0731, and @cf/deepseek-ai/deepseek-v4-pro-0813. You can access these models with either the Workers Paid plan or prepaid AI Gateway credits.

两条路:订阅 Workers Paid($5/月,含 10M Neurons + 按量超额),或不开通 Workers 订阅直接用 AI Gateway 预付费额度。AI Gateway 路径对已经在用 Cloudflare 网关路由 OpenAI/Anthropic 流量的团队友好——同一个计费关系,加一个 model ID 即可。changelog 特别提到"使用预付费额度的 frontier 模型请求享有更高速率限制",这是明确的激励信号。

速率限制:默认 300 RPM,frontier 表格待更新

Cloudflare 的 速率限制页把 GLM-5.3 列入付费 frontier 阵营,但显式"Frontier models" RPM 表格还没有它。当前表格只列了三款:

模型标准 RPM预付费 AI Gateway RPM
@cf/zai-org/glm-5.22050
@cf/moonshotai/kimi-k2.62050
@cf/moonshotai/kimi-k2.7-code2050
@cf/zai-org/glm-5.3 (新增,预计)300 (Text Generation 默认)待定

实际上 GLM-5.3 当前继承 300 RPM Text Generation 默认值——远高于 GLM-5.2 的 20 RPM 标准 frontier 上限。这几乎肯定是过渡状态(Cloudflare 通常把 frontier 模型压在 20/50 RPM 以保护 GPU 供给),所以如果你的生产流量在 GLM-5.3 上跑,做好一两周内表格更新的心理准备。50 RPM 预付费额度提升路径大概率适用。

对突发调用模式的 agent 工作负载,300 RPM 默认值是个临时红利——并发 agent 集群今天可以猛打 GLM-5.3。对持续批量作业,用令牌桶限速器排个队。

基准对比:GLM-5.3 vs GLM-5.2

changelog 头条是 Z.ai Code Bench 50% 提升。公开基准的增量更显眼:

基准GLM-5.2GLM-5.3变化
Terminal Bench 2.181.088.2+7.2
Terminal Bench 3.04.628.3+23.7(OS SOTA)
DeepSWE46.266.9+20.7
FrontierSWE67.578.1+10.6
SWE-Marathon19.442.5+23.1(2.2x)
CyberGym(漏洞发现)84.5Z.ai 对比榜第一
AutomationBench48.2Z.ai 对比榜第一

三种规律要拎出来:

  • 长程任务提升最大。SWE-Marathon(多时长的智能体工程任务)翻倍以上。Terminal Bench 3.0(长程终端任务)跳 6.1 倍。后训练对智能体工具使用的强调在多步规划场景下收益最显。
  • 单轮编码只是温和上涨。Terminal Bench 2.1 从 81.0 到 88.2——稳健的 +9%,不是革命。如果你的工作负载是一次性代码生成(无工具循环、无多步规划),升级是 nice-to-have,不是质变。
  • 漏洞发现与长程自动化是开源权重新 SOTA。CyberGym 84.5 和 AutomationBench 48.2 是安全研究与智能体自动化场景下开源模型超越闭源 API 的基准胜利。

"基座与 GLM-5.2 相同,提升全来自后训练"的定调对一个决策至关重要:如果你的 GLM-5.2 部署瓶颈在上下文理解(而非规划、工具使用、长程一致性),GLM-5.3 帮不上忙。如果瓶颈在 agent 半路卡壳或丢失目标,GLM-5.3 会是可测量的提升。

从 Worker 调用 GLM-5.3:四个入口

Cloudflare 为 Workers AI 模型提供四种 API 入口,GLM-5.3 全部支持。

1. Workers 绑定 — env.AI.run()

// wrangler.toml 绑定:[[ai_bindings]] binding = "AI"
// TypeScript Worker
export interface Env { AI: Ai }

export default {
  async fetch(req: Request, env: Env): Promise<Response> {
    const { prompt } = await req.json();

    const resp = await env.AI.run('@cf/zai-org/glm-5.3', {
      messages: [
        { role: 'system', content: '你是一位资深 TypeScript 工程师。' },
        { role: 'user',   content: prompt }
      ],
      max_tokens: 4096,
      temperature: 0.7,
      reasoning_effort: 'medium'  // 'low' | 'medium' | 'high'
    });

    return Response.json(resp);
  }
};

reasoning_effort 参数(low / medium / high)是 OpenAI 风格——智能体基准任务用 high,简单 Q&A 用 low。

2. REST API — 账户级端点

curl -X POST "https://api.cloudflare.com/client/v4/accounts/$CF_ACCOUNT_ID/ai/run/@cf/zai-org/glm-5.3" \
  -H "Authorization: Bearer *** \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [
      {"role": "user", "content": "把这个 Python 函数改成 asyncio 版本。"}
    ],
    "max_tokens": 2048,
    "stream": true
  }'

适合 CI runner、Workers 运行时之外的 serverless 函数,或任何能拿 API token 的环境。

3. OpenAI 兼容 — OpenAI SDK 即插即用

from openai import OpenAI

client = OpenAI(
    api_key="<你的 cloudflare api token>",
    base_url="https://api.cloudflare.com/client/v4/accounts/<CF_ACCOUNT_ID>/ai/v1"
)

resp = client.chat.completions.create(
    model="@cf/zai-org/glm-5.3",
    messages=[
        {"role": "user", "content": "写一个带单测的 TypeScript 防抖函数。"}
    ],
    max_tokens=2048,
    temperature=0.7,
)

print(resp.choices[0].message.content)

任何 OpenAI SDK(Python、Node、Go、Rust)只需替换 base_url 即可对接。唯一的坑点:model ID 必须在 OpenAI 兼容面上也带 @cf/ 前缀。

4. AI Gateway — 网关代理路由 + 缓存

// gateway.example.com 通过 Unified billing 路由到 GLM-5.3
curl -X POST "https://gateway.example.com/v1/chat/completions" \
  -H "Authorization: Bearer *** \
  -d '{
    "model": "@cf/zai-org/glm-5.3",
    "messages": [{"role": "user", "content": "讲一下 DSA 注意力机制。"}]
  }'

AI Gateway 就是上面提到的预付费额度路径——把网关计费设为 "Unified billing" 并充值,然后把 OpenAI/Anthropic/Workers AI 模型通过同一端点路由,叠上缓存、限速、分析能力。

开源权重:HF 仓库、License、自托管路径

GLM-5.3 权重已发布在 huggingface.co/zai-org/GLM-5.3,使用自定义的 GLM-5.3 License。模型是带 DSA 注意力的 MoE(GlmMoeDsaForCausalLM),每 token 选 8 个专家,总参数量 ~754B,存储为 BF16 + FP8 分片 safetensors(全部片合计 ~755 GB)。

License 摘要(全文见 HF LICENSE 文件):

  • 免费用于使用、修改、合并、发布、分发、再许可、销售
  • 允许微调与衍生作品
  • 无 copyleft——衍生作品可采用任何许可
  • 唯一条件:Model-as-a-Service 提供商所属集团在任何 12 个月内收入超过 100 亿美元,商用前必须完成 Z.AI 安全审查
  • "按原样"提供,无任何担保
  • 安全审查联系方式:glmlicense@z.ai

对典型 SaaS 创业团队和内部工具,License 实际是宽松的。100 亿美元收入门槛只针对最大型超大规模云厂商——这条线以下的 API 转售方都可以自托管 GLM-5.3 而无需联系 Z.AI。架构细节见 arXiv 论文 2602.15763("GLM-5: from Vibe Coding to Agentic Engineering")。

如果自托管,准备好硬核硬件需求:754B 参数 BF16 推理最少 ~1.5 TB GPU 显存,或 FP8 下 ~755 GB。8 卡 H100 节点(80 GB × 8 = 640 GB 总)装不下 BF16;满 BF16 推理需要 8 卡 B200 或 8 卡 GB300 节点;接受 FP8 量化就能塞进 8 卡 H100。对绝大多数团队,Workers AI $1.40/M 输入价比自托管摊销 GPU 成本便宜得多。

何时用 GLM-5.3,何时用 Workers AI 上的其它选择

Workers AI 的国产模型阵容现在有三款付费层编码/智能体选项:

模型输入 $/M输出 $/M适用场景
@cf/zai-org/glm-5.3$1.40$4.40长程智能体工程、多小时编码任务、漏洞研究
@cf/zai-org/glm-5.3-flash$0.15$0.50高并发交互负载、多模态输入、对成本敏感的 chat/agent 循环
@cf/moonshotai/kimi-k2.7-code$0.60$2.50代码补全、代码评审、代码搜索——32K 以下单轮编码任务比 GLM-5.3 便宜
@cf/qwen/qwen3.8-27b$0.20$0.80Workers AI 上最便宜的多模态——走量不走前沿

价格规律:GLM-5.3 是四款中最贵的(输入价是 GLM-5.3-Flash 的 10 倍、Qwen 3.8 27B 的 7 倍),由基准增量背书。如果你的工作负载是单轮 Q&A 或简单 chat,GLM-5.3-Flash 或 Qwen 3.8 27B 是更划算的选择。如果你的工作负载正是 GLM-5.3 基准瞄准的智能体编码 / 长程自动化场景,溢价是值得的。

Z.ai 自家平台的替代路径是 GLM Coding Plan 订阅,把 GLM-5.3、GLM-5.3-Flash、GLM-5.2、GLM-5-Turbo 打包给 IDE 和智能体场景按月计费。这是 IDE 插件开发者想要固定预算下的前沿质量的正解;按 API 计费的工作负载一旦月用量超过 ~5M token,Workers AI 按 token 付费就比订阅更便宜。

常见问题

问:GLM-5.3 在 Workers Free 层免费吗?

不免费。GLM-5.3 在 Cloudflare 付费 frontier 列表里,和 GLM-5.2、GLM-5.3-Flash、Kimi K2.6、Kimi K2.7 Code、DeepSeek V4 Flash、DeepSeek V4 Pro 同列。要调用它需要 Workers Paid 套餐($5/月)或预付费 AI Gateway 额度。10K Neurons/天的免费额度不适用。

问:Workers AI 上 GLM-5.3 多少钱?

每百万输入 token $1.40,每百万缓存输入 $0.26,每百万输出 $4.40——与 GLM-5.2 同价。每 1K 输入 token 模型消耗 127,273 Neurons;每 1K 输出 token 400,000 Neurons。一次典型的 50K 输入 / 4K 输出编码任务约 $0.088。

问:Workers AI 上的模型 ID 是什么?

官方模型 ID 是 @cf/zai-org/glm-5.3(注意命名空间是 zai-org,不是 zhipu)。兄弟 Flash 变体是 @cf/zai-org/glm-5.3-flash。两者共享同样的 1,048,576 token 上下文窗口、推理、工具调用与结构化输出能力。

问:GLM-5.3 的速率限制是多少?

截至 2026-08-29,GLM-5.3 继承 Text Generation 默认 300 RPM/账户。Cloudflare 显式"Frontier models" RPM 表格(当前列出 GLM-5.2、Kimi K2.6、Kimi K2.7 Code 标准 20 RPM / 预付费 AI Gateway 50 RPM)尚未更新加入 GLM-5.3,预计上线后几天内会补充。

问:GLM-5.3 与 GLM-5.2 在编码基准上对比如何?

Z.ai 自家 Z.ai Code Bench 提升 50%。公开基准 GLM-5.3 vs GLM-5.2:Terminal Bench 2.1 88.2 vs 81.0,Terminal Bench 3.0 28.3 vs 4.6(开源 SOTA),DeepSWE 66.9 vs 46.2,FrontierSWE 78.1 vs 67.5,SWE-Marathon 42.5 vs 19.4(2 倍以上),CyberGym 84.5,AutomationBench 48.2。基座与 GLM-5.2 相同——所有提升来自后训练。

问:能自托管 GLM-5.3 吗?

可以。GLM-5.3 权重开源在 huggingface.co/zai-org/GLM-5.3(754B 参数,BF16 + FP8 分片,磁盘 ~755 GB)。模型是带 DSA 注意力的 MoE(GlmMoeDsaForCausalLM,每 token 8 专家)。许可为自定义 GLM-5.3 License——免费用于使用、修改、微调与商用部署;Model-as-a-Service 提供商所属集团在任何 12 个月内收入超过 100 亿美元,商用前必须完成 Z.AI 安全审查。

问:如何从 Worker 调用 GLM-5.3?

四个入口:(1) Workers 绑定 — env.AI.run('@cf/zai-org/glm-5.3', { messages: [...] });(2) REST API — POST https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/run/@cf/zai-org/glm-5.3;(3) OpenAI 兼容 — 对 Workers AI 端点 POST /v1/chat/completions,model='@cf/zai-org/glm-5.3';(4) AI Gateway — 同样的 model ID,网关计费设为 'Unified billing' 走预付费额度路径。

问:中国大陆访问情况?

Workers AI 端点是全球的;模型跑在 Cloudflare 300+ 城市的 GPU 池上,通过 Cloudflare 标准 anycast IP 可从中国大陆直连。GFW 内更高吞吐需求的话,Z.ai 自家平台(z.ai)托管同一 GLM-5.3 家族,外加 GLM Coding Plan 订阅,把 GLM-5.3、GLM-5.3-Flash、GLM-5.2、GLM-5-Turbo 打包给 IDE 和智能体场景。

结论

Workers AI 上的 GLM-5.3 是当前能以 $1.40/M 输入价调用的最强开源权重编码模型。对比 GLM-5.2 的基准增量——Terminal Bench 3.0 6.1 倍、SWE-Marathon 2.2 倍、CyberGym 84.5——是真实存在的,而且全部来自后训练,所以任何现有 GLM-5.2 部署的升级只需改一行 model ID。

两个真正的坑:付费门槛(10K Neurons/天免费额度不适用)和仍在变化的速率限制图景(当前 300 RPM 默认,几乎肯定在 Cloudflare 更新 frontier-RPM 表格后收紧)。已经在 Workers Paid 或有 AI Gateway 额度的团队,这是无脑升级。还在用免费层的团队,要么升级到 Paid(最低 $5/月),要么继续用 GLM-5.3-Flash / Qwen 3.8 27B——这两款依然在标准 Text Generation 300 RPM 下可用、且免费层 Neurons 可用。

最后核验:2026-08-29。来源:Cloudflare changelogWorkers AI pricingWorkers AI limitsGLM-5.3 model pageHF model cardarXiv 2602.15763