GLM-5.3-Flash API 价格 2026:智谱 Z.ai 320B 混合注意力多模态模型评测
2026 年 8 月 26 日,智谱国际站 Z.ai(北京智谱 AI 的海外业务)在其 API 与 OpenRouter 上架了一个新模型:GLM-5.3-Flash。即使在发布密集的一周里,两个数字也值得深看一眼:它是一个320B 总参数 / 18B 激活参数的模型,而且是首个把稀疏注意力与线性注意力组合成混合架构的开源前沿模型。Z.ai 官方文档称,相比 GLM-5.3,该设计把注意力计算减少 3.01 倍、KV cache 体积减少 4.44 倍——这正是像 apirank 这样的 API 价格站最想拆解的服务成本数学。本评测覆盖 docs.z.ai(2026-08-27 抓取)上已验证的每百万 token 定价、50% 首发折扣窗口、多模态交互面,以及 Flash 在产品矩阵里与 GLM-5.3 及市面上其他低成本推理 API 的定位。
为什么架构对 API 成本很关键
大多数 "Flash" 或 "mini" 模型靠整体缩小模型来降成本。GLM-5.3-Flash 走了另一条路:保留 320B 总参数但每个 token 只激活 18B,并用稀疏注意力 + 线性注意力的混合结构替代二次方自注意力。据 Z.ai 文档,相比 GLM-5.3,这使注意力计算减少 3.01 倍、KV cache 体积减少 4.44 倍。对开发者来说,实际意义是更低的单位服务成本与长上下文记忆开销——这也是 Z.ai 把它的价格定在旗舰的零头的原因。同样的架构既让宿主 API 保持低价,又在保持"精确长上下文能力"的同时避免了真正小模型常见的上下文截断问题。
GLM-5.3-Flash 定价 2026:从 docs.z.ai 验证
docs.z.ai/guides/overview/pricing(2026-08-27 抓取)上的官方定价表,按每百万 token 列出 GLM-5.3-Flash:
- 输入:$0.15/百万 token —— 首发促销$0.075。
- 输出:$0.50/百万 token —— 首发促销$0.25。
- 缓存输入:$0.03/百万 token —— 促销$0.015。
- 缓存输入存储:限时免费。
划线价是官方列表价,50% 折扣持续到 2026 年 9 月 9 日 24:00(UTC+8,新加坡时间)。在 OpenRouter 上,模型以 z-ai/glm-5.3-flash 上线,$0.075 输入 / $0.25 输出每百万,上下文窗口 1.25M——与 Z.ai 折扣价一致,说明当前市场看到的就是促销价。
GLM-5.3-Flash vs GLM-5.3:清晰的两档故事
Z.ai 现在同时提供两款 GLM-5 级模型,价格差是最快的阅读方式:
| 模型 | 参数(总/激活) | 输入/M | 输出/M | 上下文 | 多模态 | 发布时间 |
|---|---|---|---|---|---|---|
| GLM-5.3-Flash | 320B / 18B | $0.15(促销 | $0.50(促销 | 1M(文档)/1.25M(OpenRouter) | ✅ 原生图像/视频 | 2026-08-26 |
| GLM-5.3 | 大型文本模型 | $1.40 | $4.40 | 1M | 仅文本 | 2026-08-18 |
GLM-5.3 是 Z.ai 面向复杂软件工程与长周期 agent 任务的推理旗舰;GLM-5.3-Flash 是主打性价比的多模态兄弟。以 1/9 的输入价格与 18B 激活参数,Flash 用推理深度换取吞吐与单位经济——对吞吐优先、需要视觉闭环的高频编码 agent 来说,更便宜的 token 预算往往比略高的推理上限更重要。
原生多模态:把视觉融入编码闭环
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态输入模型:图像、视频、文件通过与文本相同的 Chat Completion API 传入。通过 type: "image_url" 内容块添加图像(URL 或 Base64 Data URL)。因为视觉被内建进编码闭环而非外挂,模型可以观察界面、渲染结果与交互反馈,再持续测试与改进——覆盖前端开发、游戏创作、Blender 3D 场景,以及浏览器/GUI 工具驱动的 agent 化操作。对于过去要拼装"视觉模型 + 编码模型"两个厂商的团队,这会把两个厂商折叠成一次调用。
上下文、思考模式与推荐参数
文本参数与 GLM-5.3 一致,支持 1M-token 上下文窗口(OpenRouter 报告 1,310,720 token)。Z.ai 推荐参数:temperature: 1、top_p: 0.95、reasoning_effort: max。注意 thinking.type 仅支持 enabled——无法关闭思考。流式请求时官方建议同时开启 stream: true 与 tool_stream: true。模型还支持函数调用、上下文缓存(即上面打折的缓存输入档)、结构化输出与完整流式。
调用 GLM-5.3-Flash:curl 与 Python
端点兼容 OpenAI,官方 OpenAI Python SDK 只需替换 base_url。Z.ai 模型代码为 glm-5.3-flash,OpenRouter 为 z-ai/glm-5.3-flash。
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [
{"role": "user", "content": [
{"type": "text", "text": "Describe this diagram and list the API endpoints it shows."},
{"type": "image_url", "image_url": {"url": "https://example.com/architecture.png"}}
]}
],
"temperature": 1,
"top_p": 0.95,
"reasoning_effort": "max"
}'
from openai import OpenAI
client = OpenAI(
api_key="$ZAI_API_KEY", # 或填入 OpenRouter key
base_url="https://api.z.ai/api/paas/v4", # 或 https://openrouter.ai/api/v1
)
resp = client.chat.completions.create(
model="glm-5.3-flash", # OpenRouter 上用 z-ai/glm-5.3-flash
messages=[{"role": "user", "content": [
{"type": "text", "text": "Explain the cost of running this 320B/18B model at scale."},
]}],
temperature=1,
top_p=0.95,
)
print(resp.choices[0].message.content)
GLM Coding Plan:3 倍配额,非高峰半价积分
GLM-5.3-Flash 现已加入 Z.ai 的 GLM Coding Plan(个人版与团队版),在同套餐下拥有 GLM-5.3 的 3 倍配额。该套餐采用积分制配额系统、限额透明,且非高峰时段(包括周末全天)的模型调用只消耗标准积分的 50%。这种非高峰半价钩子,让 Flash 成为面向 Claude Code、Cursor、Cline、Kilo Code 等可指向自定义 OpenAI 兼容端点、且 token 消耗是主要成本变量的开发者工具时,通常的首选。
GLM-5.3-Flash 适合谁
三个典型场景:
- 视觉闭环编码 agent:一次 API 调用同时处理文本+图像+视频,模型在渲染出的 UI 上迭代——把"视觉模型 + 编码模型"折叠成单一端点。
- 高频、成本敏感的多模态负载:首发促销 $0.075/M 输入(列表价 $0.15),配合 18B 激活参数与线性注意力,单 token 成本远低于前沿旗舰——适合大规模抓取、文档与图表分析、长上下文 RAG。
- 自托管长上下文推理:作为开源模型,GLM-5.3-Flash 的权重可跑在自己的 GPU 上(或 Z.ai 的国产 AI 芯片服务),对大陆数据驻留与严格数据主权有意义。
它不太适合的场景:需要最深的推理上限(GLM-5.3 乃至 OpenAI/Anthropic 旗舰仍占优)、无法忍受强制的思考过程(thinking.type 不可关闭)、或需要超过 128K 的超长单次输出。
总结
GLM-5.3-Flash 是本周最有意思的"高性价比前沿"发布,因为它的成本优势来自架构而非单纯缩小模型。混合稀疏+线性注意力设计(相比 GLM-5.3 注意力计算减少 3.01 倍、KV cache 减小 4.44 倍),是 Z.ai 能把 320B 参数的多模态模型定价到 $0.075/$0.25 每百万(促销至 2026 年 9 月 9 日)、随后稳定在 $0.15/$0.50 的根本原因。已从 docs.z.ai(2026-08-27)验证,并在 OpenRouter 交叉核对(以相同折扣价实时上架)。它是 GLM-5.3 的合法低成本兄弟,带原生图像/视频输入与 1M+ 上下文。如果你的预算偏向开源模型、负载是视觉闭环编码或高频多模态 RAG,趁 50% 促销仍在,现在就该把 GLM-5.3-Flash 放进候选名单。
如果你想用一把 OpenAI 兼容的钥匙、带跨区切换路由 GLM-5.3-Flash(或上面提到的任意开源/多模态模型),FreeModel 是最简单的交接方式:一个控制台、一次计费关系、无需胶水代码即可做路由控制。