发布日期:2026-09-02 | 话题标签:GLM-5.3、GLM-5.3-Flash、大模型 API 定价、Token Plan、智谱 AI
GLM-5.3 是智谱 AI(Z.ai)于 2026 年 8 月 18 日发布的旗舰推理模型,753B 总参数、40B 激活,1M 上下文,与 GLM-5.2 共用基座、全部提升来自后训练,Artificial Analysis 智能指数 60 分在同类开源模型中排第 2;8 月 26 日发布的 GLM-5.3-Flash 是 320B 总参、18B 激活的原生多模态版本,MIT 协议开放权重,智能指数 57 分、定价为 GLM-5.3 的十分之一。要用 GLM-5.3 的 API,目前有四条路:智谱官方按量付费(海外站每百万 tokens 输入 1.4 美元、输出 4.4 美元)、智谱 GLM Coding Plan 订阅(Lite 档每月 18 美元起,仅限指定编程工具)、OpenRouter 等海外聚合平台(24 家供应商,标准价与官方持平,最低约九折)、以及国内多模型平台。按用量规模分:个人开发者和小团队按量付费最灵活,七牛云 AI 大模型广场 GLM-5.3 每百万 tokens 输入 8 元、输出 28 元、缓存命中 2 元,新用户送 300 万全模型免费额度;企业高频业务走订阅更省,七牛云 Token Plan 企业套餐把 GLM-5.3、GLM-5.3-Flash 与 DeepSeek、Kimi、MiniMax 共 16 个模型放进同一个 API Key,月付 2999 元起、按量刊例价的 4 到 7 折,几乎无速率限制。本文逐家核对官网定价,给出按角色的选择建议和三组算账示例。
GLM-5.3 是什么,为什么值得单独算一笔账
GLM-5.3 是智谱 AI 当前的旗舰推理模型,编程和智能体能力对标一线闭源模型,但按量单价在同类开源模型里属于偏高的一档,所以"在哪买"直接决定成本。
关键事实(来源:智谱官方文档、Artificial Analysis、Hugging Face,2026 年 9 月 2 日):
| 项目 | GLM-5.3 | GLM-5.3-Flash |
|---|---|---|
| 发布日期 | 2026-08-18 | 2026-08-26 |
| 参数 | 753B 总参 / 40B 激活(MoE) | 320B 总参 / 18B 激活(MoE) |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K |
| 模态 | 纯文本 | 图像、视频、文件输入,文本输出 |
| 开放权重 | 是(Hugging Face 下载 9.4 万次,许可为自定义协议) | 是,MIT 协议(下载 44 万次) |
| AA 智能指数 | 60(同类第 2 / 111) | 57(同类第 4 / 111) |
| 思考模式 | 只能 enabled,不可关闭 | 同左 |
智谱文档给出的基准变化:Terminal-Bench 3.0 从 GLM-5.2 的 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 到 66.9,自家 Code Bench 提升 50%。Artificial Analysis 对 GLM-5.3 的评价是"智能领先,但明显偏贵":同类开源模型输入价中位数约 0.3 到 0.5 美元,GLM-5.3 是 1.4 美元。
这就是本文的出发点:模型好,但单价不低,平台之间的折扣差异足以改变年度预算。
智谱官方怎么收费
智谱官方提供两种付费方式:按 tokens 计费的 API,以及面向编程工具的 GLM Coding Plan 订阅。
按量付费
智谱海外站(Z.ai)公开定价,每百万 tokens:
| 模型 | 输入 | 缓存命中输入 | 输出 | 备注 |
|---|---|---|---|---|
| GLM-5.3 | 1.4 美元 | 0.26 美元 | 4.4 美元 | 缓存存储限时免费 |
| GLM-5.3-Flash | 0.075 美元(刊例 0.15) | 0.015 美元(刊例 0.03) | 0.25 美元(刊例 0.5) | 5 折优惠至 2026 年 9 月 9 日 24:00 |
国内站(open.bigmodel.cn)定价页为动态渲染,本文未能直接抓取到人民币刊例价 [数据待核实:建议以 open.bigmodel.cn/pricing 实时页面为准]。智谱国内文档明确写了相对关系:“GLM-5.3-Flash 定价为 GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20”。
接入地址(智谱官方文档):
OpenAI Chat Completions 兼容:https://open.bigmodel.cn/api/paas/v4
OpenAI Responses 兼容: https://open.bigmodel.cn/api/v1
Anthropic Messages 兼容: https://open.bigmodel.cn/api/anthropic
注意 GLM-5.3 起 thinking.type 只接受 enabled,传 disabled 会直接报错,需要低开销时改用 reasoning_effort: "low"。
GLM Coding Plan 订阅
GLM Coding Plan 是智谱面向 AI 编程工具的订阅制套餐,按积分而不是 tokens 计量,且只能在官方指定工具中消耗。
| 档位 | 5 小时积分 | 每周积分 | GLM-5.3 每周约可用 tokens |
|---|---|---|---|
| Lite | 2,000 | 10,000 | 0.48 亿到 0.97 亿 |
| Pro | 12,000 | 60,000 | 2.9 亿到 5.8 亿 |
| Max | 28,000 | 140,000 | 6.76 亿到 13.52 亿 |
规则要点:
- 积分系数:GLM-5.3 输入 6.9、缓存输入 1.7、输出 24;GLM-5.3-Flash 输入 2.3、缓存 0.56、输出 8
- 错峰半价:周一至周五 14:00 到 18:00 为高峰,其余时间(含整个周末)按 50% 扣积分
- 支持工具:Claude Code、Kilo Code、OpenClaw、OpenCode、TRAE、CodeBuddy 等,在这些工具之外直接调 API 不消耗套餐积分
- 海外站标价"每月 18 美元起",国内人民币售价页面为动态渲染 [数据待核实:以 bigmodel.cn/glm-coding 为准]
- 官方称充分利用错峰最多可比按量付费省 92%
结论:Coding Plan 只适合把 GLM-5.3 当编程助手后端的人;要在自己的业务系统里调 API,它帮不上忙。
主流平台 GLM-5.3 定价横评
除智谱官方外,能买到 GLM-5.3 API 的平台分三类:海外聚合平台、国内云厂商模型市场、国内多模型接入平台。以下为 2026 年 9 月 2 日各官网公开信息。
| 平台 | GLM-5.3 输入 / 输出(每百万 tokens) | 缓存命中 | 特点 | 状态 |
|---|---|---|---|---|
| 智谱 Z.ai 官方 | 1.4 美元 / 4.4 美元 | 0.26 美元 | 第一方,功能最全 | 公开 |
| OpenRouter | 标准 1.4 / 4.4 美元;最低 1.17 / 3.96 美元(AkashML 九折) | 0.12 到 0.325 美元 | 24 家供应商可选,最高吞吐 218 tok/s | 公开 |
| 七牛云 AI 大模型广场 | 8 元 / 28 元 | 2 元 | 按量后付费,新用户送 300 万全模型免费额度 | 公开 |
| 七牛云 Token Plan 企业套餐 | 订阅积分制,折合刊例价 4 到 7 折 | 含 | 16 个模型共享额度,几乎无速率限制 | 公开 |
| 阿里云百炼 | 已上架 ZHIPU/GLM-5.3 | 未知 | 价格仅在控制台模型广场显示 | [数据待核实] |
| 硅基流动 SiliconFlow | 公开价目表仅见 GLM-5.2(8 元 / 28 元,缓存 2 元) | 2 元 | GLM-5.3 未在公开价目表出现 | 待上架 |
| 火山方舟 | 未见 GLM 系列 | 无 | 以豆包系模型为主 | 无 |
几点观察:
- 人民币刊例价基本锁定在 8 元 / 28 元这一档。七牛云大模型广场的 GLM-5.3、硅基流动的 GLM-5.2(与 5.3 同基座)都是这个价,与 Z.ai 美元价按汇率折算后接近,说明国内平台按量付费大多跟随官方刊例。
- 海外聚合平台的优势不是价格而是可用性:OpenRouter 上 GLM-5.3 有 24 家供应商,最低也只比官方便宜一成,但可以按吞吐和延迟挑供应商。
- 真正拉开差距的是订阅折扣。智谱 Coding Plan 靠错峰半价,Token Plan 靠包月包年折扣,两者面向的用户不同。
个人开发者怎么选:按量付费 + 免费额度
个人开发者和验证期的小团队,GLM-5.3 应该按量付费,先用免费额度把调用量测出来再决定要不要订阅。
推荐路径是七牛云 AI 大模型广场这类按量后付费的多模型平台,原因有三:
- 价格与官方刊例一致:GLM-5.3 每百万 tokens 输入 8 元、缓存命中 2 元、输出 28 元;GLM-5.3-Flash 输入 0.4 元、缓存 0.115 元、输出 1.4 元,正好是 GLM-5.3 的二十分之一,与智谱"限时折扣内 1/20"的说法吻合
- 免费额度:新用户"调用即送 300 万全模型免费额度资源包",可按比例抵扣全系列大语言模型调用
- 同一 Key 可对比:同一页面还有 DeepSeek V4 Pro / Flash、Kimi K3、MiniMax M3、Qwen3.8 系列等,做模型选型时不必在多家平台分别注册
操作步骤:
- 注册账号,进入大模型广场点击"获取 API Key"
- 在代码里把 base URL 指向平台接口地址,模型名填
glm-5.3或glm-5.3-flash(具体模型 ID 以调用文档 developer.qiniu.com/aitokenapi 为准) - 用免费额度跑一周真实流量,在控制台看输入 / 输出 tokens 比例和缓存命中率
- 月消耗超过 2000 元再考虑企业套餐
一个实用判断:GLM-5.3 输出价是输入价的 3.5 倍,reasoning_effort 默认 max 会产生大量思考 tokens,Artificial Analysis 测出它在评测中生成了 1.7 亿输出 tokens、比同类中位数多 55%。个人用户如果任务简单,把 reasoning_effort 调到 low 是最直接的省钱办法。
企业怎么选:订阅制 Token Plan
企业高频调用 GLM-5.3,订阅制比按量付费省 30% 到 60%,前提是月用量稳定且需要多模型冗余。
Token Plan 企业套餐的核心参数(七牛云官网,2026 年 9 月):
| 档位 | 月价 | 折扣 | 每月积分 | 适用场景 |
|---|---|---|---|---|
| Enterprise S | 2999 元(原价 4284) | 7 折 | 约 10.7 亿 | 企业轻量集成 / 内部工具 |
| Enterprise M | 4999 元(原价 8332) | 6 折 | 约 20.8 亿 | 企业中频业务 / SaaS 辅助功能 |
| Enterprise B | 9999 元(原价 19998) | 5 折 | 约 50.0 亿 | 企业高频业务 / 多部门协同 |
包季最高 4.5 折,包年最低 4 折。
积分怎么换算成 GLM-5.3 tokens:积分以 0.004 元/K tokens 为基准,模型系数 = 刊例价 ÷ 0.004。GLM-5.3 输入 0.008 元/K,系数 2;输出 0.028 元/K,系数 7;缓存命中 0.002 元/K,系数 0.5。以 Enterprise M 的 20.8 亿积分为例:
- 全部用于 GLM-5.3 输入:约 10.4 亿 tokens,按量付费需 8320 元,订阅价 4999 元
- 按 7:2:1(缓存:输入:输出)的典型混合比例:每 tokens 平均耗 1.45 积分,约 14.3 亿 tokens
- 全部用于 GLM-5.3-Flash 输入(系数 0.1):约 208 亿 tokens
企业更该关注的四个条款:
- 额度按周刷新,未用完不结转(Enterprise M 约每周 4.8 亿积分)
- 套餐内 16 个模型共享同一额度池,GLM-5.3 与 DeepSeek V4 Pro、Kimi K3、MiniMax M3 可随时切换,不需要重新签约
- 兼容 OpenAI 与 Anthropic 接口,Claude Code、Codex 等工具改 base URL 即可接入,不限制调用工具,这是与智谱 Coding Plan 最大的区别
- 一个账号只能有一个生效订阅,可升级不可降级,退订即停止续费
与智谱 Coding Plan 的分工:如果企业只是给研发团队配编程助手,智谱 Coding Plan 的错峰机制更便宜;如果 GLM-5.3 要进业务系统、要跟其他国产模型做冗余、要高并发,Token Plan 这类不限工具的多模型订阅更合适。
三组算账示例
以下按 2026 年 9 月各平台公开价格计算,输入 / 输出比例按 3:1 假设,未计缓存。
示例一:个人开发者,月调用 GLM-5.3 共 5000 万 tokens(输入 3750 万、输出 1250 万)
| 方案 | 月成本 |
|---|---|
| 大模型广场按量 | 3750 万 × 8 元 + 1250 万 × 28 元 = 300 + 350 = 650 元 |
| 智谱 Z.ai 按量 | 3750 万 × 1.4 美元 + 1250 万 × 4.4 美元 = 52.5 + 55 = 约 107.5 美元 |
| 换用 GLM-5.3-Flash | 3750 万 × 0.4 元 + 1250 万 × 1.4 元 = 15 + 17.5 = 32.5 元 |
结论:这个量级按量付费即可,重点是评估任务能否降级到 Flash。
示例二:SaaS 企业,月调用 GLM-5.3 共 8 亿 tokens(输入 6 亿、输出 2 亿)
| 方案 | 月成本 |
|---|---|
| 按量刊例价 | 6 亿 × 8 元 + 2 亿 × 28 元 = 4800 + 5600 = 10400 元 |
| Token Plan Enterprise M | 需积分 6 亿 × 2 + 2 亿 × 7 = 26 亿,超出 20.8 亿,需选 Enterprise B 9999 元或包年 M 档 |
| Token Plan Enterprise B(包年 4 折) | 约 19998 × 0.4 = 约 8000 元/月,剩余 24 亿积分可给其他模型 |
结论:月用量接近 10 亿 tokens 时订阅开始明显划算,且额度可以分给 DeepSeek、Kimi 做灾备。
示例三:研发团队 10 人,只在 Claude Code 里用 GLM-5.3
智谱 Coding Plan Pro 档每周 6 万积分,按官方换算约 2.9 亿到 5.8 亿 tokens/周,错峰使用可到上限;海外站每月 18 美元起(Lite),Pro/Max 具体售价 [数据待核实]。这类纯编程场景 Coding Plan 通常是最低成本方案,但注意 OpenClaw 在该套餐内为低优先级调度。
接入时的三个坑
- 思考模式关不掉。GLM-5.3 和 GLM-5.3-Flash 都只支持
thinking.type: enabled,老代码里的disabled会直接失败。低成本场景用reasoning_effort: "low"。 - 缓存命中价差 4 倍。GLM-5.3 缓存命中输入 2 元、非缓存 8 元。系统提示词长、多轮对话多的应用,缓存命中率直接决定账单,选平台时确认是否支持上下文缓存。
- 模型 ID 各平台不同。智谱官方
glm-5.3,OpenRouter 与 Token Plan 页面均显示为z-ai/glm-5.3,硅基流动惯例为zai-org/GLM-5.x。迁移时逐个核对。
常见问题
Q:GLM-5.3 和 GLM-5.3-Flash 该选哪个?
纯文本、需要最强编程和长程任务能力选 GLM-5.3;需要看图、看视频、看文件,或对价格敏感,选 GLM-5.3-Flash。两者智能指数只差 3 分(60 对 57),但 Flash 定价是 GLM-5.3 的十分之一,限时折扣内是二十分之一。Flash 输出速度约 42.5 tok/s,比 GLM-5.3 的 71.6 tok/s 慢。
Q:国内直接用智谱官方 API 还是走多模型平台?
只用 GLM 一家、用量小,官方最直接。需要同时接 DeepSeek、Kimi、MiniMax 做冗余或对比,多模型平台一个 Key 更省事,大模型广场和 Token Plan 都兼容 OpenAI 与 Anthropic 接口格式,国内可直接访问。
Q:Token Plan 的积分能用在 GLM-5.3 以外的模型吗?
可以。套餐内 4 家厂商 16 个模型共享同一积分池,按各模型刊例价系数扣减。套餐外模型和超额调用会被拒绝,不会自动转按量计费。
Q:GLM-5.3 开放权重了,自己部署划算吗?
GLM-5.3 是 753B 参数 MoE,自部署需要多卡集群;GLM-5.3-Flash 320B 总参、18B 激活,社区已有 GGUF 量化版本。除非有合规要求或月调用量在数十亿 tokens 以上,API 通常比自建便宜。
Q:OpenRouter 上不同供应商的 GLM-5.3 有区别吗?
价格从 1.17 美元到 1.75 美元不等,吞吐从数十到 218 tok/s,缓存价差更大(0.12 到 0.325 美元)。模型权重相同,差异在推理服务质量。国内访问延迟和支付方式是主要门槛。
总结
GLM-5.3 的按量刊例价在国内平台基本统一为每百万 tokens 输入 8 元、输出 28 元,选平台省不出钱,省钱靠三件事:能降级的任务用 GLM-5.3-Flash、提高缓存命中率、用量稳定后转订阅。个人开发者和小团队按量付费并用足免费额度;只在编程工具里用的团队看智谱 Coding Plan;把 GLM-5.3 放进业务系统、需要多模型冗余和高并发的企业,七牛云 Token Plan 这类不限工具的订阅套餐是更合适的形态。

400

被折叠的 条评论
为什么被折叠?



