- 前沿模型单价确实在降:GPT-5.6 Sol 输出价 -33%,Gemini 3.7 Flash 折扣力度约 75%,Anthropic 还取消了原定 9 月的涨价。
- 但你的账单大概率在涨:中国日均 Token 调用量从 2024 年初约 1000 亿,涨到 2026 年 3 月约 140 万亿;一次 Agent 任务的消耗约为线性 workflow 的 30 倍。
- 根因不是"模型贵了",而是 调用量爆炸 + 你大概率在为贵的那部分买单 + 没有路由。
- 工程师能做的三件事:成本感知路由、运行时策略控制面、缓存保全。下面给代码。
一、反直觉的事实:模型在降价,你的账单在涨
2026 年 8 月,海外三家同时松价:
| 模型 / 动作 | 价格变化 |
| OpenAI GPT-5.6 Sol | 输出 $30 → $20(-33%),且至少维持到 2026-11 |
| Google Gemini 3.7 Flash | 约上一版 5 折,折扣持续到 2027-01 |
| Anthropic Claude Sonnet 5 | 取消原定 9 月 +50% 涨价,首发价长期保留 |
单价下行,是确定性趋势。但把镜头拉到企业侧,故事反过来了:
- 国家数据局数据:中国日均 Token 调用量从 2024 年初约 1000 亿 增至 2026 年 3 月约 140 万亿(注意单位:是"万亿",不是"亿")。
- Agent 放大效应:单次 Agent 任务消耗约为线性 workflow 的 30 倍。一旦把 AI 嵌进业务流程,调用量不再按"人点击次数"算,而是按"Agent 自主循环次数"算。
这就是典型的 K 型分化:模型单价往左下走,企业总账单往右上走。两者同时发生,不矛盾——因为账单 = 单价 × 调用量,而调用量的增速远快于单价降幅。
二、为什么"单价降"救不了"账单涨"
1. 调用量在结构性膨胀
线性 workflow 是"人发起一次、模型答一次"。Agent 是"规划 → 调工具 → 看结果 → 再规划"的循环,每一步都可能是一次或多此模型调用。微软工程师用一个运行时策略控制面把 Agent Token 账单砍掉 78%,同时任务完成率从 67% 升到 96%——砍掉的是死循环、冗余搜索和膨胀上下文,不是有效推理。这说明:很多账单是"浪费"堆出来的,不是"智能"堆出来的。
2. 你大概率在为"贵的那部分"买单
llmpricing.dev 覆盖 2573 个模型 × 200 家服务商 × 7295 条报价,同一模型的最低价与官方牌价价差惊人:
- GPT OSS 120B:33.3×
- Kimi K2.6:8.1×
- GLM-5.2:7.7×
- DeepSeek V4 Pro:6.9×
也就是说,同一个模型,你走官方牌价 vs 走低价渠道,账单能差一个数量级。"会不会选渠道"本身就是成本。** 没有路由的团队,默认走最贵、最容易被记账的那条路。**
3. 没有路由,就默认走"最慢 / 最贵 / 最不稳"路径
硬编码一家模型,等于把"选模型"这个决策永久冻结在上线那天。而模型市场每周都在变:DeepSeek 8/17 提价,9 天后智谱和阿里就开源了评测更高、价格更低的新模型。涨价能维持定价权的窗口往往只有一两周。把模型写死,等于主动放弃这期间的降本机会。
三、工程师能做的三件事(附代码)
思路一:成本感知路由——按任务价值选模型
不要把所有请求都丢给同一个旗舰。简单分类、草稿生成、内部校验走小模型;只有真正需要推理的步骤才上前沿模型。经验值:约 80% 请求路由到低价模型、20% 用前沿 API,可降本 60–70% 且不损常规任务质量。
下面是一个 OpenAI 兼容的"按成本路由"示意(DeepSeek / 混元 / Qwen 都兼容同一套 SDK):
from openai import OpenAI
# 三家用同一套 OpenAI 兼容协议,只是 base_url 和 model 名不同
PROVIDERS = {
"cheap": {"base_url": "https://api.deepseek.com/v1", "model": "deepseek-chat"},
"mid": {"base_url": "https://api.hunyuan.cloud.tencent.com/v1", "model": "hunyuan-turbo"},
"strong": {"base_url": "https://dashscope.aliyuncs.com/compatible-mode/v1", "model": "qwen-plus"},
}
def route(task_complexity: str) -> dict:
# 简单任务走便宜的,复杂任务才上强的
if task_complexity == "trivial":
return PROVIDERS["cheap"]
if task_complexity == "normal":
return PROVIDERS["mid"]
return PROVIDERS["strong"]
def ask(prompt: str, complexity: str):
cfg = route(complexity)
client = OpenAI(base_url=cfg["base_url"], api_key="sk-自己的Key")
resp = client.chat.completions.create(
model=cfg["model"],
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
思路二:运行时策略控制面(照微软的做法)
在 Agent 循环外挂一层"策略守卫":速率限制、输出长度动态精简、检测到死循环自动切到低成本路径。微软那个 -78% 的案例,核心就是这层控制面,而不是换模型。
思路三:缓存保全
CacheRouter 论文把工具列表拆成"固定核心工具(主模型永远看到)+ 独立路由通道(其余工具走子模型检索)",让 token 级缓存命中率达到 90%+,输入成本压到无缓存基线的 8%–12%。如果你的 prompt 前缀长期不变(系统提示、工具定义),务必打开 provider 的 prompt cache。
四、一个现实解法:统一接入层 + 成本感知路由
上面三件事,单独做都不难,难的是长期维护:模型每周变价、渠道每周新增、合规要求(尤其出海)每月加码。当团队同时用 3+ 家模型时,自己写一个路由 + 计费 + 故障转移的中间层,很快会变成"第二个需要养的项目"。
我们最近在做的 TokenLat 就是沿着这条路走的——一个面向国产大模型的统一翻译层 / 模型聚合与分发网关:
- OpenAI 兼容:你上面那段代码,把
base_url指向网关,就能一行代码在 DeepSeek / 混元 / Qwen 之间切换,不用为每个厂商改 SDK。 - 成本感知路由:峰谷计价、分层定价自动转化为业务红利——某家高峰涨价时,路由自动把可替代流量导向闲时或更优渠道。
- 故障转移 + 可观测:一家不可用,自动切下一家;每一笔调用都有成本、延迟、来源留痕。
- 出海合规友好:数据驻留感知路由,让境内 / 境外流量走各自合规模型与节点(对做海外业务的企业是硬需求,不是加分项)。
五、小结
“Token 自由时代"没有消灭成本问题,只是把问题从"买不买得起模型"变成了"会不会用模型”。三件事现在就能做:
- 路由:按任务价值选模型,别让所有请求都砸旗舰上。
- 控制面:给 Agent 循环加策略守卫,砍掉死循环和冗余。
- 缓存:长前缀务必开 prompt cache。
等模型多到养不动时,再考虑把路由 / 计费 / 故障转移交给统一接入层。账单的拐点,往往不在"换个更便宜的模型",而在"建立一套会自己选模型的机制"。
免责声明:文中价格与调用量数据来自 2026-08 公开报道与厂商公告(OpenAI / Google / Anthropic / 国家数据局 / llmpricing.dev / 微软工程博客 / arXiv 等),统计口径不一,具体以各官网实时信息为准。本文为技术分享,不构成任何采购或投资建议。

320

被折叠的 条评论
为什么被折叠?



