今天早上九点,如果你有个定时跑的Agent任务还在直调DeepSeek-V4 Pro,账单可能直接让你清醒。
高峰时段输出价27元/百万token,涨幅最高到1100%。
这已经不是“谁家模型又降价了”的新闻,而是整个行业在告诉你:API成本这件事,过去靠低价补贴混日子,现在轮到你自己动手优化了。
幻觉的终结
说实话,很多个人开发者和小团队这两年过得挺滋润。DeepSeek、Qwen、GLM轮番降价,OpenAI Luna脚踝斩80%,给人一种“算力自由”的幻觉。
但幻觉在2026年8月这个节点被戳破:
-
DeepSeek开始峰谷定价,高峰贵一倍
-
OpenRouter被Stripe以超70亿美元收编,成了支付巨头的“AI收费站”
-
NVIDIA开源了NeMo Switchyard,把智能路由做成基础设施
三件事拼在一起,信号很清晰:上游不再普惠请客,中间层开始收过路费,下游只能自己学会精打细算。
把“时间”写进账单
先看DeepSeek。它不是简单涨价,而是把“时间”引入了成本公式。
高峰9-12点、14-18点价格翻倍,空闲时段才回到你熟悉的水平。过去你随便丢给模型的后台任务,现在得看表。如果一个月50%调用落在高峰,同样流量成本直接涨40%以上。
这本质上是在教育市场:算力不是无限供给的,稀缺时段必须付费。
中间层的收网时刻
再看OpenRouter卖身Stripe。
关键不是70亿美元的数字,而是Stripe的身份——它不是云厂商,是支付管道。它买下OpenRouter,等于把“钱的流动”和“Token的流动”焊在一起。
OpenRouter月处理200万亿Token、年化收入1.4亿美元,毛利率接近70%。这不是技术公司的估值,这是基础设施收税权的估值。以后每一笔API调用,可能都要经过支付巨头的清算层。
路由,不是可选项了
那怎么办?
NVIDIA的NeMo Switchyard给了一个方向:别把所有请求都扔给最贵的模型。
145个Agent任务里,只有7%真正需要Claude Opus 4.8,剩下93%交给更小更便宜的模型,成本直接降74%。这不是实验室概念,是生产环境可以落地的策略。
路由、缓存、批量API这几招叠加,降本40%-70%是常态。国内像EasyAPI做的,就是把路由、缓存、配额管理打包成一套网关层,让中小团队不用自己搭一套NeMo Switchyard就能把多模型调度跑起来。

灰产的坑,比想象的大
但优化成本不能只靠工具,还得看清风险。
最近Vectoral报告曝光的AI Credit Resale Economy——初创公司用不完的API额度被黄牛以3-8折转卖,有经纪人一天过手10万美元。
便宜是真的便宜。但你的Prompt、用户数据、甚至Agent轨迹,全要过一个不明底细的代理。对企业来说,这等于在合规红线上蹦迪。
接下来半年
趋势不难判断:
-
API定价会越来越像机票和酒店,分时、分峰、分层
-
模型路由会从“高级玩法”变成默认配置
-
中间层会被金融和云巨头控制
-
合规和透明度会从可选项变成必选项
最后一句
今天不是AI变贵的开始,而是低价补贴结束的开始。
对会算账的团队来说,这反而是拉开差距的机会。模型能力正在commoditize,但调用效率、成本结构、合规水位,会成为接下来真正的护城河。


被折叠的 条评论
为什么被折叠?



