周二早上打开一个跑了俩月的Agent项目账单,差点以为自己点错了报表——同样的调用量、同样的代码、同样的模型名,这个月支出比上个月多了快三成。
什么都没改,Anthropic也没发通知。最后翻了一遍Claude Sonnet 5的报价页面才反应过来:首发价8月31日到期。这周日一过,每百万Token从2/10美元直接跳到3/15美元,输入输出两边各涨50%。
100M输入加20M输出的中等Agent流水线,月成本从400美元变成600美元。
但这只是账面上能算出来的。真正能让账单失控的,是下面这两把隐形杠杆。
第一把:你以为的Token数不是真的Token数
Sonnet 5这次换了一套新的分词器。Anthropic官方说明写得很坦白:同一段文本,按新tokenizer会被映射成约1.0到1.35倍的Token数。代码、JSON、结构化数据、非英文文本,落在膨胀最重的一档。
中文加代码密集的Agent任务,正好是国内开发者的主力场景。到9月1日之后,"等效文本单位"的实际成本相对旧标准价,最高可能接近翻倍,而不是账面上的50%。
第二把:同一模型同一天能差出几倍价
现在任何主流模型,都不止一个价位。GPT-5.6 Sol有官方直采价($5/$30)、batch半价($2.50/$15)、fast双倍加速($10/$60),再叠加prompt caching之后,实际成本可以差出好几倍。只看"标准价"做预算,现实会教你做人。
反直觉的是差价方向还不固定。DeepSeek V4 Flash官方标价$0.14/$0.28,OpenRouter上Provider报价却是$0.09/$0.18,第三方反而比官方便宜37%。GPT-5.6 Sol在OpenRouter跟官方标准价一样,Luna和Terra却对的是batch半价。一家一家去对,得不出结论。
更糟的是,涨价日历不会在代码里通知你
Sonnet 5之外,几个看起来还在降价的模型都埋着倒计时。Gemini 3.7 Flash的$0.75/$3.75优惠价只到2026年底,2027年1月翻倍。DeepSeek的V4 Flash虽然对外说降价,新的峰谷时段表8月17日已经悄悄生效。加上月底就要到期的还有OpenAI GPT-5.6 Sol促销价(20%/33%折扣,到11月21日)、Sonnet 5首发价(到8月31日)。
对独立开发者来说,真正的麻烦不是哪家最便宜,而是你根本不知道哪天哪条曲线会跳。账单说崩就崩,代码一行都不用动。
怎么看住这张账单?
如果你还在用一把密钥、一条调用链跑所有模型,翻倍的成本会突然拍到你脸上——而不是提前一周让你调整路由。
EasyAPI这类多模型网关的核心价值,也不只是"哪家便宜就调哪家"。而是把每家模型的有效期、tokenizer的膨胀系数、不同渠道的差价、以及月底到期的促销价,提前摊到你能看见的视图里。先看清楚账怎么涨的,再去谈降本。

如果你想知道自己手里的模型调用,到9月1日之后实际会涨多少,可以先把tokenizer膨胀系数乘进去算一下——尤其是大量用中文+代码的场景,那个1.35倍,可能比你想象的影响更大

400

被折叠的 条评论
为什么被折叠?



