9月1日,Anthropic发了两款新模型——Claude Fable 5.1和受限版Mythos 5.1。
跑分多少?不重要。
真正值得看的数字在价目表里:列表价一分没动,输入10美元、输出50美元/百万token,跟上一代一模一样。但缓存读取价从1美元砍到0.25美元,降了75%。
第二天,Google把Gemini 3.8 Flash转正。输入0.75美元/百万token,缓存读取只要0.075美元——正好是十分之一。
再往前看,国内那场Flash之争,真正拉开差距的也不是标价。GLM-5.3-Flash和Qwen3.8-Flash的输入价都压在0.8元、输出2.7到2.8元,几乎不差。真正的差距在缓存命中价:Qwen低到0.1元/百万token,DeepSeek闲时能到0.05元。
标价没变,但你的账单可能已经变了。
为什么厂商都在抢“缓存价”?
因为烧钱的场景变了。
单轮问答的token消耗就那么多,标价砍到地板也省不了几个钱。真正烧钱的是那些反复读同一份上下文的Agent任务:一个改代码的Agent,同一份代码库要读几十遍;一个长文档助手,系统提示和背景材料几乎全程不动。
Anthropic的官方数据说得很直白:缓存命中价一降,典型工作负载便宜约25%,重度依赖缓存的Agent场景能便宜到45%。
这道算术很简单:缓存命中的token,模型不用重新计算,边际成本远低于首算。厂商过去把这块利润藏着,现在拿出来当武器,说明他们赌的是Agent化才是下一波量用的主力。
降价的方式在分化
Anthropic:标价不动,只动缓存。
Google:用“入门价+定期调价”快攻打法。
国内:标价、缓存、限时折扣叠在一起打混战。智谱GLM-5.3-Flash叠了限时5折到9月9日,阿里云8月31日把Qwen3-VL-Rerank的多模态输入从1.8元直接降到0.5元。
对开发者来说,旧有的“比标价”方式越来越失真。同样一份账单,缓存命中率90%和0%,成本能差出一个数量级。
如果你在用EasyAPI这类聚合层,缓存降价的红利能直接落到账单上——它把多模型接入、缓存命中率、每次调用的真实成本放在同一个视图里,切换只改配置不动代码。缓存价降了,你看得见;哪个任务值得缓存,你管得住。

一条规律正在浮现:标价是给市场看的,缓存价才是给账单看的。下次看到某家“没降价”的新闻,往下翻一页价目表——真正的战争,可能就藏在那行不起眼的小字里。

268

被折叠的 条评论
为什么被折叠?



