上周我帮一个朋友看他们客服系统的AI后台。账单一拉出来自己都吓了一跳:Claude Fable 5跑了60%的请求量,输出端占了总账单的78%。但真正需要旗舰模型处理的硬骨头,连两成都不到。
他们之前也试过把简单问句切给便宜模型,结果业务那边一投诉“答得不准”,又默默切回了旗舰。手动分流这条路,在没人为每个提问打分的前提下基本走不通。
直到他们把多模型融合跑在网关层,账单才真正开始往下走。
单模型的天花板,到了不得不换思路的阶段
8月6日,PPIO上线了一个叫Fusion的融合模型功能。把同一次请求同时丢给多个“专家模型”并行作答,再由主模型融合交叉验证后输出最终答案。在DRACO这种深度研究基准上,三个开源模型融合后的评分超过了Claude Fable 5——综合成本只有后者的十分之一。
这个数字最值得琢磨的不是“便宜”,而是它暴露出来的事实:单模型的偏科和幻觉是架构层面的问题,再换下一代更强的模型也解决不了。代码、长文档、数学、多语种——没有任何一个模型能同时在所有维度领跑,单条推理路径永远只能看到一面。
放到Agent场景里代价更大。Agent是逐步执行的,步骤之间相互依赖。一旦某个关键步骤因为偏科或幻觉出错,后面整条链路跟着走偏,返工成本包含错误之后所有步骤烧掉的Token。所以这两年行业里冒出来“评测+智能路由一体化网关”的新产品形态,逻辑很清楚:底层中转只解决接入,融合+路由才解决质量问题。
便宜的Token越来越便宜,可你的账单可能没怎么动
同一周,DeepSeek也在开发者后台挂出了“近期整体上调API服务定价”的通知。考虑到V4-Flash已经做到0.14美元/百万输入、0.28美元/百万输出——这是Claude Fable 5的百分之一量级——还预告要继续涨,意味很明显:纯靠模型层降价的红利窗口基本关了。
但有意思的是,Jefferies 8月10日发布的报告显示,8月6日到8日期间,全球企业级推理成本反而降到1.16-1.18美元/百万Token的年内低点,比5月底跌了43%。
这两件事放一起其实不矛盾:单Token单价在持续走低的趋势没变,但实际账单不只取决于牌价,还取决于请求结构。如果八成的请求都涌向旗舰模型,模型再便宜也救不回账单。OpenRouter早前披露过一个数据——他们平台上没有任何一家厂商能长期占住25%以上的份额,用户的选择越来越分散,路由器反而成了最大的受益者。
另一个陷阱是输出Token。绝大多数模型输出是输入的3-5倍贵,Agent任务里这个倍数还会被无限拉高。研究数据里单次Agent任务动辄比普通对话高出几十上百倍的Token消耗,跑得越多、烧得越快。
网关这层,正在悄悄变成新基础设施
说回开头那个朋友。后来他们的做法不算复杂:把每一类业务请求在网关层打分,简单分类、抽取、固定格式走轻量模型,核心推理和复杂Agent步骤才走旗舰,整体调用成本砍掉了将近七成。这种事手动路由做不到,因为请求量太大、太杂,必须由网关自动判断。
8月7日,Azure把这件事进一步规范化——推出的AI网关预览版,控制平面直接围绕“模型、MCP服务器、工具”来组织,而不是围绕API路径。配置时间一分钟,遥测数据用OpenTelemetry协议导出到任意可观测平台。这个信号比一款具体产品更重要:当第一梯队的云厂商把“模型管理”从API后面摘出来、当成一等公民看待,说明调用层的基础设施已经成立。
国内这层基础设施也在分流。一类是从Token超市往基础设施化运营的方向走,比如长三角的Token运营中心、硅基流动。另一类则是更轻量的智能路由层,把多模型统一接入、智能调度、成本审计打包成一个小网关,给中小团队现成集成。
EasyAPI走的是后面这条路——和LiteLLM、Portkey这类海外产品类似,主打一个OpenAI兼容端点、一套密钥、一份整合账单,省掉企业直连十几家厂商的麻烦。它本身不是大模型,但决定了团队账单上的每一个数字。

模型层这一轮价格变动、技术变动、版本变动都在加速,单押一家API的窗口期肉眼可见在缩短。下一阶段竞争的胜负手,已经不在“我有没有最强的模型”了,而在“我怎么把这些模型用对地方”——而这件事,几乎一定要在网关层解决。

712

被折叠的 条评论
为什么被折叠?



