上周的时候帮一个朋友排查客服系统的 AI 使用情况,结果他们自己都吃了一惊。
后台账单显示,Claude Fable 5 承担了大约 60% 的请求量,但输出成本占到了总费用的 78%。真正需要旗舰模型处理的复杂问题,其实不到两成。
他们之前也尝试过简单分流:把常见问答交给便宜模型,复杂问题留给旗舰模型。但实际运行后,业务团队很快反馈“回答质量下降”,最后又默默切回了旗舰模型。
问题不在于有没有便宜模型,而在于人工判断哪类请求该用什么模型,这件事很难长期维持。
当请求规模上来以后,模型选择本身就需要被自动化,而这个入口,正在转移到网关层。
单一模型路线,正在遇到瓶颈
8 月 6 日,PPIO 上线 Fusion 融合模型功能。它的思路并不复杂:一次请求同时交给多个模型处理,再通过主模型进行融合和校验,最终输出答案。
在 DRACO 等深度研究基准测试中,多个开源模型组合后的表现超过了 Claude Fable 5,而整体成本只有后者的一小部分。
这个结果真正值得关注的地方,并不是“更便宜”,而是它说明了一件事:
单个模型很难在所有任务上保持优势。
代码、数学、长文本理解、多语言能力、知识覆盖,不同模型各有强项。过去企业习惯选择一个“最强模型”解决所有问题,但随着应用复杂度提升,这种方式开始暴露问题。
尤其是在 Agent 场景中。
Agent 不是一次性的问答,而是一连串步骤的执行。前面某一步判断错误,后续流程可能都会受到影响。而错误发生后,浪费的不只是一次回答的 Token,而是整个执行链路上的成本。
因此,越来越多企业开始关注“模型评测 + 智能路由”的组合方式。简单接入已经不是难点,如何让不同任务自动匹配合适模型,才是降低成本和提升稳定性的关键。
模型越来越便宜,为什么账单没有明显下降?
最近一段时间,模型价格持续下降。
DeepSeek 也曾调整 API 服务定价策略,而此前 V4-Flash 已经做到非常低的价格水平。表面来看,模型调用成本正在不断降低。
但企业实际支付的费用,并不只是 Token 单价。
更重要的是:你的请求到底流向了哪个模型。
如果大量普通任务仍然默认调用旗舰模型,即使模型价格下降,整体账单也不会明显变化。
行业数据也在反映这种趋势。随着模型数量增加,企业正在从“选择一个模型”转向“管理多个模型”。不同供应商之间的能力和价格差异越来越明显,如何分配请求,逐渐成为新的效率问题。
另外,一个经常被忽略的问题是输出 Token。
很多模型的输出成本明显高于输入,而 Agent 任务由于需要多轮推理、调用工具、生成长结果,Token 消耗往往远高于普通聊天场景。
所以真正影响成本的,不只是模型价格,而是整个调用链路的设计。
网关正在成为 AI 应用的新基础设施
回到前面的案例。
后来他们做的事情并不复杂:在网关层增加请求识别和模型调度。
简单问答、内容整理、固定格式生成等任务,交给轻量模型;复杂分析、关键业务流程,再调用旗舰模型。
调整之后,整体调用成本下降了接近七成。
这类优化很难依靠人工完成,因为企业每天面对的是大量、复杂且不断变化的请求。模型选择需要实时判断,而不是靠规则表长期维护。
8 月 7 日,Azure 发布 AI 网关预览版,也释放出了类似信号:未来企业管理的对象,不只是 API 接口,而是模型、MCP 服务、工具以及整个 AI 调用流程。
当云厂商开始把模型管理能力从 API 后台独立出来,作为基础设施的一部分管理,说明“调用层”正在成为 AI 技术栈中的重要环节。
国内市场也出现了类似趋势。
一类企业正在向模型资源整合和 Token 服务方向发展;另一类则聚焦更轻量的智能路由和统一管理。
比如 EasyAPI 这类产品,提供 OpenAI 兼容接口、统一密钥管理和账单整合,帮助团队减少对多个模型供应商的维护成本。
它本身不负责训练模型,但决定了企业如何使用这些模型,以及最终账单如何产生。
下一阶段,比拼的是模型使用效率
可能在未来一段时间,模型能力依旧会快速变化。
今天领先的模型,可能很快被新的版本替代。价格、性能、上下文能力也会持续调整。
因此,企业真正需要解决的问题,可能已经不是“有没有最强模型”
而是:面对越来越多的模型选择,如何让每一次请求都找到最合适的那个。
这也是为什么网关层正在变得越来越重要。
它不直接创造模型能力,却决定了这些能力如何被调用、如何组合,以及企业最终为 AI 支付多少成本。

281

被折叠的 条评论
为什么被折叠?



