三个便宜模型凑在一起,比十倍价格的旗舰还聪明

上周帮朋友审合同,他拿Claude跑了一遍,找出三个风险条款,花了大概两块钱。

我顺手把同一份合同丢给DeepSeek。它找出两个,其中一个和Claude重合,另一个是Claude没发现的。

当时就想,要是能让两个模型同时审,取并集,是不是更稳?

没想到已经有人在做了。8月6日,PPIO在智能模型网关里上线了一个叫Fusion的融合模型。用户发一个请求,网关在后台同时分发给多个模型并行回答,再通过交叉验证和思考编排,由主模型融合出最终答案。

结果有点意思。在DRACO深度研究基准测试里,PPIO用Kimi K3、GLM-5.2、MiniMax M3做参考,DeepSeek V4 Flash做融合主模型,拿到57.34分,超过Claude Fable 5的55.14分,总成本只有后者的十分之一。

所有模型都在偏科

2026年的大模型市场,大家基本都认了一件事:没有全能选手。

代码生成、长文档理解、数学推理、多语言翻译,没有一个模型在所有维度上同时领先。你用A写代码最强,用B做数学最准,用C处理长文档最好。选模型这件事,本质上是在做取舍。

比偏科更麻烦的是幻觉。同一个问题,不同模型可能给出不同答案,你不知道该信谁。单模型调用时这个问题几乎无解——模型自己不知道自己错了。但多模型并行加交叉验证,刚好能治这个病:三个模型同时回答,两个说A一个说B,大概率采信A,再让主模型校验一轮。这比靠单个模型“自我反思”靠谱多了。

参与融合的三个模型——Kimi K3、GLM-5.2、MiniMax M3——单独拿出来都不是各自赛道最强的。性能提升完全来自编排层,而不是基座模型的参数规模。智能增量可以发生在调用层,不一定要等下一个万亿参数模型发布。

网关从“转发”变成了“会诊”

常见的API网关做的是转发:请求进来,选一条线路发出去,网关本身不改变答案质量。PPIO Fusion在转发之外加了一层编排,让多个模型的产出在返回前经过比对和融合,网关本身成了智能增量的来源。

技术上几个细节值得提一下:多个模型同时执行,等待时间取决于最慢的那个,不会随模型数量线性增长。某个模型调用失败,网关跳过它继续融合,多路径结构反而比单模型调用更抗抖动。在Agent多轮交互里,同一回合已获得的参考结果会被复用,避免重复消耗Token,实际成本增幅远低于“调用了多个模型”这个直觉判断。

这个思路不是PPIO独有。微软7月底发布的Project Perception,用自研模型承担90%的漏洞扫描负载,最难的那10%才丢给GPT-5.4。NVIDIA的Agent Toolkit通过路由把复杂编排交给旗舰模型、研究任务交给小模型,官方称查询成本降了50%以上。vLLM团队发布的Semantic Router更直接,把路由层定义为“能力构建层”而非简单代理层,内置了包括Fusion在内的五种编排模式。

从“选一个”到“编排一队”

行业正在从“哪个模型最好”转向“跑哪个模型组合”。当不同模型的价差拉到上百倍——DeepSeek V4-Flash每百万Token输入0.14美元,Claude Fable 5是10美元——用几个便宜模型融合出一个更好答案的成本,可能还不到一个旗舰模型的零头。

对开发者来说,这比等下一个旗舰模型发布更值得关注。你不一定要追参数更大的模型,用现有模型做好编排,可能就够了。

这也刚刚好是EasyAPI这类服务在做的事——把多模型切换、路由策略、成本优化打包成开箱即用的工具,你不用自己搭这套系统,接上就能用。毕竟,与其等一个全能模型出现,不如先把手里几个好用的模型用明白。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值