上周帮朋友审合同,他拿Claude跑了一遍,找出三个风险条款,花了大概两块钱。
我顺手把同一份合同丢给DeepSeek。它找出两个,其中一个和Claude重合,另一个是Claude没发现的。
当时就想,要是能让两个模型同时审,取并集,是不是更稳?
没想到已经有人在做了。8月6日,PPIO在智能模型网关里上线了一个叫Fusion的融合模型。用户发一个请求,网关在后台同时分发给多个模型并行回答,再通过交叉验证和思考编排,由主模型融合出最终答案。
结果有点意思。在DRACO深度研究基准测试里,PPIO用Kimi K3、GLM-5.2、MiniMax M3做参考,DeepSeek V4 Flash做融合主模型,拿到57.34分,超过Claude Fable 5的55.14分,总成本只有后者的十分之一。
所有模型都在偏科
2026年的大模型市场,大家基本都认了一件事:没有全能选手。
代码生成、长文档理解、数学推理、多语言翻译,没有一个模型在所有维度上同时领先。你用A写代码最强,用B做数学最准,用C处理长文档最好。选模型这件事,本质上是在做取舍。
比偏科更麻烦的是幻觉。同一个问题,不同模型可能给出不同答案,你不知道该信谁。单模型调用时这个问题几乎无解——模型自己不知道自己错了。但多模型并行加交叉验证,刚好能治这个病:三个模型同时回答,两个说A一个说B,大概率采信A,再让主模型校验一轮。这比靠单个模型“自我反思”靠谱多了。
参与融合的三个模型——Kimi K3、GLM-5.2、MiniMax M3——单独拿出来都不是各自赛道最强的。性能提升完全来自编排层,而不是基座模型的参数规模。智能增量可以发生在调用层,不一定要等下一个万亿参数模型发布。
网关从“转发”变成了“会诊”
常见的API网关做的是转发:请求进来,选一条线路发出去,网关本身不改变答案质量。PPIO Fusion在转发之外加了一层编排,让多个模型的产出在返回前经过比对和融合,网关本身成了智能增量的来源。
技术上几个细节值得提一下:多个模型同时执行,等待时间取决于最慢的那个,不会随模型数量线性增长。某个模型调用失败,网关跳过它继续融合,多路径结构反而比单模型调用更抗抖动。在Agent多轮交互里,同一回合已获得的参考结果会被复用,避免重复消耗Token,实际成本增幅远低于“调用了多个模型”这个直觉判断。
这个思路不是PPIO独有。微软7月底发布的Project Perception,用自研模型承担90%的漏洞扫描负载,最难的那10%才丢给GPT-5.4。NVIDIA的Agent Toolkit通过路由把复杂编排交给旗舰模型、研究任务交给小模型,官方称查询成本降了50%以上。vLLM团队发布的Semantic Router更直接,把路由层定义为“能力构建层”而非简单代理层,内置了包括Fusion在内的五种编排模式。
从“选一个”到“编排一队”
行业正在从“哪个模型最好”转向“跑哪个模型组合”。当不同模型的价差拉到上百倍——DeepSeek V4-Flash每百万Token输入0.14美元,Claude Fable 5是10美元——用几个便宜模型融合出一个更好答案的成本,可能还不到一个旗舰模型的零头。
对开发者来说,这比等下一个旗舰模型发布更值得关注。你不一定要追参数更大的模型,用现有模型做好编排,可能就够了。
这也刚刚好是EasyAPI这类服务在做的事——把多模型切换、路由策略、成本优化打包成开箱即用的工具,你不用自己搭这套系统,接上就能用。毕竟,与其等一个全能模型出现,不如先把手里几个好用的模型用明白。

387

被折叠的 条评论
为什么被折叠?



