"把新出的 Qwen 也接进来,跑个评测看看能不能替掉一部分 Claude。"——这话我隔三差五就能在技术群里看到一次。模型发得越来越密,团队里总有人问"要不要切",然后就得有人站出来拉一组 benchmark、再压上一批真实业务流量,最后憋出一份"我们到底该用哪个"的结论。这活儿又累又费钱,更要命的是,做完没几天就过期了——因为下一款模型又上线了。
所以当 OpenRouter 在 8 月 11 日把它的 Auto Router 改成"跟着市场走"之后,我第一反应不是兴奋,是松了口气:总算有人愿意替大家把这件脏活干了。
路由器的信号源,从评测换成了钱包
新版 Auto Router 的思路其实很朴素:你不需要再自己选模型了。每个请求进来,先用一个轻量分类器把它归到约 30 种任务类型里——代码调试、多步 agent 规划、知识问答、数学、客服、研报报告……然后去查过去 7 天里,平台上所有开发者在"这一类任务"上真实花掉的 token 份额,谁的花费占比高,就把请求路由到谁。最后再套一层成本档位,从 low 一路到 max,决定你愿意为"够用"多花多少钱。
信号源变了,结果也立竿见影。默认档位下,MMLU Pro 这条知识任务的成本从 393.34 美元一路压到 140.93 美元,准确率只掉了 1.4 个点;而拉满档位时,新版在五个基准上全部反超旧路由,SWE-Atlas 编程这条线更是从 2.4% 直接干到 60.7%。
说白了,选型这道题,从"你自己跑评测"变成了"看市场用钱包投出来的票"。好处是省心,而且跟得上趟——一旦某个新模型有真实用户涌进去,路由器几天之内就跟着改道,完全不用你手动改配置。
这个时间点,不是巧合
这种"随大流"能成立,背后是两件事撞到了一起。
一边是钱在往里砸。8 月 10 日有消息说 Stripe 正在以约 100 亿美元收购 OpenRouter,紧接着 Snowflake、Cloudflare、Vercel、Baseten 都开始密集接触路由类初创公司,英国一个五人的小团队 Requesty,两周内被 25 家公司找上门谈投资收购。用他们创始人的话说,"优化竞赛已经到了疯狂的程度"。
另一边是迁移快得人工根本追不上。18 个月前,中国模型在 OpenRouter 上的 token 份额只有 4.5%,现在高峰周已经突破 46%。DeepSeek 一家就占了 17.6%,一周 5.13 万亿 token,比 Anthropic 的 Claude 全部模型加起来还多。这种速度下,靠人一个个跑评测去追新模型,早就来不及了——只能让市场数据自己滚起来。
随大流很好,但别把方向盘也交出去
不过,把选型完全交给"大家花钱在用谁",也有坑。
第一,热门不等于适合你。别人砸钱是因为他们的 prompt、他们的数据、他们的延迟预算,跟你的场景可能是两码事。第二,路由器在模型之间切来切去是有代价的——每次切换都可能重建输入缓存,白白多烧一笔钱,新版特意加了"粘性"逻辑,就是为了在会话中间别乱换模型。第三,也是最关键的一点:关键链路最好还是留一手,用自己的真实数据测过再上线。
这也是为什么国内像 EasyAPI 这类智能路由层,正在做一件类似但有分寸的事——一个 key 接多个模型,按任务类型动态调度,把"选型"和"省钱"自动化,但把最终判断权还给开发者。选型可以交给市场,兜底的判断得自己攥着。路由层从"可选项"变成"控成本的标配"这件事,现在看已经没什么悬念了;真正要较劲的,是谁能在"随大流"和"自己心里有数"之间,找到那个刚刚好的位置。

5738

被折叠的 条评论
为什么被折叠?



