凌晨两点的时候,手机响了一下。是Claude的账单邮件。一个AI客服项目,原本用GPT-5.6 Luna跑得好好的,客户临时要求“升级成最强的”,切到Claude Fable 5。结果一个Demo周,账单从预期的300美元飙到2100美元。客户嫌贵,项目黄了,差价自己扛。
这不是个例。2026年,模型越来越多,价格越来越乱,开发者真正焦虑的已经不是“哪个模型最强”,而是“怎么在不同模型之间活下来”。
Token消耗爆炸,路由层被逼成独立赛道
8月27日,基元律动(TokenRhythm)宣布API平台公测,同时完成新一轮数千万美元融资。它给自己的定位是“中国版OpenRouter”——开发者用一个API Key就能调用多个厂商模型,不用分别注册、适配接口、对账。
已经有5.4万用户,单日Token调用量超过5000亿。
5000亿是什么概念?国家数据局的数据显示,中国日均Token调用量从2024年初的1000亿,涨到2025年底的100万亿,2026年6月已接近175万亿。TokenRhythm一家单日就切走了全国近0.3%的总量,多模型路由已经从“省事工具”变成真实流量入口。
海外的OpenRouter更夸张。每天处理超过10万亿Token,连接400多个模型,服务1000万开发者,8月20日被Stripe以超过80亿美元收购。5月份估值才13亿美元,三个月翻了6倍。不是资本泡沫,是模型碎片化让“路由”本身成了稀缺能力。
从“接模型”到“组织模型”,路由层在进化
如果只是“一个Key调所有模型”,API聚合层早就红海了。基元律动真正想讲的是另一个概念:Routing Harness。
它不只是帮你连模型,而是进入Agent执行任务的过程,根据任务类型、执行阶段、成本预算和实时状态,动态选择、切换、协作、聚合结果。
举个例子:一个Deep Research Agent要写行业报告,流程包括搜索、读网页、提取数字、写代码、计算、推理、核验、组织成文。最懒的办法是全程调用Claude或GPT,效果好但贵得离谱。更合理的做法是:网页摘要交给便宜的小模型,代码交给Qwen Coder,普通推理用DeepSeek,只有真正难的问题才调用旗舰模型,最后再用一个模型检查一致性。
基元律动公布的数据:在PinchBench上,保持近似任务精度,Query级动态路由的成本约为任务级路由的1/9;在DRACO复杂研究任务中,国产模型组成的多模型集成方案以约1/3的成本取得了高于Claude Fable 5的成绩。
智能不再只发生在模型内部,也发生在调用层。谁能更好地“组织模型”,谁就能用更少的钱办更多的事。
个人开发者怎么参与?
大厂的博弈普通人改变不了,但可以用工具把自己的代码和某一家模型解耦。
不管是基元律动、OpenRouter,还是更轻量的EasyAPI,本质上都是在业务系统和模型供应商之间加一层“缓冲带”。价值不只是比价和切换,更是在价格变动、模型下架、服务限流的时候,业务不会一夜崩盘。
DeepSeek 8月17日峰谷定价生效,高峰时段价格最高涨了12倍;OpenAI同月把GPT-5.6 Luna降价80%;Anthropic原本要涨价又临时冻结。这种环境下,“写死一个base_url”越来越像赌博。
如果暂时不需要Routing Harness那么重的架构,可以先从三件事开始:
第一,把模型调用收口到一个可配置层。 不要在业务代码里到处散落API地址和Key,用统一的配置模块管理所有调用,切换只改配置不碰代码。
第二,记录每次调用的成本和延迟。 没有数据就没有优化空间。先把账单和调用量对清楚,才知道哪些任务在烧钱。
第三,给关键路径设置fallback。 主模型挂了或涨价了,能自动切到备选,业务不中断。
这三件事做完,就算下个月最常用的模型突然涨价三倍,也有换的余地。
EasyAPI做的就是这三件事:一个Key接入所有主流模型,统一配置层管理调用,记录调用数据,支持主备自动切换。不用改业务代码,不用重新适配接口,改个配置就行。
模型战争的上半场是拼参数、拼benchmark。下半场开始了,比的是谁能把一堆各有所长的模型组织起来,用更低的成本完成更复杂的任务。路由层,正在成为新的主战场。

200

被折叠的 条评论
为什么被折叠?



