Agent连续工作25小时后,API省钱的关键

周五下班前,你把一个重构需求丢给Codex,顺手打开了那个叫“持久模式”的开关。屏幕显示:智能体会持续工作,直到你手动让它休眠。你心想,周末让它自己跑,周一验收成果。

周一早上代码确实改完了,但打开账单页面时手有点抖——这个周末烧掉的Token,够用以前一个季度。

这不是虚构的场景。8月28日外媒披露,OpenAI正在为Codex测试持久模式,测试环境里最长连续运行25小时。换句话说,AI代理已经从“你问一句、它答一句”,进化到“你给目标、它通宵干”。问题随之而来:当Agent替你连续工作25小时,你还在用“每百万Token多少钱”这套旧尺子,根本量不准成本。

Agent正在成为Token最大的消费者

过去默认Token主要是人打出来的。聊天、写文章、查资料,人问一句,模型答一句,消耗有限。但这个假设正在失效。

a16z在8月21日引用OpenRouter的数据:Agent消耗的Token已经接近人类的5倍,自2026年2月以来增长了约14倍。在OpenRouter这个窗口里,Agent单周能烧掉7.3万亿Token,而人类只有1.4万亿。更值得关注的是,其中85%以上来自缓存提示词——说明Agent不是在一遍遍问新问题,而是在反复读取同一段上下文,像人做项目一样持续推进。

OpenRouter CEO Alex Atallah前几周接受采访时打了个比方:当某个模型价格下降10倍,使用量可能暴涨30倍。人对AI的需求有生理上限,一天只有24小时;但软件没有。一个Agent可以在后台自己调用模型、调用工具、重试、纠错,把一次人类指令扩展成几十次模型调用。

所以当Stripe在8月20日宣布以超80亿美元收购OpenRouter时,市场反应不是“又一个API聚合站卖贵了”,而是“路由层这门生意,终于被正名了”。因为大家意识到,未来调用模型的主体不再是人,而是Agent。

价格波动+任务膨胀:账单越来越难算

Token单价下降是事实,但月底账单下降未必是事实。

DeepSeek在8月17日正式执行峰谷定价:V4-Pro高峰时段输出涨到27元/百万Token,缓存命中输入从0.025元涨到0.3元。紧接着8月23日又调整规则,周六周日全天按低谷价计费。同一个任务,周五下午跑和周六凌晨跑,价格可能差几倍。

同一周OpenAI还在扩大GPT-5.6 Luna对免费用户不限量文字聊天的覆盖。一边免费放量,一边高峰涨价,两边看似矛盾,其实指向同一个趋势:大模型API正在从“一口价商品”变成“分时计价服务”。

对开发者来说,成本预测变难了。以前只需要算“这个月大概调用多少百万Token”;现在得算“哪些任务可以放到低谷时段跑”“哪些请求能命中缓存”“哪些任务必须用旗舰模型”。当Agent把单次人类指令扩展成上百次调用,价格的微小差异会被放大成账单上的显著差距。

省钱的新逻辑:不是少调用,是会调度

Coinbase今年年初公开过一个内部实践:他们没有限制工程师使用AI,反而把默认模型切换成更便宜的国产开源模型GLM 5.2和Kimi 2.7,只在复杂规划和推理任务上保留前沿模型。同时做了一件更重要的事:把缓存命中率从5%提到60%。结果是Token使用量持续增长,但AI总支出几乎砍了一半。

核心思路不是“少调用”,而是“把调用分给对的模型”。格式整理、代码摘要、简单分类交给轻量模型;架构设计、异常排查、关键决策才交给旗舰模型。中间再加一层缓存,避免重复读取同一段系统提示和工具定义。

对个人开发者和小团队来说,自己从头搭一套路由层并不现实。像EasyAPI类聚合平台,就是把多模型切换、低谷时段调度、失败自动降级这些事情打包成一层网关。你不需要为每个模型单独维护Key和SDK,也能在后台看到哪个任务、哪个时段、哪个模型花了多少钱。省下来的时间,比省下来的钱更值钱。

工具只是工具。真正省钱的底层能力,是对任务做分层:判断哪些调用值得用最好的模型,哪些调用用够用的模型就行。Agent时代,API成本管理的本质不是砍价,而是让合适的模型在合适的时间干合适的活

当你的Agent真的能连干25小时,你最该担心的已经不是“它能不能做完”,而是“它有没有在不该烧钱的地方烧钱”。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值