AI 账单为什么是预估的 30 倍:LLM 成本的 3 个陷阱和一套管理框架

上个月,一家 SaaS 客户的技术负责人来找我,开口就甩了一张账单截图:“我们去年 12 月上线 AI 助手,立项时的成本测算是一个月 8000 块。这是 8 月的账单,18 万。财务现在天天追着我要解释。”

我让他把账单拆给我看。供应商后台的报表只有一行总数——这本身就是第一个问题:你连钱花在哪都不知道。

花了两周,我们把他的调用链理了一遍,账单按 模型 × 调用方 × 场景 拆开之后,三个数字让他沉默了:客服场景的输入 Token 是输出的 14 倍(历史对话没截断,第 20 轮重发前 19 轮);38% 的调用是一次"JSON 解析失败后重新生成"(没人给失败重试记账);还有 5 个"离线摘要"任务,因为配置写错走了实时旗舰接口(同样的活,单价差 50%)。

AI 项目的财务事故,大多不是"效果不行",而是"成本失控"——而失控的根源,是成本从头到尾没被当成一个工程指标管过。

今天把这套完整的成本管理框架拆开:先拆账单、再拆 3 个陷阱、然后讲单位经济学、最后给降本杠杆和预算告警机制。每一步都能直接抄。


一、先拆账单:钱到底花在哪

拿到月度账单,第一件事不是砍,是拆。拆的维度就三个:模型 × 调用方 × 场景

前提是网关层记账:每一次模型调用,记录 model / api_key / scenario_tag / input_tokens / output_tokens,聚合出一张这样的表:

场景          模型            输入Token    输出Token    成本(元)  占比
客服-FAQ      qwen-turbo      42,000,000   3,100,000     680     38%
客服-工单     qwen-max         8,500,000   2,900,000   1,020     57%
摘要-离线     qwen-turbo      96,000,000   1,200,000      95      5%

这张表会自己说话:

  • 客服-FAQ 的输入是输出的 13 倍——正常问答场景输入输出比在 2-4 倍,13 倍大概率是历史对话全量重发;
  • 客服-工单用旗舰模型占了 57% 成本——要回答的问题是"每条工单都配旗舰模型吗";
  • 摘要-离线 9600 万输入 Token 只花了 95 块——如果这批任务走的是批量接口而不是实时接口,成本还能再砍一半。

没有这张表,一切优化都是猜。 而大多数团队没有这张表的原因,是记账埋点没在架构里——网

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值