上个月,一家 SaaS 客户的技术负责人来找我,开口就甩了一张账单截图:“我们去年 12 月上线 AI 助手,立项时的成本测算是一个月 8000 块。这是 8 月的账单,18 万。财务现在天天追着我要解释。”
我让他把账单拆给我看。供应商后台的报表只有一行总数——这本身就是第一个问题:你连钱花在哪都不知道。
花了两周,我们把他的调用链理了一遍,账单按 模型 × 调用方 × 场景 拆开之后,三个数字让他沉默了:客服场景的输入 Token 是输出的 14 倍(历史对话没截断,第 20 轮重发前 19 轮);38% 的调用是一次"JSON 解析失败后重新生成"(没人给失败重试记账);还有 5 个"离线摘要"任务,因为配置写错走了实时旗舰接口(同样的活,单价差 50%)。
AI 项目的财务事故,大多不是"效果不行",而是"成本失控"——而失控的根源,是成本从头到尾没被当成一个工程指标管过。
今天把这套完整的成本管理框架拆开:先拆账单、再拆 3 个陷阱、然后讲单位经济学、最后给降本杠杆和预算告警机制。每一步都能直接抄。
一、先拆账单:钱到底花在哪
拿到月度账单,第一件事不是砍,是拆。拆的维度就三个:模型 × 调用方 × 场景。
前提是网关层记账:每一次模型调用,记录 model / api_key / scenario_tag / input_tokens / output_tokens,聚合出一张这样的表:
场景 模型 输入Token 输出Token 成本(元) 占比
客服-FAQ qwen-turbo 42,000,000 3,100,000 680 38%
客服-工单 qwen-max 8,500,000 2,900,000 1,020 57%
摘要-离线 qwen-turbo 96,000,000 1,200,000 95 5%
这张表会自己说话:
- 客服-FAQ 的输入是输出的 13 倍——正常问答场景输入输出比在 2-4 倍,13 倍大概率是历史对话全量重发;
- 客服-工单用旗舰模型占了 57% 成本——要回答的问题是"每条工单都配旗舰模型吗";
- 摘要-离线 9600 万输入 Token 只花了 95 块——如果这批任务走的是批量接口而不是实时接口,成本还能再砍一半。
没有这张表,一切优化都是猜。 而大多数团队没有这张表的原因,是记账埋点没在架构里——网


412

被折叠的 条评论
为什么被折叠?



