盘点系列第 2 篇 · API 成本核算
✅ 【数据说明】:本文为公开核算——单价来自各比价站对官方定价的核验(CloudZero 声称已对照 OpenAI/Anthropic/Google/DeepSeek 官方文档,截至 2026-08-20;国内厂人民币官价来自 GetModelKey,截至 2026-08),换算统一按 1 USD ≈ 7.1 CNY(发文日近似汇率,属假设)。三个场景的成本为「单价 × 用量」的透明算术,假设全部写明,你可以代入自己的数字重算。价格随时变动,下单前以官网为准。 本篇不涉及本机实测(API 计费无需实测,核算即验证)。
一句话结论
上一篇选完了模型,这篇算钱。我把 10 个主流 API 放进同一个客服 workload(输入 2000 / 输出 300 token,每月 10 万次)统一核算:最贵的 GPT-5.6 Sol 要 $1,900/月,最便宜的 DeepSeek V4 Flash 谷时段只要 $61/月——31 倍。但结论不是"都用最便宜的":真正的账单杀手是三个被忽视的结构性因素——输出单价是输入的 3-6 倍(冗长回复比长 prompt 贵得多)、多轮对话在为重复上下文全额买单、同一厂商内部价差高达 150 倍。把这三个变量管住,比换供应商省得多。
一、先看十个 API 的官价(2026-08,$/百万 token)
| 模型 | 厂商 | 输入/输出($/M) | 上下文 | 定位 |
|---|---|---|---|---|
| GPT-5.6 Sol | OpenAI | 5.00 / 30.00 | 1.05M | 旗舰推理 |
| Claude Opus 5 | Anthropic | 5.00 / 25.00 | 1M | 高端旗舰 |
| Claude Sonnet 5 | Anthropic | 2.00 / 10.00 | 1M | "$2 战区",入门价已转永久 |
| GPT-5.6 Terra | OpenAI | 2.00 / 12.00 | 1.05M | 均衡档 |
| Gemini 3.1 Pro | 2.00 / 12.00 | 1M | 均衡档 | |
| Gemini 3.6 Flash | 1.50 / 7.50 | 1M | 中档 | |
| Kimi K3 | Moonshot | ¥20 / ¥100(≈2.82 / 14.08) | — | 中国旗舰 |
| GLM-5.2 | 智谱 | ¥8 / ¥28(≈1.13 / 3.94) | — | 中国性价比 |
| DeepSeek V4 Pro | DeepSeek | ¥9 峰 / ¥27 峰(≈1.27 / 3.80) | 1M | 中国旗舰(谷时段再减半) |
| DeepSeek V4 Flash | DeepSeek | ¥3 峰 / ¥9 峰(≈0.42 / 1.27) | — | 地板价之王(谷时段≈$0.21/$0.63) |
参考天花板与地板:Claude Fable 5($10/$50)、GPT-5.5 Pro($30/$180)是天花板;OpenAI 的 Luna($0.20/$1.20)和 Together 托管的 Llama 4 Maverick($0.27/$0.85)是地板。注意:这四家比价站的口径和快照日期不同,同一模型会有 ±20% 出入——这也是为什么本文所有结论只依赖"量级和结构",不依赖小数点后两位。
单看单价表没感觉,对吧?下面把它们扔进同一个真实场景。
二、三个真实场景的月账单(同一件事,天壤之别)
核算公式(你可以代入自己的数字): 月成本 = 月输入量/1M × 输入单价 + 月输出量/1M × 输出单价
场景 A:智能客服(输入重、输出轻)
设定:每次输入 2,000 token(系统提示+历史),输出 300 token,每月 10 万次(月输入 200M、月输出 30M)。
| API | 月账单 | 相对最便宜 |
|---|---|---|
| GPT-5.6 Sol | $1,900 | 31× |
| Claude Opus 5 | $1,750 | 29× |
| Kimi K3 | $986 | 16× |
| GPT-5.6 Terra / Gemini 3.1 Pro | $760 | 12× |
| Claude Sonnet 5 | $700 | 11× |
| Gemini 3.6 Flash | $525 | 8.6× |
| DeepSeek V4 Pro(峰/谷) | $368 / $184 | 6× / 3× |
| GLM-5.2 | $344 | 5.6× |
| GPT-5.6 Luna | $76 | 1.2× |
| DeepSeek V4 Flash(谷) | $61 | 1× |
31 倍。而且注意两个细节:① 最贵的两个(Sol、Opus)输入单价相同($5),差距全在输出单价($30 vs $25)——输出才是分水岭;② DeepSeek 的峰谷差一倍,你的客服如果有明显的夜间低谷,错峰调度本身就是免费的优化。
场景 B:文档摘要 / RAG(输入极重)
设定:每次输入 8,000 token(长文档+检索片段),输出 500 token,每月 1 万次(月输入 80M、月输出 5M)。
| API | 月账单 |
|---|---|
| GPT-5.6 Sol | $550 |
| Claude Opus 5 | $525 |
| Claude Sonnet 5 | $210 |
| Gemini 3.6 Flash | $158 |
| DeepSeek V4 Pro(峰/谷) | $120 / $60 |
| GLM-5.2 | $110 |
| GPT-5.6 Luna | $22 |
| DeepSeek V4 Flash(谷) | $20 |
差距缩到 27 倍——输入占比越高,输出单价的权重越小,高端模型的"输出溢价"被摊薄。输入重、输出轻的场景,是便宜模型性价比最高的战场。
场景 C:代码生成(输出重)
设定:每次输入 3,000 token,输出 2,000 token,每月 5 千次(月输入 15M、月输出 10M)。
| API | 月账单 |
|---|---|
| GPT-5.6 Sol | $375 |
| Claude Opus 5 | $325 |
| Kimi K3 | $183 |
| Gemini 3.1 Pro / GPT-5.6 Terra | $150 |
| Claude Sonnet 5 | $130 |
| Gemini 3.6 Flash | $98 |
| DeepSeek V4 Pro(峰) | $57 |
| GLM-5.2 | $56 |
| GPT-5.6 Luna | $15 |
| DeepSeek V4 Flash(谷) | $9.5 |
差距拉到 39 倍,且结构变了:Opus 5($325)开始明显反超 Sol($375)的对手盘——输出越重,输出单价($25 vs $30)的权重越大。选代码模型别只看 benchmark,先看你的输出/输入比。
三、三个被忽视的账单杀手(比换供应商更值钱)
杀手 1:输出单价是输入的 3-6 倍,你的账单是被"话痨"撑大的。 Anthropic 输出≈输入 5 倍、OpenAI ≈6 倍。同一个 2,000 token 的任务,"读 2000 吐 300"(摘要)和"读 300 吐 2000"(代码生成)成本结构完全不同。推理模式(thinking)是隐藏放大器:内部思维链也按输出计费,动辄翻几倍——开之前先算这笔账。
杀手 2:多轮对话在为重复上下文全额买单。 一笔透明算术:20 轮对话、每轮新增 500 token,你累计发送的输入是 500×(1+2+…+20) = 105,000 token——其中 95,000 是重复发送的历史。不开缓存,这 95,000 全按原价计费;开了前缀缓存(行业普遍约为标准价 10%,DeepSeek 缓存命中 ¥0.05-0.15/M,约为未命中价的 3%),等效成本降到约 19,500 token——省 81%。多轮会话产品不开缓存,等于每月白烧八成输入账单。
杀手 3:同一厂商内部价差 150 倍,"选模型"比"选厂商"重要一个数量级。 OpenAI 家族从 Luna($0.20)到 GPT-5.5 Pro($30)差 150 倍;Anthropic 从 Haiku($1)到 Fable($10)差 10 倍。比价站的原话值得贴在工位上:"模型选择是任何 AI 预算里最大的单一决策"。而 $2 档是 2026 年的"战争区"——Sonnet 5、Terra、Gemini 3.1 Pro 全挤在这里,Anthropic 甚至把 Sonnet 5 的入门价转成了永久价(原定 9 月涨价已取消)。你的大部分生产负载,就住在这个档位。
四、省钱行动清单(按见效快慢排序)
- 今天就能做:翻你家 API 后台的"模型使用分布",把非核心流量(日志摘要、分类、路由判断)从旗舰模型降到 $0.2-1 档——通常这一步就能砍 30-50% 账单,质量损失可测可控。
- 本周做:给多轮会话开前缀缓存(各家参数不同,但原理一致);给异步批量任务走 batch 通道(行业普遍 5 折)。
- 上线前做:用本文公式代入你的真实 token 用量,做一个三档方案(旗舰/均衡/地板)的月成本表,写进技术方案——"会涨多少钱"应该出现在架构评审里,而不是月底账单里。
- 持续做:盯峰谷价(DeepSeek 谷时段半价)和各家价格变动(8 月 Anthropic 刚把入门价转永久)——这个市场的价格月月都在动。
下篇预告
模型选了、账单算了,下一篇回到"人"的部分:《十个最值得做的 AI 副业方向:用平台需求数据打分,别信"月入十万"》——需求量、竞争度、客单价三维打分,每个方向附上手路径和真实价格带。
附:本文全部数据来源
- CloudZero《LLM API pricing comparison in 2026》(对照官方文档核验,截至 2026-08-20:单价表、输出/输入倍率、厂商内部价差、缓存与批量折扣、Sonnet 5 定价事件)
- GetModelKey《AI API Token Price Comparison 2026》(国内厂 CNY 官价与 DeepSeek 峰谷/缓存价,2026-08)
- AI Cost Check(2026-08-06 快照:Mistral/Llama 托管价、Gemini Flash 档)
- APIpulse《AI API Pricing August 2026》(市场结构、"中档即新高端"判断)
- 三场景与多轮缓存算术:本文公开核算,假设已在文中写明,可代入自有用量复算
盘点系列《最 X 的前十名 X——数据说话版》持续更新。每个「最」字后面都挂着可验证依据:能本机实跑的本机跑,不能跑的公开核算,再不行逐条标注权威来源。

951

被折叠的 条评论
为什么被折叠?



