8 月 17 日起,DeepSeek V4 全系列启用峰谷分时计费,旗舰 V4-Pro 高峰时段输出价从 6 元涨到 27 元/百万 token(涨幅 350%);智谱、Kimi、MiniMax 等独立厂商年内也接连上调 API 价格。
- 但另一边,全球企业推理均价在 8 月跌到约 $1.16/百万 token(较 2023 年 -88%)。模型更贵、推理更便宜的背离,把「按任务 / 按时段 / 按成本选模型」从省钱技巧变成了财务刚需。
- 硬编码一家模型 = 把成本命运交出去。解法是用一层统一翻译层 + 成本感知路由:简单任务走低单价模型、重活在闲时跑、一家挂了自动切另一家。
- 文末给了一段可直接抄的路由示意代码(DeepSeek / 混元 / Qwen 三家 OpenAI 兼容)。
一、发生了什么:国产大模型集体涨价
2026 年 8 月,持续两年的「百模大战」低价竞赛正式收尾。最先动刀的是 DeepSeek:
- 8 月 17 日 0 点,DeepSeek V4 全系列新定价生效,引入峰谷分时计费;
- 8 月 23 日又优化规则:周六日全天按低谷价计,不再区分峰谷。
DeepSeek V4 峰谷价(单位:元 / 百万 token):
| 模型 | 时段 | 输入(缓存命中) | 输入(未命中) | 输出 |
| V4-Flash | 高峰 | 0.10 | 3.0 | 9.0 |
| V4-Flash | 闲时 | 0.05 | 1.5 | 4.5 |
| V4-Pro | 高峰 | 0.30 | 9.0 | 27.0 |
| V4-Pro | 闲时 | 0.15 | 4.5 | 13.5 |
> 高峰时段:北京时间 9:00–12:00、14:00–18:00;闲时为其余时间,价格统一是高峰的一半。
这不是一家在涨。据多家媒体与券商统计:
- 智谱:2026 年内已完成三轮 API 上调,一季度累计提价约 83%,但调用量反而增长 400%;
- Kimi(月之暗面):K3 输入 20 / 输出 100 元/百万 token,输出较前代涨近 4 倍;
- MiniMax:6 月发 M3 时 API 价格全面翻倍;
- 大厂算力侧:腾讯云、阿里云、百度智能云 3 月同步上调 AI 算力产品,涨幅 5%–34%。
摩根士丹利 8 月研报更直接:2026 年二季度国内大模型平均 API 输入价 4.9 元、输出价 21.9 元/百万 token,较 2025 年一季度(3.3 / 12.2 元)分别上涨 48% 和 80%。
为什么涨? 一句话:算力供需失衡。一季度国内 AI 算力需求同比 +417%,供给只 +128%;高端 GPU、HBM 供给紧张,加上智能体 / 代码生成让单次调用 token 消耗量指数级增长,早年补贴式低价已难以为继。行业从「以价换量」转向「价值定价」。
二、矛盾点:模型更贵,推理却更便宜
别被「涨价」吓住。把视角拉到全球:
- Jefferies / Silicon Data 数据,企业 LLM 推理均价在 8 月 6–8 日跌到 $1.16–1.18/百万 token,较 2023 年 3 月 -88%;
- 开源权重模型输入价已到 $0.04–0.30/百万 token;
- 但闭源前沿 agentic 模型输出价仍是 $25–50/百万 token。
结论很关键:价格正在剧烈分化——同一时刻,既有 0.3 元的开源小模型,也有 50 元的前沿大模型;同一家厂商,高峰 27 元、闲时 13.5 元。「永远无脑选最低单价模型」是错的,正确的姿势是「按任务价值选模型」。这恰好是路由层存在的理由。
三、硬编码一家模型的三个坑
很多团队早期图省事,直接把某个模型写死在业务代码里。涨价一来,三个问题同时暴露:
| 痛点 | 硬编码一家模型 | 用路由层 |
| 成本 | 高峰全量走贵模型,账单随峰值线性放大 | 简单任务走低单价,重活错峰跑 |
| 韧性 | 厂商 outage / 限流 = 业务中断 | 自动故障转移,换一家继续跑 |
| 灵活性 | 换模型要改代码、重测、重新接 SDK | 改一行配置即切换,业务无感 |
尤其当你开始跑 Agent(一个任务往往几十上百次模型调用 + 工具调用),token 消耗是指数级的,硬编码的代价会被放大几十倍。
四、解法:成本感知路由(三个思路)
思路 1:按任务路由(降本主力)
经验值:把约 80% 的简单请求(抽取、翻译、分类、润色)路由到 $0.30/百万 token 档的小模型,仅 20% 复杂任务(深度推理、长程编码)走前沿模型,整体成本可降 60%–70%,且常规任务质量几乎不损。
思路 2:按峰谷 / 时段路由(错峰省钱)
DeepSeek 的峰谷机制本身就是信号:把可延迟的重活(批量摘要、离线训练数据生成、夜间报表)排到闲时跑,单价直接减半。不是所有请求都要「立刻、用最贵的模型」。
思路 3:统一翻译层 + 故障转移 + 成本会计
把「选模型」从业务代码里抽出来,放到一层统一翻译层:
- 对外暴露单一 OpenAI 兼容入口,业务代码只认一套 SDK;
- 背后接多家厂商,靠配置决定路由策略(任务 / 时段 / 成本);
- 一家挂了自动切备选,业务不中断;
- 按团队 / 应用做 token 成本分摊(showback / chargeback),让花钱看得见。
这一层本质上就是「模型聚合与分发网关」——它不生产模型,只负责把对的请求,在对的时间,送给对的模型,并按对的价钱记账。
五、实战示意:一个路由配置
下面是一段可直接抄的骨架(三家国产模型均 OpenAI 兼容,endpoint 为各官方地址;key 换成你自己的):
from openai import OpenAI
import datetime
# 三家国产模型,均 OpenAI 兼容;把 api_key 换成自己的
PROVIDERS = {
"deepseek": {"base_url": "https://api.deepseek.com",
"api_key": "sk-自己的Key"},
"hunyuan": {"base_url": "https://api.hunyuan.cloud.tencent.com/v1",
"api_key": "sk-自己的Key"},
"qwen": {"base_url": "https://dashscope.aliyuncs.com/compatible-mode/v1",
"api_key": "sk-自己的Key"},
}
def is_peak():
"""北京时间高峰时段 9:00-12:00 / 14:00-18:00;周末按低谷"""
tz = datetime.timezone(datetime.timedelta(hours=8))
now = datetime.datetime.now(tz)
if now.weekday() >= 5: # 周六日
return False
h = now.hour
return (9 <= h < 12) or (14 <= h < 18)
def pick_model(task_complexity: str) -> str:
"""简单任务走低成本模型;复杂任务高峰避开最贵的,闲时再用"""
if task_complexity == "simple":
return "qwen" # 抽取/翻译/分类优先低成本
return "deepseek" if not is_peak() else "hunyuan"
def chat(provider: str, model: str, prompt: str):
client = OpenAI(base_url=PROVIDERS[provider]["base_url"],
api_key=PROVIDERS[provider]["api_key"])
try:
return client.chat.completions.create(
model=model, messages=[{"role": "user", "content": prompt}])
except Exception:
# 故障转移:自动切到备选厂商
fallback = "hunyuan" if provider != "hunyuan" else "qwen"
return chat(fallback, model, prompt)
# 用法:一行切换模型,不把模型写死在业务代码里
resp = chat(pick_model("simple"), "qwen-plus", "把这段话翻译成英文")
要点:业务代码只调用 chat(),选哪家、什么时段、挂了切谁,全在路由层决定。模型名、endpoint、峰谷策略都是配置,调价时改配置即可,不用动业务。
注:示例模型名(如
qwen-plus)仅为示意;endpoint 以官网文档为准。
六、小结:把选型权握在自己手里
涨价不是坏事,它逼着行业从「调了多少次模型」转向「业务有没有被解决」。对开发者来说,唯一确定的应对是:别把模型写死。
- 简单任务 → 低成本模型;
- 重活 → 错峰 + 能打的模型;
- 生产环境 → 至少两家兜底,自动故障转移;
- 成本 → 按团队 / 应用分摊,看得见才控得住。
当你把「选模型」抽象成一层统一翻译层(模型聚合与分发网关),涨价、峰谷、厂商 outage 都不再是你的事故,而是路由表里一条可以调的规则。这正是 2026 年把 AI 跑进生产的工程基本功。
免责声明:文中价格、峰谷时段均引用自 2026 年 8 月公开报道与各厂商官方公告,可能随时调整,正式接入请以各官网实时定价为准。本文为技术经验分享,不构成任何商业建议。

354

被折叠的 条评论
为什么被折叠?



