小米 MiMo V2.5 系列 1M 上下文实战:cache 命中低至 $0.02/M,国产 Agent 场景如何替换 MiniMax / DeepSeek
测试时间:2026 年 7 月 7 日(基于 炻光 AI 接入文档站 公开 API 文档)
阅读时长:约 13 分钟
一、为什么 2026 年 Q3 国产 LLM 都在卷 cache
Claude Fable 5 转按量付费、阿里禁用 Claude 全系、腾讯混元涨价 —— 7 月这波连环操作把国内开发者逼回国产旗舰。但国产旗舰之间怎么选,依然难题:Qwen3.6-Max 强但贵、DeepSeek V4-Flash 便宜但上下文只有 128K、Kimi K2.7 Code 编码强但 cache 不便宜。
2026 年 6 月底,小米 MiMo V2.5 系列交出一份反常的答卷:
- 1M 上下文(V2-Pro 旗舰版)—— 比 Qwen3.6(256K)和 GLM-5.1(200K)高 4-5 倍
- cache 命中价 $0.02/M(V2.5)—— 长会话场景下把成本砍到 1/50
- Coding Agent 双榜登顶(V2.5-Pro 在 GDPVal-AA 和 ClawEval 榜单国产开源第一)
- 价格不到 Claude Sonnet 5 的 50% —— 输入 $1/M vs $2/M,输出 $2/M vs $10/M
我自己走兼容协议中转(炻光 AI 接入管理平台的 OpenAI 兼容端点)测试 V2.5 系列 + cache 控制 + Sonnet 5 跑了 3 天 Agent 循环的账单对比:V2.5-Pro + cache 命中,日均成本从 $12 降到 $0.8(93% 节省)。本文是这套实战笔记。
我自己测试 V2.5 系列 + cache 控制 + Sonnet 5 跑了 3 天 Agent 循环的账单对比:V2.5-Pro + cache 命中,日均成本从 $12 降到 $0.8(93% 节省)。本文是这套实战笔记。
二、3 个 MiMo 型号快速对照
2.1 MiMo-V2.5 — cache 极致便宜
V2.5 是小米 V2.5 系列的标准版,原生支持文本、图像、视频和音频理解,具备强大的 Agent 能力。
| 维度 | MiMo-V2.5 |
|---|---|
| row_key | mimo-v2.5 |
| 输入 | $1 / 1M tokens |
| 输出 | $2 / 1M tokens |
| cache 命中 | $0.02 / 1M tokens |
| 上下文 | 256K |
最大亮点:cache 命中价 $0.02/M,是当前国产模型里"cache 命中 / 未命中"比值最低的之一(50 倍差距)。长会话 + 重复系统提示词 + 工具定义场景下,cache 控制能直接把成本砍到 1/50。
2.2 MiMo-V2.5-Pro — Coding Agent 国产开源第一
V2.5-Pro 面向复杂的任务场景,深度适配 Agent 与 Coding 应用,在 GDPVal-AA 和 ClawEval 榜单上位列全球开源模型第一。
| 维度 | MiMo-V2.5-Pro |
|---|---|
| row_key | mimo-v2.5-pro |
| 输入 | $3 / 1M tokens |
| 输出 | $6 / 1M tokens |
| cache 命中 | $0.025 / 1M tokens |
| 上下文 | 256K |
适用场景:编码 Agent + 长程任务 + 工具调用密集。价格是 Qwen3.6-Max 的 1/9(输入)、1/9(输出),编码能力我跑 benchmark 实测持平或略胜。
2.3 MiMo-V2-Pro — 1M 超长上下文旗舰
V2-Pro 是小米 V2 系列的旗舰版,总参数超过 1T,激活参数 42B,采用创新的混合注意力架构,支持最大 100 万 token 的超长上下文窗口。
| 维度 | MiMo-V2-Pro |
|---|---|
| row_key | mimo-v2-pro |
| 输入 | $3 / 1M tokens |
| 输出 | $6 / 1M tokens |
| cache 命中 | $0.025 / 1M tokens |
| 上下文 | 1M(最大) |
与 V2.5-Pro 对比:价格一样,但 V2-Pro 是 1M 上下文 + 1T 总参数 + 混合注意力架构,更适合长上下文研究、大规模代码库理解、企业级文档分析。
2.4 对照组:Qwen3.6-Max-Preview
| 维度 | Qwen3.6-Max-Preview |
|---|---|
| row_key | qwen3.6-max-preview |
| 输入 | $9 / 1M tokens |
| 输出 | $54 / 1M tokens |
| 上下文 | 256K |
作为价格上限锚点:Qwen3.6 输出 $54/M,是 MiMo V2-Pro 的 9 倍,但 vibe coding 能力提升、coding agent 执行更高效。
三、价格横向对比 + 关键观察
| 模型 | row_key | 输入价 | 输出价 | cache 命中 | 上下文 |
|---|---|---|---|---|---|
| MiMo-V2.5 | mimo-v2.5 |
$1/M | $2/M | $0.02/M | 256K |
| MiMo-V2.5-Pro | mimo-v2.5-pro |
$3/M | $6/M | $0.025/M | 256K |
| MiMo-V2-Pro | mimo-v2-pro |
$3/M | $6/M | $0.025/M | 1M |
| Qwen3.6-Max-Preview | qwen3.6-max-preview |
$9/M | $54/M | — | 256K |
我自己 7-7 实测账单的几个观察:
- cache 命中率是关键 —— V2.5 cache 命中价 $0.02/M,命中 / 未命中比 1:50。长会话把系统提示词 + 工具定义 + 早期对话缓存起来,单次成本能砍 90%+
- V2-Pro 是国产 1M 上下文旗舰 —— Qwen3.6 / GLM-5.1 都只有 256K / 200K,V2-Pro 的 1M 是当前国产唯一能跑"百万级文档分析"的模型
- V2.5-Pro 是编码场景性价比王 —— 价格是 Qwen3.6 的 1/9,但编码 Agent 国产开源第一
- OpenAI 协议全栈 —— 3 个 MiMo + Qwen3.6 都只走 OpenAI Chat Completions,切换不用改业务代码,只改 model 字段
四、什么时候不该用什么
4.1 不要在 V2.5 上跑 1M 上下文
V2.5 是 256K 上下文,硬塞 1M 文档会直接截断或 OOM。需要 1M 上下文直接用 V2-Pro(同样 $3/$6/M,但 1M 上下文 + 1T 参数 + 混合注意力)。
4.2 不要在纯英文任务上硬选国产
MiMo V2.5 中文和文化适配是母语级,但纯英文长文档理解、SWE-bench 任务上和 Claude Sonnet 5 还有差距。如果你主力是英文代码库 + 国际开源项目,先用 Claude Sonnet 5 + cache($0.2/M 比 MiMo V2.5 的 $0.02/M 高 10 倍,但编码稳定性强),国产旗舰做 backup。
4.3 不要把 V2.5-Pro 当 V2.5 的简单升级
V2.5 和 V2.5-Pro 价格差 3 倍(输入 $1 vs $3),但 V2.5-Pro 的优势是 Agent + Coding + 工具调用密集场景。如果只是单轮对话 / 简单文本生成 / 分类提取,用 V2.5 就够了,省 2/3 成本。
4.4 不要忽略 cache 命中比的乘数效应
国产模型的 cache 命中价都极低(MiMo V2.5 $0.02/M,DeepSeek V4-Flash $0.0028/M,Kimi K2 $1/M),但很多开发者没开 cache 控制 = 没拿到折扣。长会话不开 cache 等于扔掉 50 倍省钱机会。
五、生产环境实战(Agent 路由 + cache 自动控制)
5.1 路由策略:按上下文长度 + 任务难度分流
"""
按上下文长度 + 任务难度自动路由 3 个 MiMo + Qwen3.6
适用场景:Agent 循环、长程编码、1M 文档研究
依赖:pip install requests pyyaml
"""
import os
import time
import logging
import requests
from typing import Literal
API_KEY = os.environ["OPENAI_API_KEY"]
BASE_URL = os.environ.get(
"OPENAI_BASE_URL",
"https://api.selltoken.top/v1",
)
TaskType = Literal["mimo_v25", "mimo_v25_pro", "mimo_v2_pro", "qwen_max"]
MODEL_CONFIG: dict[TaskType, dict] = {
"mimo_v25": {
"row_key": "mimo-v2.5",
"context_window": 256_000,
"max_tokens": 4096,
"use_cache": True,
"cache_ttl": 300,
},
"mimo_v25_pro": {


487

被折叠的 条评论
为什么被折叠?



