在 ai 模型价格竞争持续加剧的当下,小米旗下 mimo 大模型于5月27日发布官方公告,宣布对其 mimo-v2.5 系列 api 实施永久性降价,并同步重构计费机制,力求借助技术进步切实降低开发者调用门槛与使用成本。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一、API 费率显著下调,最大降幅达99%
本次价格调整已于北京时间 5月27日0:00 起在全球范围内正式上线。覆盖范围包括 MiMo-V2.5 与 MiMo-V2.5Pro 两大主力版本,且取消按上下文长度分级计价,整体定价逻辑更趋简洁、统一、透明。
| **模型版本** | **输入缓存命中单价** | **最高降幅** | **输出单价** | **最高降幅** |
| **MiMo-V2.5Pro** | 0.025元/百万 tokens | 99% | 6元/百万 tokens | 86% |
| **MiMo-V2.5** | 0.02元/百万 tokens | 98% | 2元/百万 tokens | 93% |
二、计费机制升级:扩容不提价
除直接降低单位 Token 报价外,小米同步对 Token Plan 计费体系完成全面迭代:
小米/米家智能家居设备控制。通过MCP Server工具控制家中设备,包括灯、空气净化器、电暖气、空调、风扇、扫地机器人、窗帘等。触发场景:用户提到智能家居控制指令,如"把灯关掉"、"开空调"、"净化器调到睡眠模式"、"客厅太暗了"、"家里空气不好"等。即使未明确提及"小米"或"米家",只要涉及家居设备控制即可触发。
- 额度倍增: 在维持原有订阅价格不变的基础上,用户可使用的 Token 总量提升至此前的 5–8倍;
- 计费可视化: 全新引入 Credits(积分) 统一计量单位,取代原有繁复的多维计费规则,帮助开发者更清晰掌握 Token 消耗节奏与实际支出。

三、底层支撑:技术驱动降本增效
小米方面指出,本次大规模让利的核心动力,源自其在大模型推理基础设施层面的关键突破:
- SWA 加速推理: 基于 SGLang HiCache 完整集成 SWA(滑动窗口注意力) 技术,实现 KV Cache 在 GPU 显存、CPU 内存与 SSD 间的三级数据迁移量压缩至原方案的 1/7;
- 缓存能力跃升: 可高效缓存的 Token 数量增长近 5倍,大幅拉升缓存命中率,有效摊薄单次推理的平均开销;
- 集群吞吐强化: 通过融合专家并行(MoE)架构与输入长度动态分桶策略,显著提升集群整体输入处理吞吐量,在保障响应质量与稳定性的同时,持续压低每 Token 的服务边际成本。
业内普遍认为,此举是小米对当前大模型商业化“内卷化”趋势的一次主动破局。随着接入成本进一步下探,MiMo 系列模型的综合性价比优势将加速释放,推动 AI 能力更快、更深地融入千行百业及广大开发者的日常研发流程中。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










