必须确认使用agent api的/run端点而非/chat/completions,启用mimo v2flash缓存(x-cache-mode: v2flash)、固定tools schema、截断对话历史至最近两轮、显式设置enable_search: false,并可选启用openclaw共享缓存池。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想把MiniMax Agent API集成进客服系统或自动化报告工具,但发现Token账单一个月涨到三千多元,必须立刻控制成本。
确认是否真在用Agent API而非基础Chat API
很多开发者误以为调用的是Agent能力,实际请求发到了chat/completions端点——这会按完整上下文计费,且无法启用Agent专属缓存。打开你最近一次API调用的原始请求体,检查url是否为https://api.minimaxi.com/v1/agents/<strong>run</strong>(注意结尾是run而非chat/completions)。如果不是,所有后续优化都无效。
Agent API的run端点强制要求传入tools数组和tool_choice字段,缺失任一字段将自动降级为普通Chat调用并全额计费。
启用MiMo V2Flash缓存(必须做)
方法一:在请求头中添加缓存开关
在HTTP请求头中加入X-Cache-Mode: v2flash。这一步必须在首次调用前完成,否则缓存指纹无法注册。
方法二:确保输入结构完全一致
缓存命中依赖字节级一致——system prompt、user message、tools schema、temperature=0、top_p=1这五项必须逐字相同。哪怕tools里一个字段名多一个下划线,或temperature写成0.0,都会导致X-Cache-Status: MISS。建议用Python的json.dumps(obj, sort_keys=True)生成标准化JSON字符串后再发送。
【tools schema必须固定不变】一旦上线,禁止修改tools定义中的name、description、parameters结构。变更schema会导致全部历史缓存失效。
截断对话历史并显式指定cache_key
第一步:计算当前对话的语义哈希值
对system prompt + 最近两轮user/assistant消息拼接后取SHA256,作为cache_key字段值。不要用时间戳或随机数。
多链钱包与交易工具,为 AI 代理提供 27 项功能:钱包管理(创建、查余额、导出密钥),灵活额度代币兑换(100美元、50%、最大),跨链桥,DEX 市场数据(热门、成交量、涨跌榜),分层市值的代币发行,费用管理。支持 Solana 与 EVM 链。适用于代理需要操作钱包、执行交易、调研或发行代币的场景。
第二步:在请求体中注入cache_key
在JSON请求体顶层添加"cache_key": "a1b2c3d4..."字段。该字段不参与模型推理,仅用于缓存索引。
第三步:主动丢弃冗余历史
Agent API默认保留全部历史,但超过3轮后复用率急剧下降。在构造messages数组时,只保留最近1个system + 最近2个user/assistant交替对,其余全部剔除。实测可使单次调用token消耗降低42%。
对接OpenClaw缓存池(高阶降本)
登录MiniMax控制台→Billing→OpenClaw Settings→Enable Shared Cache Pool。开启后,同一企业下所有应用共享缓存指纹库,跨服务重复请求自动命中。
在请求头中添加X-OpenClaw-Pool: shared。此参数仅对企业认证账户生效,个人开发者账号无法使用。
注意:启用OpenClaw缓存池后,X-Cache-Mode: v2flash仍需保留,二者叠加使用效果最佳。
关闭enable_search开关(关键省钱动作)
MiniMax Agent API默认开启enable_search: true,该功能会额外调用内部检索服务并按1000 tokens/次单独计费。若你的Agent不依赖外部知识库,必须显式设为false。
在请求体中找到tools数组,将每个tool对象内的"enable_search": false字段补全。漏掉任意一个tool的设置,整个请求仍会触发搜索扣费。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










