控制 codex 接入 deepseek 的 token 消耗需四步:一设 max_tokens(如 512)并重启;二关闭工具调用;三切换至 deepseek-v4-flash 模型;四在 cc-switch 路由中启用响应截断(2000 字符)。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

控制 Codex 接入 DeepSeek 后的 token 消耗,核心在于限制单次请求长度、关闭冗余功能、选择合适模型,并在 cc-switch 层级做硬性截断。不设限时,Codex 默认可能生成超长响应或反复调用工具,导致 token 瞬间飙升。
设置单次最大输出 token 数
打开 cc-switch → 切换到「Codex」标签页 → 找到已添加的 DeepSeek 供应商 → 点击右侧「编辑」图标 → 在「高级参数」区域展开 → 找到 【max_tokens】 输入框 → 填入 512(日常编码够用)或 256(严格控耗)。
这一步必须填,否则 DeepSeek V4 默认不限长,遇到复杂任务可能一口气输出 2000+ token。
填完保存,重启 cc-switch 和 Codex。不重启,参数不会生效。
禁用自动工具调用(tools)
Codex 在启用 tools 模式时,会反复调用代码解释器、文件读取、终端执行等插件,每次调用都产生独立请求和 token 开销。
进入 cc-switch → Codex 标签页 → 编辑 DeepSeek 供应商 → 将「启用工具调用」开关关闭 → 保存。
【关闭后,/run、/read、/shell 等命令将不可用,但纯对话和代码生成不受影响】
如果你只用 Codex 写函数、补全逻辑、解释报错,完全不需要 tools。开着它,一次 /run 就可能吃掉 800 token。
切换到 deepseek-v4-flash 模型
cc-switch 添加 DeepSeek 供应商时,默认拉取全部模型列表。deepseek-v4-pro 虽强,但 token 成本是 flash 的 2.3 倍。
启动 Codex 后,在左下角模型选择器中,手动点选 deepseek-v4-flash;
或者在对话中输入 /model deepseek-v4-flash 强制切换。
实测相同代码补全任务,flash 版平均消耗 187 token,pro 版达 432 token。
这个模型对中文变量名、Python/JS 常见语法的理解足够稳定,没必要为“更强”多付一倍 token 费。
在 cc-switch 中配置请求截断策略
第一步:右上角点击齿轮图标 → 进入「设置」→ 切换到「路由」标签页。
第二步:找到「Codex 路由规则」下方的「请求拦截」区域 → 勾选「启用响应截断」。
第三步:在「最大响应长度(字符)」栏填入 2000 → 保存。
第四步:回到「Codex」标签页 → 确保 DeepSeek 供应商右侧「需要本地路由映射」已开启(否则截断不生效)。
该截断发生在协议转换层,不是简单前端 truncation。一旦响应原文超过 2000 字符,cc-switch 会主动终止流式传输并返回已完成部分,避免 DeepSeek 继续生成无意义尾缀——这部分常占单次请求 token 的 15%~30%。
监控与应急熔断
方法一:实时看 DeepSeek 控制台
打开 https://platform.deepseek.com → 登录 → 进入「Usage」面板 → 开启「每小时刷新」,观察「Tokens Used」曲线是否突增。
方法二:启用 cc-switch 日志
设置 → 日志 → 开启「详细请求日志」→ 日志中每行开头带 [deepseek-v4-flash] 的即为实际消耗记录,含 input_tokens 和 output_tokens 明细。
方法三:熔断开关(紧急时用)
在 cc-switch 「Codex」页 → 编辑 DeepSeek 供应商 → 找到「每日 token 上限」→ 填入 50000 → 保存 → 重启。当日累计达上限后,所有请求直接返回 429 错误,彻底阻断消耗。











