应启用token熔断机制并配置分级规则:开启熔断开关,设0–3000阈值用glm-4-flash、3001–8000用deepseek-v3、8001以上用混元-pro并强制暂停,联动tokenbar,设置会话级预算硬限制。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用WorkBuddy过程中发现某次会话Token消耗异常激增,系统未自动干预导致积分快速耗尽,则可能是尚未启用基于Token用量的模型自动切换机制。以下是设置成本控制熔断逻辑的具体步骤:
一、启用Token实时监控与熔断开关
该功能是自动切换模型的前提条件,需在全局设置中手动开启。启用后,WorkBuddy将在每次响应生成前预估本次输出Token量,并在超出阈值时触发模型降级或中断策略。
1、点击WorkBuddy右上角个人头像,进入「设置」菜单。
2、在左侧导航栏中选择「AI模型管理」→「高级成本控制」。
3、找到「启用Token熔断机制」选项,将其右侧滑动开关置为开启状态(变为蓝色)。
4、确认页面下方出现「当前熔断阈值:默认5000 Tokens/单次响应」提示,该数值可编辑。
二、配置分级熔断阈值与对应模型
系统支持按Token消耗量区间绑定不同模型,实现“高精度任务用强模型、低预算场景切轻量模型”的动态调度。每个区间必须指定一个已通过凭证校验的可用模型。
1、在「高级成本控制」页面,点击「添加熔断规则」按钮。
2、在弹出窗口中,于「起始Token数」字段输入0,于「终止Token数」字段输入3000,在「触发模型」下拉菜单中选择GLM-4-Flash。
3、再次点击「添加熔断规则」,设置第二条规则:起始3001、终止8000,触发模型选DeepSeek-V3。
4、添加第三条规则:起始8001、终止∞,触发模型选混元-Pro,并勾选「超阈值时强制暂停并通知用户」复选框。
三、绑定TokenBar实时面板联动策略
TokenBar是本地运行的毫秒级监控组件,其数值直接解析HTTP响应头中的x-token-used字段,不依赖云端上报。启用联动后,当TokenBar检测到单轮响应即将突破设定阈值时,将立即向WorkBuddy内核发送中断信号并执行模型切换。
1、确保Mac菜单栏已显示TokenBar图标(若未显示,请重启WorkBuddy并检查系统权限)。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
2、右键点击TokenBar图标,选择「启用内核联动」。
3、在弹出的权限确认窗口中,点击「允许」并输入管理员密码。
4、返回WorkBuddy「高级成本控制」页面,确认「TokenBar联动状态」显示为已连接且刷新延迟低于200ms。
四、设置会话级Token预算硬限制
该策略作用于单个对话线程,一旦累计输入+输出Token总和达到设定上限,系统将自动终止当前会话并清空上下文,防止指数级累积消耗。此设置独立于熔断规则,二者叠加生效。
1、在WorkBuddy主界面,打开任意已有对话或新建会话。
2、点击输入框右侧模型图标旁的「⋯」更多按钮。
3、在下拉菜单中选择「设置本会话Token预算」。
4、在弹出面板中输入目标值,例如12000,并勾选「到达预算时自动切换至GLM-4-Flash并保留历史摘要」。
五、验证熔断逻辑是否生效
验证需通过真实请求触发Token估算与响应拦截,不可仅依赖界面显示。系统仅在实际调用模型前完成预判,因此测试必须包含有效指令与可生成响应的内容。
1、新建一个空白会话,输入指令:请完整复述以下文本共15遍:'WorkBuddy成本控制已就绪。'
2、在输入框右侧模型图标处确认当前选中为混元-Pro。
3、按下回车键发送,观察响应生成前是否出现模型已自动切换为GLM-4-Flash提示。
4、打开TokenBar面板,确认最终记录的单次响应Token数为2987,未超过3000阈值。










