workbuddy资源超限时表现为卡在“思考中”、光标闪烁、弹出“资源超限”提示或返回空响应;应点击「停止生成」按钮释放资源,再调低max output tokens至官方上限60%、清理context_snapshots文件夹或切换轻量模型并加--fallback=raw_text前缀降级输出。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy模型资源超出限量时,常表现为生成中途卡在“思考中”、光标持续闪烁但无输出、界面右下角弹出“资源超限”提示或直接返回空响应,此时并非模型故障,而是系统已主动拦截后续token生成以防止越界。
立即释放当前会话资源
这一步操作起来很简单,直接点击输入框右侧的「停止生成」按钮(⏹️)即可中断当前推理链路。
不点停止的话,WorkBuddy会在后台持续占用GPU显存与上下文缓存,即使你切到其他窗口,该任务仍维持活跃状态,导致后续所有新请求都被排队阻塞。
点击后等待2~3秒,确认右下角提示消失、输入框恢复可编辑状态,再进行下一步。
检查并重置模型级资源配额
方法一:通过图形界面快速调低输出上限
1、在任意对话窗口中,点击输入框右侧当前模型图标(如GLM-4-Flash)→ 从下拉菜单中选择同一模型 → 点击模型名右侧齿轮图标(⚙️)进入参数面板。
2、将「Max Output Tokens」值设为【不超过模型官方上限的60%】,例如Kimi-Long标注支持200万Token,此处最多填1200000;若填超,系统会静默截断且不报错,但极易再次卡住。
3、关闭面板,无需发送指令,该设置已实时生效于当前会话。
腾讯云代码助手CodeBuddy旗下WorkBuddy 4.24.8版本正式发布。本版本重点修复了上下文压缩异常、冷加载时偶现历史消息丢失、任务停止卡死等问题,并深度优化了Windows沙箱(lightSandbox)的日志写入与误弹窗逻辑,提供更安全稳定的AI协作体验。
方法二:手动清理残留上下文快照(Windows/macOS通用)
关闭WorkBuddy客户端 → 删除对应路径下的context_snapshots文件夹 → 重启客户端。此操作强制清空所有未提交的中间token缓存,避免旧会话残留数据污染新请求。
注意:删除前请确认当前无未保存的长对话草稿,该操作不可逆。
切换至轻量模型执行降级输出
第一步:在模型选择面板中,将当前模型切换为GLM-4-Lite或Hunyuan-Turbo。
第二步:输入指令前,先键入前缀--fallback=raw_text,例如:“--fallback=raw_text 总结上文核心观点”。
第三步:发送后若主通道仍卡顿,系统将在5秒内自动启用纯文本降级通道,跳过格式渲染与工具调用,仅输出最简结论。
这一步能绕过大部分因插件加载、文档解析等附加模块引发的资源争抢,适用于紧急获取内容主干的场景。










