workbuddy卡顿是因本地推理触发系统保护而截断token生成,需立即点⏹️停止、重置输出配额、切换轻量模型、禁用非核心技能包、压缩或重置上下文。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy生成内容卡顿表现为光标持续闪烁、界面长时间显示“思考中”、右下角弹出“资源超限”提示、输入框失活或返回空响应,这不是网络延迟导致的等待,而是本地推理链路已触发系统级保护机制,正在主动截断token生成以防止越界。
立即中断当前生成任务
点击输入框右侧的「停止生成」按钮(⏹️),强制终止当前推理链路。
不点停止的话,WorkBuddy会在后台持续占用GPU显存与上下文缓存,即使你切到其他窗口,该任务仍维持活跃状态,导致后续所有新请求都被排队阻塞。点击后等待2~3秒,确认右下角提示消失、输入框恢复可编辑状态,再进行下一步。
检查并重置模型输出配额
方法一:通过图形界面快速调低输出上限
1、在任意对话窗口中,点击输入框右侧当前模型图标(如GLM-4-Flash)→ 从下拉菜单中选择同一模型 → 点击模型名右侧齿轮图标(⚙️)进入参数面板。
2、将「Max Output Tokens」值设为【不超过模型官方上限的60%】,例如Kimi-Long标注支持200万Token,此处最多填1200000;若填超,系统会静默截断且不报错,但极易再次卡住。
3、关闭面板,无需发送指令,该设置已实时生效于当前会话。
方法二:手动清理残留上下文快照(Windows/macOS通用)
关闭WorkBuddy客户端 → 删除对应路径下的context_snapshots文件夹 → 重启客户端。此操作强制清空所有未提交的中间token缓存,避免旧会话残留数据污染新请求。
注意:删除前请确认当前无未保存的长对话草稿,该操作不可逆。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
切换至轻量模型执行降级输出
第一步:在模型选择面板中,将当前模型切换为GLM-4-Flash或Qwen2-7B等轻量级模型。
第二步:在高级设置中添加启动前缀--fallback=raw_text,强制模型跳过复杂格式渲染,直接输出纯文本流。
第三步:发送一句“你好”,验证是否恢复逐字输出效果。这一步操作起来很简单,直接把文件拖进去就行。
禁用非核心技能包并释放初始化负载
进入「技能中心」→ 停用所有未实际使用的技能包,仅保留docx、pdf、summary三类高频刚需技能。
技能包越多,初始化越慢;远程大模型越强,首次调用延迟越高。卡顿常始于这些后台加载动作。
关闭后重启WorkBuddy,观察控制台日志是否出现[SkillLoader] loaded 3 active skills提示。
压缩或重置当前会话上下文
第一步:点击当前会话右上角「⋯」→ 选择「停止当前任务」→ 等待3秒再发送一句「你好」测试是否恢复响应。
第二步:若恢复,立即对AI说「请压缩当前上下文」→ 它会自动剔除冗余对话、保留关键指令与记忆片段。
第三步:若仍无反应,直接删除该会话 → 新建会话 → 用自然语言指令让AI读取「最近7天内的重要记忆」,而非全量加载。
不先停止就新建会话,旧会话的上下文仍在后台占用资源。










