workbuddy模型响应慢需先确认后端是否支持sse流式响应,再强制客户端启用sse协议、调低temperature、关闭top_p、限制max_tokens、清理插件缓存、重建知识库索引、启用gpu加速并重配暂存盘。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy模型响应太慢,不是单纯调高“速度”就能解决的问题,而是流式传输缺失、参数未收敛、本地资源争抢或缓存劣化等多重因素叠加导致的——首token延迟高、整块返回无打字机效果、技能调用卡在“正在处理”状态,都指向同一类底层链路故障。
确认后端是否真正支持SSE流式响应
这一步必须先做,否则后续所有客户端设置都是无效的。WorkBuddy能否实现逐token输出,完全取决于你对接的模型服务是否真正返回text/event-stream格式的数据流。
打开终端,执行以下curl命令测试原始响应:
curl -N "http://127.0.0.1:8000/v1/chat/completions" -H "Content-Type: application/json" -d '{"model":"qwen2-7b","messages":[{"role":"user","content":"hi"}],"stream":true}'
如果返回的是完整JSON(以{开头),说明后端压根没启用流式;如果持续滚动输出以data:开头的多行内容,才具备流式基础。【必须看到data: event: message字段交替出现,才算通过】
若失败,请回退到vLLM/FastAPI服务端代码,在生成循环中加入yield语句,并显式设置response.headers["Content-Type"] = "text/event-stream"。
强制WorkBuddy使用SSE协议
即使后端已支持stream=true,WorkBuddy也可能因响应头缺失或字段不规范而自动降级为普通HTTP请求。这时需手动指定传输协议。
进入【设置】→【AI模型】→选择你的自定义模型→点击【高级设置】→找到“传输协议偏好”→从Auto改为SSE(Server-Sent Events)。
保存后必须重启WorkBuddy客户端,否则新配置不会加载进网络栈。【该选项仅在客户端版本≥v1.3.2中可见。若找不到,先升级客户端再操作】
优化生成参数降低TTFT(首token延迟)
首token出来太慢,用户感知就是“卡住”,其实模型已在计算,只是没及时吐出第一个字。可通过调整三个关键参数压缩TTFT:
第一步:在模型高级设置中,将temperature从默认1.0降至0.3~0.6区间,减少采样随机性,加快确定性路径收敛。
第二步:关闭top_p(即设为1.0),避免动态裁剪词汇表导致推理分支膨胀。
第三步:将max_tokens限制在512以内,防止模型陷入长文本生成的冗余计算;若仅用于指令解析或技能路由,可进一步压至128。
清理插件缓存与重建知识库索引
插件缓存堆积和本地索引碎片化会直接拖慢模型调用前的上下文准备阶段——尤其在技能触发时,WorkBuddy需同步加载插件状态+检索知识库+组装prompt,任一环节卡顿都会传导至模型响应。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
方法一:清理插件缓存
关闭WorkBuddy主程序,确保所有子进程终止(macOS可在活动监视器中搜索“python”“node”相关进程;Windows可在任务管理器中结束“WorkBuddy Plugin Host”及“ClawWorker”等进程)。
定位插件缓存目录:macOS用户前往~/Library/Application Support/WorkBuddy/Plugins/Cache/;Windows用户前往%APPDATA%\Tencent\WorkBuddy\Plugins\Cache/。
删除该目录下所有以.tmp、.pid、.log结尾的文件,以及名称含“_cache”“_temp”的子文件夹;保留plugins.json、manifest.yaml及各插件根目录下的metadata.xml。
方法二:重建轻量级本地知识库索引
进入「设置」→「知识库管理」→「高级选项」,点击「索引健康度检测」按钮。
若检测结果显示“碎片率>40%”或“过期文档占比>25%”,则必须执行重建;切勿直接点击“全量重建”,应选择“增量刷新”模式。
在弹出窗口中勾选“仅重建近7天内修改过的文档”与“跳过PDF图像页文本提取”,点击「开始刷新」。
等待状态栏显示“索引刷新完成,有效文档数:XXX,平均检索延迟:XX ms”后,返回任意技能界面测试响应速度。
启用GPU加速并重配暂存盘
GPU未启用时,模型推理被迫跑在CPU上,尤其在处理多模态输入或长上下文时,首token延迟会指数级上升。
在WorkBuddy主窗口右上角点击「首选项」→ 左侧导航栏选择「GPU设置」→ 勾选启用GPU性能加速 → 若列表中显示多个GPU设备,选择计算能力得分最高的一项(通常为独立显卡)→ 点击「应用」。
暂存盘空间不足也会触发AI引擎强制降频:当所选磁盘剩余空间低于8GB时,系统将阻塞任务排队。
切换至「增效工具」→「暂存盘」选项页 → 点击「更改」按钮,定位至剩余空间大于20GB的非系统分区(如D:\、E:\)→ 勾选清空原暂存盘残留缓存 → 点击「确定」启动迁移清理。










