deepseek v4 与 anythingllm 对接需五步:一、确认服务端点可访问;二、配置 genericopenai 提供商;三、为工作区单独绑定模型;四、协同嵌入模型与向量库;五、执行端到端测试验证。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已完成 DeepSeek V4 模型的本地部署或获取了其 API 接入能力,但无法在 AnythingLLM 中调用该模型进行知识库问答,则可能是由于 LLM 首选项配置不匹配、服务地址未正确暴露、或模型名称未被识别。以下是完成 DeepSeek V4 与 AnythingLLM 对接的具体操作路径:
一、确认 DeepSeek V4 可访问服务端点
AnythingLLM 必须能通过 HTTP 协议访问到运行中的 DeepSeek V4 服务。若使用 Ollama 运行,需确认其已支持 V4 版本;若使用官方推理服务(如蓝耘、硅基流动等平台),则需获取有效 Base URL 与认证凭据。
1、若通过 Ollama 运行:检查当前 Ollama 版本是否 ≥0.4.5(V4 支持起始版本),执行 ollama list 查看是否存在 deepseek-v4 或类似命名模型。
2、若通过第三方 API 平台运行:登录对应平台控制台,进入 DeepSeek-V4 服务页,复制 Base URL(含 /v1 路径) 与 API Key,确保权限已开通且未过期。
3、若自建 vLLM 或 Transformers 服务:验证本地 http://127.0.0.1:8000/v1/chat/completions(或其他端口)可被 curl 正常调用,返回 status 200 且含 openai 兼容响应结构。
二、在 AnythingLLM 中配置 GenericOpenAI 接口方式
DeepSeek V4 官方 API 兼容 OpenAI 格式,AnythingLLM 的 GenericOpenAI 提供商可直接对接,无需额外插件。此方式适用于所有托管型或自建型 V4 服务。
1、启动 AnythingLLM 桌面客户端,点击左下角 ⚙️ 设置图标,进入【人工智能供应商】→【LLM首选项】。
2、在【LLM 提供商】下拉菜单中选择 GenericOpenAI。
3、在【Base URL】栏填入完整服务地址,例如:https://maas-api.lanyun.net/v1 或 http://127.0.0.1:11434/v1(Ollama 默认前缀需手动补全 /v1)。
4、在【API Key】栏粘贴密钥,若为本地 Ollama 则留空或填任意非空字符串(Ollama 不校验 key)。
5、在【Chat Model Name】栏输入模型标识符,如:deepseek-v4、deepseek-ai/deepseek-v4 或平台文档指定的全路径名。
6、点击 Save changes 保存全局设置。
三、为工作区单独绑定 DeepSeek V4 模型
全局 LLM 配置仅设定默认行为,每个工作区需显式启用 V4 模型以触发 RAG 流程。此步骤确保知识检索与生成阶段均使用 V4 推理能力。
1、返回主界面,点击已创建的工作区(如“专属知识库”)右侧的 ⚙️ 设置按钮。
2、进入【聊天设置】,将【工作区 LLM 提供者】设为 GenericOpenAI(而非 System default)。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
3、在【工作区聊天模型】下拉列表中,手动输入或选择与上一步一致的模型名,如:deepseek-v4。
4、关闭【流式响应】开关(部分 V4 实现暂不兼容 SSE 流式,关闭可避免中断)。
5、滚动至底部,点击 Save changes 确认工作区级配置。
四、验证嵌入模型与向量数据库协同性
DeepSeek V4 仅负责生成环节,知识召回依赖嵌入模型将文档向量化并存入 LanceDB。若嵌入模型与 V4 的语义空间不一致,将导致检索结果相关性下降,进而影响最终回答质量。
1、再次进入左下角 ⚙️ 设置,切换至【Embedder首选项】。
2、若使用 Ollama 嵌入模型,确认已拉取与 V4 同源的嵌入器,执行:ollama pull nomic-embed-text:latest 或平台推荐的 deepseek-v4-embedding(如有)。
3、在【嵌入引擎提供商】中选择 Ollama,并在模型下拉框中选定上述嵌入模型。
4、若使用内置 AnythingLLM Embedder,保持默认即可,但需注意其向量维度(768)与 V4 文本编码器输出是否对齐。
5、点击 Save changes 并重启 AnythingLLM 客户端使嵌入配置生效。
五、执行端到端连通性测试
配置完成后必须通过实际请求验证整个链路是否通畅,包括模型加载、token 解析、向量检索、上下文拼接与流式/非流式响应返回。
1、确保工作区中已上传至少一份测试文档(如 test.pdf),并点击 Save and Embed 完成向量化。
2、新建一个对话 Thread(旧 thread 缓存可能未加载新配置)。
3、输入问题,例如:本文档中提到的首次发布时间是哪一天?
4、观察右上角状态栏是否显示 Using deepseek-v4,并等待响应内容出现非通用模板化语句。
5、打开开发者工具(Ctrl+Shift+I),切换至 Network 标签页,筛选 /v1/chat/completions 请求,确认 response headers 中包含 x-model: deepseek-v4 字段。










