在dify中接入hugging face推理端点是为了绕过本地gpu限制,直接调用hf托管的模型服务,需创建public端点、配置custom模型提供者,并验证text-generation等兼容任务类型。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在Dify中接入Hugging Face推理端点(Inference Endpoints),是为了绕过本地GPU资源限制,直接调用HF托管的、已部署好的模型服务,适用于无显卡服务器或需快速验证模型效果的场景。该方式不依赖vLLM/Ollama等本地推理引擎,而是通过HTTPS API通信,要求端点已启用且公开可访问。
创建并启用Hugging Face Inference Endpoint
登录 Hugging Face 账户 → 进入 Inference Endpoints 页面 → 点击 “Create new endpoint” → 选择模型(如 Qwen/Qwen3-Embedding 或 meta-llama/Llama-3-8b-chat-hf)→ 设置硬件规格(CPU/GPU)、实例类型(例如 gpu.rtx6000.x1)→ 开启 “Public endpoint” → 点击 “Launch”。
等待状态变为 Running 后,复制页面顶部显示的 Endpoint URL(形如 https://xxxxx.us-east-1.aws.endpoints.huggingface.cloud)——这是后续Dify配置唯一必需的地址。
【注意:Endpoint必须设为Public,否则Dify无法发起跨域HTTP请求】
在Dify中注册HF推理端点为自定义模型
进入 Dify 后台 → 【Settings】→ 【Model Providers】→ 【+ Add Model Provider】→ 选择 “Custom” 类型 → 填写以下字段:
-
Name:任意标识名,如
HF-Qwen3-Embedding - API Base URL:粘贴上一步复制的 Endpoint URL,末尾不要加 /v1 或任何路径
-
API Key:填写你在 Hugging Face Settings → Access Tokens 中生成的 inference token(权限需含
inference),不是 read/write token -
Model Name:与HF模型库中完全一致的ID,例如
Qwen/Qwen3-Embedding(大小写、斜杠、连字符均需严格匹配)
保存后,该模型将出现在【Model Configuration】的下拉列表中,可直接绑定到应用的 LLM 节点。
验证端点可用性与格式兼容性
第一步:用 curl 测试原始响应(替换为你的真实 URL 和 token):
curl -X POST "$ENDPOINT_URL" \<br> -H "Authorization: Bearer $HF_TOKEN" \<br> -H "Content-Type: application/json" \<br> -d '{"inputs":"Hello"}'
若返回 JSON 且含 "generated_text" 或 "embedding" 字段,说明端点就绪;若报错 401 Unauthorized,检查 token 是否过期或权限不足;若报错 400 Bad Request,大概率是模型 task 类型与 Dify 默认预期不符。
第二步:在 Dify 应用中新建测试对话流 → LLM 节点选择刚注册的模型 → 输入“你好” → 运行。首次调用可能延迟 3–8 秒(冷启动),成功返回即表示对接完成。
【关键前提:HF端点必须部署为 text-generation、feature-extraction 或 conversational 类型,Dify不支持 image-to-text 等多模态端点】










