必须本地部署llama 3并接入dify才能实现完全离线运行:先用ollama拉取llama3:8b模型,再通过ollama serve启动服务,最后在dify中配置对应ollama供应商并测试连接成功。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Dify中让AI应用真正跑在自己机器上,不依赖任何云API、不上传敏感数据,就必须把Llama 3模型本地部署并接入Dify——这一步做完,你的AI能力就完全掌控在自己手里了。
安装Ollama并拉取Llama 3模型
打开终端,执行安装命令:curl -fsSL https://ollama.com/install.sh | sh。Linux/macOS用户可直接运行;Windows用户需先安装WSL2再操作。
安装完成后,运行 ollama pull llama3:8b 拉取8B参数量的轻量版Llama 3。该版本对显存要求低(最低4GB GPU显存或16GB系统内存即可推理),适合大多数开发测试场景。若设备资源充足,也可改用 llama3:70b,但需确认已配置vLLM或启用GPU offloading。
拉取过程耗时取决于网络,期间不要关闭终端。成功后会显示 Status: download complete。
启动Ollama服务并验证端口
执行 ollama serve 启动服务,默认监听 http://127.0.0.1:11434。此地址是Ollama API的入口,所有模型调用都经由此端点。
新开一个终端,运行 curl http://localhost:11434/api/tags。如果返回包含 "name": "llama3:8b" 的JSON数据,说明服务已就绪。
【注意:Dify容器内无法直接访问localhost】 若Dify通过Docker Compose部署(绝大多数本地安装方式),必须将Ollama服务地址改为宿主机真实IP或特殊Docker网关地址,否则连接必然失败。
在Dify中添加Ollama模型供应商
登录Dify Web界面 → 点击右上角头像 → 设置 → 模型供应商 → 点击“+ 添加模型供应商” → 选择“Ollama”类型。
填写以下三项:
① 模型名称:填 llama3-8b-local(不可含空格或特殊符号,后续创建应用时将从此名称中选择)
② 基础URL:根据Dify部署方式严格区分——
• 若Dify为源码启动(非Docker):填 http://localhost:11434
• 若Dify为Docker部署:填 http://host.docker.internal:11434(macOS/Windows Docker Desktop默认可用)或 http://172.17.0.1:11434(Linux Docker常用网关IP)
③ 模型类型:保持默认“Ollama”不变。
点击“保存”,页面不报错即完成配置。
测试模型连接并创建首个应用
回到“模型供应商”列表页,找到刚添加的条目,点击右侧“测试连接”。等待3秒内出现绿色提示“模型连接成功”,代表Dify已能稳定调用本地Llama 3。
进入“工作室” → “+ 创建应用” → 类型选“聊天型” → 应用名称随意(如“本地Llama3助手”)→ 下一步。
在“模型配置”页,模型下拉框中选择你刚命名的 llama3-8b-local,其余参数保持默认即可。
点击“创建”,进入编辑页后,直接点击右上角“发布”按钮,再点击“打开应用”。在弹出的对话窗口中输入“你好”,看到Llama 3返回中文回复,即表示整个链路打通。











