添加自部署模型需登录火山引擎边缘大模型网关控制台,在【模型配置管理>大模型管理】的【自有三方模型】页签下点击【自部署模型】→【添加模型】,填写模型名称、调用名称(仅字母/数字/下划线)、模型系列、提供商选“自部署模型”,并填入内网可访问的完整http服务地址(如http://192.168.1.100:8000/v1),确保端口开放且网关可达。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在火山引擎上部署模型,需根据模型来源(自部署/平台托管)、调用方式(API/本地集成)和运行环境(ECS/VKE/VCI)选择对应路径,不能直接上传模型文件就完成部署。
添加自部署模型到边缘大模型网关
适用于已有内网可访问的私有化模型服务(如 Ollama、vLLM、FastChat 启动的服务),需通过网关统一管控和路由。
登录火山引擎边缘大模型网关控制台 → 左侧导航栏进入【模型配置管理 > 大模型管理】 → 切换至【自有三方模型】页签 → 点击【自部署模型】标签 → 单击【添加模型】。
在弹出对话框中填写:模型名称(仅显示用)、调用名称(【必须为字母/数字/下划线组合,后续API请求中的model字段必须与此完全一致】)、模型系列(如LLM)、提供商选“自部署模型”。
地址栏填入你本地服务的完整 HTTP 地址,例如 http://192.168.1.100:8000/v1 ,注意末尾不加斜杠;端口必须开放且能被网关实例访问,否则检测失败。
在CPU云服务器上用Docker部署DeepSeek-R1-Distill
适合预算有限、低频调用、无需GPU加速的个人或调试场景,全程命令行操作,无需图形界面。
登录火山引擎ECS控制台,创建一台 ecs.c3il.8xlarge 规格的 Ubuntu 22.04 实例,绑定公网IP或配置NAT网关。
SSH登录后执行:sudo apt update && sudo apt install -y docker.io → 启动服务:sudo systemctl enable docker && sudo systemctl start docker。
运行模型容器:docker run -d --network host --privileged --shm-size 15g -v /data00/models:/data00/models -e MODEL_PATH=/data00/models -e PORT=8000 -e MODEL_NAME=DeepSeek-R1-Distill-Qwen-7B -e DTYPE=bf16 -e KV_CACHE_DTYPE=fp16 ai-containers-cn-shanghai.cr.volces.com/deeplearning/xft-vllm:1.8.2.iaas bash /llama2/en。
这一步会自动拉取镜像并启动推理服务,监听本机8000端口;【务必确认 /data00/models 目录存在且有写权限,否则模型下载失败导致容器立即退出】。
通过VKE集群部署Langchain-ChatGLM
适用于需要高可用、弹性扩缩容、GPU加速的生产级AI应用,依赖Kubernetes编排能力。
方法一:控制台可视化部署
登录VKE控制台 → 创建1.24版本集群 → 节点规格选 ecs.gni2.3xlarge(含NVIDIA A10 GPU)→ 安装 nvidia-device-plugin 组件 → 进入“工作负载 > 无状态负载” → 创建 Deployment,镜像填 cr-demo-cn-beijing.cr.volces.com/vke-ai/langchain-chatglm:v0.0.1 → 在“资源限制”中设置 nvidia.com/gpu: "1"。
方法二:YAML文件部署
在“服务与路由 > 服务”页面创建类型为“负载均衡”的Service,端口映射容器7860端口 → 等待外部IP就绪 → 浏览器直接访问该IP即可打开Gradio界面。
镜像体积约24GB,首次拉取耗时较长,建议提前推送到自有CR仓库并开启镜像加速。
用Cherry Studio接入火山方舟在线推理模型
适合不想搭服务、只想快速试用豆包等托管模型的本地用户,所有推理发生在火山云端,本地只做前端交互。
第一步:登录火山方舟控制台(https://console.volcengine.com/ark/)→ 左侧选【在线推理】→ 【创建接入点】→ 填写名称 → 添加模型(如“豆包1.6”)→ 创建成功后点击【API调用】→ 复制“OpenAI SDK调用示例”中的API地址(【必须以 / 结尾,例如 https://ark.cn-beijing.volces.com/api/v3/】)→ 再点击右上角【创建API Key】并复制。
第二步:打开Cherry Studio → 设置 → 模型服务 → 选择【火山引擎】→ 粘贴API Key和API地址 → 点击【检测】→ 检测通过后,在模型列表底部点击【添加】→ 粘贴模型ID(即方舟平台里该模型的唯一标识,非显示名称)→ 勾选功能 → 保存。
第三步:回到主聊天窗口 → 左上角模型下拉菜单中选择刚添加的模型 → 发送任意消息,即可获得响应。











