火山引擎如何部署模型?

酷雪小哥_9696

酷雪小哥_9696

2026-09-08

142人浏览

原创

添加自部署模型需登录火山引擎边缘大模型网关控制台,在【模型配置管理>大模型管理】的【自有三方模型】页签下点击【自部署模型】→【添加模型】,填写模型名称、调用名称(仅字母/数字/下划线)、模型系列、提供商选“自部署模型”,并填入内网可访问的完整http服务地址(如http://192.168.1.100:8000/v1),确保端口开放且网关可达。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

火山引擎如何部署模型?

火山引擎上部署模型,需根据模型来源(自部署/平台托管)、调用方式(API/本地集成)和运行环境(ECS/VKE/VCI)选择对应路径,不能直接上传模型文件就完成部署。

添加自部署模型到边缘大模型网关

适用于已有内网可访问的私有化模型服务(如 Ollama、vLLM、FastChat 启动的服务),需通过网关统一管控和路由。

登录火山引擎边缘大模型网关控制台 → 左侧导航栏进入【模型配置管理 > 大模型管理】 → 切换至【自有三方模型】页签 → 点击【自部署模型】标签 → 单击【添加模型】。

在弹出对话框中填写:模型名称(仅显示用)、调用名称(【必须为字母/数字/下划线组合,后续API请求中的model字段必须与此完全一致】)、模型系列(如LLM)、提供商选“自部署模型”。

地址栏填入你本地服务的完整 HTTP 地址,例如 http://192.168.1.100:8000/v1 ,注意末尾不加斜杠;端口必须开放且能被网关实例访问,否则检测失败。

在CPU云服务器上用Docker部署DeepSeek-R1-Distill

适合预算有限、低频调用、无需GPU加速的个人或调试场景,全程命令行操作,无需图形界面。

登录火山引擎ECS控制台,创建一台 ecs.c3il.8xlarge 规格的 Ubuntu 22.04 实例,绑定公网IP或配置NAT网关。

SSH登录后执行:sudo apt update && sudo apt install -y docker.io → 启动服务:sudo systemctl enable docker && sudo systemctl start docker

运行模型容器:docker run -d --network host --privileged --shm-size 15g -v /data00/models:/data00/models -e MODEL_PATH=/data00/models -e PORT=8000 -e MODEL_NAME=DeepSeek-R1-Distill-Qwen-7B -e DTYPE=bf16 -e KV_CACHE_DTYPE=fp16 ai-containers-cn-shanghai.cr.volces.com/deeplearning/xft-vllm:1.8.2.iaas bash /llama2/en

这一步会自动拉取镜像并启动推理服务,监听本机8000端口;【务必确认 /data00/models 目录存在且有写权限,否则模型下载失败导致容器立即退出】

火山引擎
火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

下载

通过VKE集群部署Langchain-ChatGLM

适用于需要高可用、弹性扩缩容、GPU加速的生产级AI应用,依赖Kubernetes编排能力。

方法一:控制台可视化部署

登录VKE控制台 → 创建1.24版本集群 → 节点规格选 ecs.gni2.3xlarge(含NVIDIA A10 GPU)→ 安装 nvidia-device-plugin 组件 → 进入“工作负载 > 无状态负载” → 创建 Deployment,镜像填 cr-demo-cn-beijing.cr.volces.com/vke-ai/langchain-chatglm:v0.0.1 → 在“资源限制”中设置 nvidia.com/gpu: "1"

方法二:YAML文件部署

在“服务与路由 > 服务”页面创建类型为“负载均衡”的Service,端口映射容器7860端口 → 等待外部IP就绪 → 浏览器直接访问该IP即可打开Gradio界面。

镜像体积约24GB,首次拉取耗时较长,建议提前推送到自有CR仓库并开启镜像加速。

用Cherry Studio接入火山方舟在线推理模型

适合不想搭服务、只想快速试用豆包等托管模型的本地用户,所有推理发生在火山云端,本地只做前端交互。

第一步:登录火山方舟控制台(https://console.volcengine.com/ark/)→ 左侧选【在线推理】→ 【创建接入点】→ 填写名称 → 添加模型(如“豆包1.6”)→ 创建成功后点击【API调用】→ 复制“OpenAI SDK调用示例”中的API地址(【必须以 / 结尾,例如 https://ark.cn-beijing.volces.com/api/v3/】)→ 再点击右上角【创建API Key】并复制。

第二步:打开Cherry Studio → 设置 → 模型服务 → 选择【火山引擎】→ 粘贴API Key和API地址 → 点击【检测】→ 检测通过后,在模型列表底部点击【添加】→ 粘贴模型ID(即方舟平台里该模型的唯一标识,非显示名称)→ 勾选功能 → 保存。

第三步:回到主聊天窗口 → 左上角模型下拉菜单中选择刚添加的模型 → 发送任意消息,即可获得响应。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

140

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

60

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

40

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

360

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

GDB C++程序怎么调试
GDB C++程序怎么调试

本专题围绕GDB调试C++程序的实际过程,详细说明程序编译、调试器启动、命令行参数传入、断点命中和程序继续运行等步骤,并介绍条件断点、临时断点和观察点的设置方法,方便开发者跟踪复杂代码的执行状态。

2026.09.11

120

20

Iris框架MVC架构与依赖注入合集
Iris框架MVC架构与依赖注入合集

本专题讲解Iris框架MVC开发模式,包含控制器注册、方法命名与路径映射、By参数绑定、BeforeActivation自定义路由,以及依赖注入容器注册、数据库依赖注入、返回值序列化及MVC下WebSocket与gRPC整合实践。

2026.09.11

80

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
腾讯元宝使用手册
腾讯元宝使用手册

共0课时 | 0人学习

DeepSeek手册
DeepSeek手册

共0课时 | 0人学习

豆包AI手册
豆包AI手册

共0课时 | 0人学习