Qwen3.6-35B如何在本地部署_SGLang高吞吐启动命令【实战】

轻明君_2985

轻明君_2985

2026-05-07

1114人浏览

原创

需借助sglang框架部署qwen3.6-35b以启用高吞吐推理,其原生支持mtp推测解码,提供fp8量化、moe专家并行、openai api兼容、docker容器化及低显存适配五种启动方案。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

qwen3.6-35b如何在本地部署_sglang高吞吐启动命令【实战】

如果您尝试在本地部署 Qwen3.6-35B 并启用高吞吐推理能力,则需借助 SGLang 推理框架。SGLang 原生支持 MTP(Multi-Token Prediction)推测解码,可显著提升 token 生成速度与并发处理能力。以下是多种可行的 SGLang 启动方案:

一、标准 SGLang 启动命令(FP8 量化版)

该方式适用于已下载 FP8 量化模型权重并挂载至本地路径的场景,通过 --tp 指定张量并行规模,启用 MTP 加速。

1、确保已安装 sglang:pip install sglang

2、确认模型路径为 /data/models/Qwen3.6-35B-A3B-FP8

3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-FP8 --host 0.0.0.0 --port 30000 --tp 2 --enable-mtp --mtp-num-speculative-tokens 3

二、启用专家并行的 MoE 专用启动命令

Qwen3.6-35B-A3B 是 MoE 架构,含 256 个专家,需显式启用专家并行以避免路由不均导致的显存溢出或性能下降。

1、设置环境变量 CUDA_VISIBLE_DEVICES=0,1

2、使用 --expert-parallel 参数配合 --tp=4

3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-AWQ --host 0.0.0.0 --port 30000 --tp 4 --expert-parallel --enable-mtp --mtp-num-speculative-tokens 2 --reasoning-parser qwen3

三、兼容 OpenAI API 的 SGLang 服务启动

该方式使 SGLang 提供与 OpenAI 兼容的 REST 接口,便于接入 Claude Code、Ollama 或自研前端,同时保留 MTP 加速能力。

1、确认已安装 sglang[openai]

Claude级 · AI第二大脑
Claude级 · AI第二大脑

叶武滨设计的AI第二大脑,基于Claude Code架构,为大模型提供全生命周期自动记忆与文件管理。

下载

2、准备模型路径及端口映射:宿主机 30000 → 容器内 30000

3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 30000 --api-key sk-xxx --enable-mtp --mtp-num-speculative-tokens 4 --chat-template qwen3

四、Docker 容器化 SGLang 部署(带 GPU 支持)

适用于生产环境统一管理,利用 NVIDIA Container Toolkit 直接调用 GPU,避免宿主机环境污染。

1、拉取官方 SGLang 镜像:docker pull sg-lm/sglang:latest-cu121

2、创建 docker run 命令,绑定模型目录与端口

3、执行启动命令:docker run -d --gpus all -v /data/models:/models -p 30000:30000 sg-lm/sglang:latest-cu121 serve /models/Qwen3.6-35B-A3B-FP8 --host 0.0.0.0 --port 30000 --tp 2 --enable-mtp --mtp-num-speculative-tokens 3 --max-num-seqs 64

五、低显存设备适配启动(RTX 3090 / 4090 单卡)

针对单卡 24GB 显存设备,需限制 KV Cache 精度与序列长度,防止 OOM,同时保留基础 MTP 加速。

1、禁用 FP16 KV cache,改用 INT8:--kv-cache-dtype int8

2、降低最大批处理 token 数:--max-num-batched-tokens 4096

3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 30000 --tp 1 --enable-mtp --mtp-num-speculative-tokens 2 --kv-cache-dtype int8 --max-num-batched-tokens 4096 --max-model-len 32768

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

qwen 千问ai合集 claude

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

140

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

60

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

40

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

360

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

GDB C++程序怎么调试
GDB C++程序怎么调试

本专题围绕GDB调试C++程序的实际过程,详细说明程序编译、调试器启动、命令行参数传入、断点命中和程序继续运行等步骤,并介绍条件断点、临时断点和观察点的设置方法,方便开发者跟踪复杂代码的执行状态。

2026.09.11

140

20

Iris框架MVC架构与依赖注入合集
Iris框架MVC架构与依赖注入合集

本专题讲解Iris框架MVC开发模式,包含控制器注册、方法命名与路径映射、By参数绑定、BeforeActivation自定义路由,以及依赖注入容器注册、数据库依赖注入、返回值序列化及MVC下WebSocket与gRPC整合实践。

2026.09.11

80

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程