需借助sglang框架部署qwen3.6-35b以启用高吞吐推理,其原生支持mtp推测解码,提供fp8量化、moe专家并行、openai api兼容、docker容器化及低显存适配五种启动方案。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您尝试在本地部署 Qwen3.6-35B 并启用高吞吐推理能力,则需借助 SGLang 推理框架。SGLang 原生支持 MTP(Multi-Token Prediction)推测解码,可显著提升 token 生成速度与并发处理能力。以下是多种可行的 SGLang 启动方案:
一、标准 SGLang 启动命令(FP8 量化版)
该方式适用于已下载 FP8 量化模型权重并挂载至本地路径的场景,通过 --tp 指定张量并行规模,启用 MTP 加速。
1、确保已安装 sglang:pip install sglang
2、确认模型路径为 /data/models/Qwen3.6-35B-A3B-FP8
3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-FP8 --host 0.0.0.0 --port 30000 --tp 2 --enable-mtp --mtp-num-speculative-tokens 3
二、启用专家并行的 MoE 专用启动命令
Qwen3.6-35B-A3B 是 MoE 架构,含 256 个专家,需显式启用专家并行以避免路由不均导致的显存溢出或性能下降。
1、设置环境变量 CUDA_VISIBLE_DEVICES=0,1
2、使用 --expert-parallel 参数配合 --tp=4
3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-AWQ --host 0.0.0.0 --port 30000 --tp 4 --expert-parallel --enable-mtp --mtp-num-speculative-tokens 2 --reasoning-parser qwen3
三、兼容 OpenAI API 的 SGLang 服务启动
该方式使 SGLang 提供与 OpenAI 兼容的 REST 接口,便于接入 Claude Code、Ollama 或自研前端,同时保留 MTP 加速能力。
1、确认已安装 sglang[openai]
2、准备模型路径及端口映射:宿主机 30000 → 容器内 30000
3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 30000 --api-key sk-xxx --enable-mtp --mtp-num-speculative-tokens 4 --chat-template qwen3
四、Docker 容器化 SGLang 部署(带 GPU 支持)
适用于生产环境统一管理,利用 NVIDIA Container Toolkit 直接调用 GPU,避免宿主机环境污染。
1、拉取官方 SGLang 镜像:docker pull sg-lm/sglang:latest-cu121
2、创建 docker run 命令,绑定模型目录与端口
3、执行启动命令:docker run -d --gpus all -v /data/models:/models -p 30000:30000 sg-lm/sglang:latest-cu121 serve /models/Qwen3.6-35B-A3B-FP8 --host 0.0.0.0 --port 30000 --tp 2 --enable-mtp --mtp-num-speculative-tokens 3 --max-num-seqs 64
五、低显存设备适配启动(RTX 3090 / 4090 单卡)
针对单卡 24GB 显存设备,需限制 KV Cache 精度与序列长度,防止 OOM,同时保留基础 MTP 加速。
1、禁用 FP16 KV cache,改用 INT8:--kv-cache-dtype int8
2、降低最大批处理 token 数:--max-num-batched-tokens 4096
3、执行启动命令:sglang serve /data/models/Qwen3.6-35B-A3B-Q4_K_M.gguf --host 0.0.0.0 --port 30000 --tp 1 --enable-mtp --mtp-num-speculative-tokens 2 --kv-cache-dtype int8 --max-num-batched-tokens 4096 --max-model-len 32768











