刚刚,deepseek v4 完成了一次重要升级。
正式发布了全新的投机解码(Speculative Decoding)框架 DSpark,并同步开源了支撑该技术的全栈式推测性解码基础设施 DeepSpec。
DeepSeek-V4-Pro-DSpark 并非全新训练的模型,而是在原有 DeepSeek-V4-Pro 架构基础上集成推测性解码模块的工程化增强版本。本次更新聚焦于实际部署效能提升,而非模型底层能力的重新训练或结构变更。
目前,DSpark 已全面接入 DeepSeek-V4(包括 Flash 与 Pro 版本)的真实线上服务流量,在保障输出质量不变的前提下,显著提升了大语言模型(LLM)的推理吞吐与响应速度。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

技术论文标题:《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》
论文地址:https://www.php.cn/link/0220329739741cb41edb31dada5a3aec
DSpark 的设计初衷直指生产环境中的核心挑战——尤其在高并发请求场景下,LLM 推理常受限于延迟过高与吞吐瓶颈。其本质是将高效率的「并行草稿生成」与智能感知负载状态的「动态验证机制」深度融合,实现性能与稳定性的双重突破。
推测性解码本身是一种不改变模型原始输出分布、仅通过工程优化加速推理的技术路径。它引入一个轻量级的「草稿模型」(draft model),预先批量生成多个候选 token;随后由主模型(target model)对整组候选进行一次性校验与筛选,从而将传统串行逐 token 解码转化为可并行处理的验证流程,大幅压缩端到端延迟。
在此基础上,DSpark 提出了两项关键创新:
一是半自回归生成架构(Semi-Autoregressive Generation):在保留草稿模型并行吞吐优势的同时,嵌入轻量级串行组件,对 block 内部 token 间的依赖关系建模,有效缓解纯并行草稿策略在长序列后段普遍存在的接受率下降问题。
二是硬件感知的置信度调度验证(Confidence-Scheduled Verification):传统投机解码往往将全部生成的草稿 token 无差别送入验证环节,但在系统高负载时,尾部低置信度 token 极易被拒绝,造成 GPU 批处理资源浪费。DSpark 引入专属「置信度头(Confidence Head)」实时评估每个 token 的存活概率,并结合硬件感知前缀调度器,依据当前引擎吞吐表现动态为每条请求定制最优验证长度,确保算力精准投向预期收益最高的 token。
为适配真实线上基础设施,DSpark 的调度器采用异步执行机制,兼容零开销调度(ZOS)及连续 CUDA 图回放。它基于前两步的历史预测结果,实时决策当前动态截断长度,既隐藏了调度延迟,又避免 GPU 流水线停顿,同时严格保证目标模型输出分布的完全一致性和无损还原。

在涵盖数学推理、代码生成与日常对话等多类任务的基准测试中,DSpark 表现全面优于当前主流方案,包括最先进的自回归加速器 Eagle3 和并行草稿模型 DFlash。以 Qwen3 系列(4B / 8B / 14B)为目标模型为例,其平均接受长度相较 Eagle3 提升 26.7%–30.9%,相较 DFlash 提升 16.3%–18.4%。

相较于上一代单 token 生产基准(MTP-1),在维持整体吞吐量不变的前提下,DSpark 实现了用户端生成速度的显著跃升:Flash 模型提速达 60%–85%,Pro 模型提速达 57%–78%。

随 DSpark 发布一同开源的 DeepSpec,是一套面向推测性解码草稿模型训练与评估的完整工具链。作为承载该技术及其他前沿算法落地的「开源基础设施」,DeepSpec 提供了数据准备、模型训练与效果评估三大核心模块。
整个流程被划分为三个阶段:数据准备 → 训练 → 评估,各阶段顺序依赖,前一阶段输出即为后一阶段输入。
在数据准备阶段,需下载提示词样本集,调用目标模型推理引擎重新生成标准答案,并构建目标缓存(target cache)。以默认配置 Qwen/Qwen3-4B 为例,该缓存体积可达约 38 TB,使用前请务必确认本地存储容量充足。
训练阶段可通过 bash scripts/train/train.sh 启动。脚本会自动调用 train.py,并在每张可见 GPU 上启动独立 worker 进程。用户可通过指定 config_path 参数,在 config/ 目录中选择不同算法与目标模型组合;亦支持通过覆盖 config_path、target_cache_dir 或添加 --opts 参数来灵活调整训练配置。
硬件方面,DeepSpec 默认适配单节点 8 卡 GPU 环境。若实际可用 GPU 数量较少,需相应缩减 CUDA_VISIBLE_DEVICES 中声明的设备编号数量。
评估阶段则通过 bash scripts/eval/eval.sh 触发。该脚本将加载训练完成的草稿模型 checkpoint,在多个 speculative decoding 标准任务上统计接受率与性能指标。当前支持的评测数据集包括 GSM8K、MATH500、AIME25、HumanEval、MBPP、LiveCodeBench、MT-Bench、Alpaca 与 Arena-Hard-v2,覆盖数学推理、编程生成、开放对话及综合问答等多种能力维度。
算法层面,DeepSpec 当前内置三种主流草稿模型实现:DSpark、DFlash 与 Eagle3;目标模型方面,已支持 Qwen3 与 Gemma 系列。
DeepSpec 的开源,标志着此前分散于各研究团队内部的推测性解码工程实践,首次被整合为一套标准化、可复现、易扩展的开源工具体系。对于希望为其自有大模型快速构建高效推理加速能力的研究者与工程师而言,这意味着无需从零搭建底层设施,即可直接基于成熟框架开展定制化草稿模型训练与部署。
参考链接:
https://www.php.cn/link/0220329739741cb41edb31dada5a3aec
https://www.php.cn/link/cf5a0f1371aa30a9f080f64baf566edd
本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:泽南、杨文 ,36氪经授权发布。










