刚刚,DeepSeek V4更新DSpark,推理速度提升80%

花韻仙語

花韻仙語

2026-06-29

228人浏览

原创

刚刚,deepseek v4 完成了一次重要升级。

正式发布了全新的投机解码(Speculative Decoding)框架 DSpark,并同步开源了支撑该技术的全栈式推测性解码基础设施 DeepSpec

DeepSeek-V4-Pro-DSpark 并非全新训练的模型,而是在原有 DeepSeek-V4-Pro 架构基础上集成推测性解码模块的工程化增强版本。本次更新聚焦于实际部署效能提升,而非模型底层能力的重新训练或结构变更。

目前,DSpark 已全面接入 DeepSeek-V4(包括 Flash 与 Pro 版本)的真实线上服务流量,在保障输出质量不变的前提下,显著提升了大语言模型(LLM)的推理吞吐与响应速度。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

刚刚,DeepSeek V4更新DSpark,推理速度提升80%

技术论文标题:《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》

论文地址:https://www.php.cn/link/0220329739741cb41edb31dada5a3aec

DSpark 的设计初衷直指生产环境中的核心挑战——尤其在高并发请求场景下,LLM 推理常受限于延迟过高与吞吐瓶颈。其本质是将高效率的「并行草稿生成」与智能感知负载状态的「动态验证机制」深度融合,实现性能与稳定性的双重突破。

推测性解码本身是一种不改变模型原始输出分布、仅通过工程优化加速推理的技术路径。它引入一个轻量级的「草稿模型」(draft model),预先批量生成多个候选 token;随后由主模型(target model)对整组候选进行一次性校验与筛选,从而将传统串行逐 token 解码转化为可并行处理的验证流程,大幅压缩端到端延迟。

在此基础上,DSpark 提出了两项关键创新:

一是半自回归生成架构(Semi-Autoregressive Generation):在保留草稿模型并行吞吐优势的同时,嵌入轻量级串行组件,对 block 内部 token 间的依赖关系建模,有效缓解纯并行草稿策略在长序列后段普遍存在的接受率下降问题。

二是硬件感知的置信度调度验证(Confidence-Scheduled Verification):传统投机解码往往将全部生成的草稿 token 无差别送入验证环节,但在系统高负载时,尾部低置信度 token 极易被拒绝,造成 GPU 批处理资源浪费。DSpark 引入专属「置信度头(Confidence Head)」实时评估每个 token 的存活概率,并结合硬件感知前缀调度器,依据当前引擎吞吐表现动态为每条请求定制最优验证长度,确保算力精准投向预期收益最高的 token。

为适配真实线上基础设施,DSpark 的调度器采用异步执行机制,兼容零开销调度(ZOS)及连续 CUDA 图回放。它基于前两步的历史预测结果,实时决策当前动态截断长度,既隐藏了调度延迟,又避免 GPU 流水线停顿,同时严格保证目标模型输出分布的完全一致性和无损还原。

刚刚,DeepSeek V4更新DSpark,推理速度提升80%

在涵盖数学推理、代码生成与日常对话等多类任务的基准测试中,DSpark 表现全面优于当前主流方案,包括最先进的自回归加速器 Eagle3 和并行草稿模型 DFlash。以 Qwen3 系列(4B / 8B / 14B)为目标模型为例,其平均接受长度相较 Eagle3 提升 26.7%–30.9%,相较 DFlash 提升 16.3%–18.4%。

PS CS6绿色精简版
PS CS6绿色精简版

最好用的图像处理软件

下载

刚刚,DeepSeek V4更新DSpark,推理速度提升80%

相较于上一代单 token 生产基准(MTP-1),在维持整体吞吐量不变的前提下,DSpark 实现了用户端生成速度的显著跃升:Flash 模型提速达 60%–85%,Pro 模型提速达 57%–78%

刚刚,DeepSeek V4更新DSpark,推理速度提升80%

随 DSpark 发布一同开源的 DeepSpec,是一套面向推测性解码草稿模型训练与评估的完整工具链。作为承载该技术及其他前沿算法落地的「开源基础设施」,DeepSpec 提供了数据准备、模型训练与效果评估三大核心模块。

整个流程被划分为三个阶段:数据准备 → 训练 → 评估,各阶段顺序依赖,前一阶段输出即为后一阶段输入。

在数据准备阶段,需下载提示词样本集,调用目标模型推理引擎重新生成标准答案,并构建目标缓存(target cache)。以默认配置 Qwen/Qwen3-4B 为例,该缓存体积可达约 38 TB,使用前请务必确认本地存储容量充足。

训练阶段可通过 bash scripts/train/train.sh 启动。脚本会自动调用 train.py,并在每张可见 GPU 上启动独立 worker 进程。用户可通过指定 config_path 参数,在 config/ 目录中选择不同算法与目标模型组合;亦支持通过覆盖 config_pathtarget_cache_dir 或添加 --opts 参数来灵活调整训练配置。

硬件方面,DeepSpec 默认适配单节点 8 卡 GPU 环境。若实际可用 GPU 数量较少,需相应缩减 CUDA_VISIBLE_DEVICES 中声明的设备编号数量。

评估阶段则通过 bash scripts/eval/eval.sh 触发。该脚本将加载训练完成的草稿模型 checkpoint,在多个 speculative decoding 标准任务上统计接受率与性能指标。当前支持的评测数据集包括 GSM8K、MATH500、AIME25、HumanEval、MBPP、LiveCodeBench、MT-Bench、Alpaca 与 Arena-Hard-v2,覆盖数学推理、编程生成、开放对话及综合问答等多种能力维度。

算法层面,DeepSpec 当前内置三种主流草稿模型实现:DSpark、DFlash 与 Eagle3;目标模型方面,已支持 Qwen3 与 Gemma 系列。

DeepSpec 的开源,标志着此前分散于各研究团队内部的推测性解码工程实践,首次被整合为一套标准化、可复现、易扩展的开源工具体系。对于希望为其自有大模型快速构建高效推理加速能力的研究者与工程师而言,这意味着无需从零搭建底层设施,即可直接基于成熟框架开展定制化草稿模型训练与部署。

参考链接:

https://www.php.cn/link/0220329739741cb41edb31dada5a3aec
https://www.php.cn/link/cf5a0f1371aa30a9f080f64baf566edd

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:泽南、杨文 ,36氪经授权发布。

相关专题

更多
DeepSeek官方入口
DeepSeek官方入口

DeepSeek,一个综合性的搜索引擎,提供来自学术数据库、新闻网站和社交媒体的广泛结果。访问 DeepSeek 的官方网站。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.02.17

32896

6

deepseek在线提问
deepseek在线提问

本合集汇总了DeepSeek在线提问技巧与免登录使用入口,助你快速上手AI对话、写作、分析等功能。阅读专题下面的文章了解更多详细内容。

2026.02.27

750

50

DeepSeek 入门与快速上手指南
DeepSeek 入门与快速上手指南

面向 AI 工具新手,从 DeepSeek 的账号注册、网页端与客户端使用讲起,介绍 DeepSeek-V3、DeepSeek-R1 等模型的能力定位与选择建议、对话提示词(Prompt)编写技巧、深度思考模式与联网搜索功能的使用场景、API Key 申请与首次接口调用流程,帮助用户快速上手 DeepSeek 并将其融入日常工作与学习。

2026.05.12

1643

18

DeepSeek API开发与应用集成教程合集
DeepSeek API开发与应用集成教程合集

系统讲解 DeepSeek 开放平台 API 的开发与集成方法,涵盖 API Key 鉴权与请求签名、Chat Completions 接口参数详解(temperature/top_p/max_tokens)、多轮对话上下文管理、流式输出(SSE Streaming)的前后端实现、Function Call 函数调用与外部工具对接、Embeddings 文本向量接口的使用、Python requests / openai SDK / J

2026.05.12

128

19

DeepSeek 提示词工程与高效使用教程合集
DeepSeek 提示词工程与高效使用教程合集

聚焦如何通过提示词工程充分发挥 DeepSeek 的能力上限,涵盖基础 Prompt 结构(角色/任务/格式/约束)设计、System Prompt 系统指令的最佳实践、Few-shot 示例引导与 Zero-shot 直接提问的场景选择、思维链(Chain of Thought)逐步推理引导、复杂任务的分步拆解策略、输出格式控制(JSON/Markdown/表格)、避免幻觉与提升准确率的约束技巧、DeepSeek-R1 深度推理模式的

2026.05.12

162

26

DeepSeek本地部署与私有化方案
DeepSeek本地部署与私有化方案

面向有数据隐私需求的开发者与企业,讲解 DeepSeek 开源模型的本地化部署方案,涵盖 DeepSeek-R1 各蒸馏版本(1.5B/7B/8B/14B/32B/70B)的硬件需求与能力对比、Ollama 一键本地运行与模型管理、vLLM 高性能推理服务部署、llama.cpp 量化推理(GGUF 格式/Q4/Q8 量化)在消费级显卡上的实践、Hugging Face Transformers 加载与微调、Docker 容器化部署、多

2026.05.12

139

21

DeepSeek行业应用场景实战
DeepSeek行业应用场景实战

以实际业务场景为导向,展示 DeepSeek 在不同行业中的落地应用方案,涵盖代码开发辅助(代码生成/审查/重构/单元测试编写)、长文写作与内容创作(报告/文案/论文大纲)、Excel 数据分析与可视化建议、智能客服机器人搭建(意图识别/多轮对话/知识库检索)、RAG 检索增强生成实现企业知识库问答、合同与法律文本审查、教育领域个性化辅导,帮助用户将 DeepSeek 转化为切实的生产力工具。

2026.05.12

306

17

DeepSeek 与主流 AI 大模型对比评测
DeepSeek 与主流 AI 大模型对比评测

从多个维度对 DeepSeek 与市场主流大语言模型进行客观对比,涵盖模型参数规模与架构差异(MoE 混合专家架构)、中文理解与生成能力对比、英文与多语言表现、数学推理与代码能力基准评测(MMLU/HumanEval/GSM8K)、长文本处理与上下文窗口对比、API 定价与性价比分析、响应速度与并发能力、开源生态与私有化部署灵活性,帮助用户根据自身需求在 DeepSeek、ChatGPT、Claude、Gemini、Llama 等模型中

2026.05.12

141

12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
腾讯元宝使用手册
腾讯元宝使用手册

共0课时 | 0人学习

DeepSeek手册
DeepSeek手册

共0课时 | 0人学习

零基础精通 PS 视频教程
零基础精通 PS 视频教程

共268课时 | 115.3万人学习