DeepSeek 联合北大发布 DSpark 推理框架

6月27日 15:47
该框架于6月27日上线,部署于DeepSeek-V4系列预览版服务,通过半自回归生成与置信度调度技术解决高并发场景下的推理延迟问题,相关代码及论文已在GitHub开源。

DeepSeek 与北京大学于6月27日正式联合推出 DSpark 推理加速框架,旨在突破大语言模型在高并发生产环境中的效率瓶颈。该框架已实际部署在 DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 的预览版服务引擎中,通过引入推测性解码技术,将单用户生成速度相比原有 MTP-1 基线提升60%至85%,相关技术论文与全栈代码 DeepSpec 已在 GitHub 开源。

DSpark 的核心机制在于结合半自回归生成架构与置信度调度策略。传统自回归方式需逐 token 串行生成,导致延迟随输出长度线性增长;而纯并行方案虽能一次性产出候选 token,却因缺乏内部依赖建模导致后续 token 接受率快速衰减。DSpark 通过轻量级草稿模型预先生成候选序列,再由目标大模型进行批量并行验证与接受,既保留了并行计算的高吞吐优势,又利用置信度调度机制动态调整生成策略,确保在无损输出分布质量的前提下显著降低端到端延迟。技术报告《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》详细阐述了该混合架构的设计原理,并指出其新机制同样适用于 Qwen、Gemma 等其他模型体系。

此次更新属于工程落地层面的迭代,而非 DeepSeek-V4-Pro 核心模型能力的重新训练。在行业对比中,当前主流推测解码方案分为依赖强建模的自回归式草稿(如 Eagle3)与生成延迟无关但接受率受限的并行式草稿(如 DFlash)。DSpark 试图在两者间寻找平衡点,通过半自回归机制缓解长候选块后缀被大量拒绝的问题。该框架的发布标志着大模型推理优化从单纯依赖算力堆叠转向算法与架构层面的精细化改进,为高并发场景下的实时响应提供了新的技术路径。