该框架基于TorchSpec构建,支持128k长上下文与插件化配置,在国内首次提供涵盖训练至部署全链路的推理加速工具,旨在解决大模型自回归解码成本高企问题。
腾讯混元技术团队正式对外发布并开源端到端投机解码框架AngelSpec,同时公开Hy3-A21B模型的MTP与DFly drafter权重及对应训练代码。该举措旨在应对大模型规模扩张带来的自回归解码成本挑战,通过多方案协同机制与工作负载的异构适配,提升真实业务场景下的推理吞吐量。项目基于TorchSpec构建,支持128k长上下文训练环境及插件化配置,致力于提供从模型训练、架构设计到线上部署的全链路工具支持。
在核心架构层面,AngelSpec引入了名为DFly的新型块扩散框架。该设计结合混合目标条件编码骨干与前序条件自回归头,通过并行生成机制优化目标特征利用率与块内依赖建模。针对不同应用场景的文本特性差异,系统实施差异化训练策略:针对高熵、开放式的多轮对话任务,采用轻量且稳定的多token预测机制(MTP),结合训练时测试(TTT)技术与端到端总变差损失,以适配自回归展开中的状态分布;面对代码生成与数学推理等结构约束较强的任务,则利用专有块扩散模型强化长跨度可预测序列的挖掘。此外,框架内置动态验证机制,能够依据在线负载、硬件条件及前缀置信度实时调整验证深度,在计算资源消耗与吞吐效率之间寻求平衡,并通过D-cut机制解决高并发验证瓶颈。
性能测试数据显示,在Hy3模型系列的系统评估中,搭载DFly的方案在4至64的并发区间内均展现出显著优势。相比传统自回归解码基线,该方案在六大基准测试中的平均加速倍数介于1.98至2.40倍之间,平均接受长度达到4.79。针对对话场景,通过TTT技术修复训练与推理不一致问题后,平均接受率提升至66.4%;利用D-cut机制进行线上流量回放时,系统吞吐最高提升15.7%。作为国内首个提供完整工具链的开源方案,AngelSpec的发布为开发者提供了开箱即用的推理加速基础设施,有助于推动大模型工程化落地与高效推理技术的广泛应用。