英伟达开源Nemotron-Labs-TwoTower双塔扩散语言模型

7月2日 00:55
该模型于7月1日发布,采用双塔架构将吞吐量提升2.42倍同时保持98.7%质量,支持商业开发并解决自回归生成效率瓶颈

英伟达于7月1日正式开源Nemotron-Labs-TwoTower扩散语言模型,旨在通过架构创新突破传统自回归模型在文本生成中的吞吐量限制。该模型引入双塔设计,将任务拆分为负责解析输入提示的上下文塔与执行并行生成优化的去噪器塔,以解决逐token串行处理带来的效率问题。这一技术路径标志着从单纯增加参数规模向优化推理架构的转变,针对大规模合成文本生成场景提供了新的解决方案。

在性能表现方面,基于双H100GPU的测试环境显示,该模型在默认配置下保留了基线模型98.7%的生成质量,同时将实际吞吐量提升至原来的2.42倍。模型具备三种解码模式选择权,包括扩散模式、模拟自回归模式及标准自回归模式,允许开发者根据任务特性在生成速度、质量与资源消耗之间进行调配。作为开放权重项目,Nemotron-Labs-TwoTower遵循NVIDIA Nemotron开放协议,明确允许商业用途的二次开发与应用部署。

尽管该架构在提升生成效率方面表现显著,测试数据也揭示了其存在的局限性。在代码生成和数学推理任务中,模型表现较原始基线略有下降,且运行环境对GPU显存容量存在特定要求。目前,人工智能行业正面临应用高频化与规模化的挑战,通过算法结构优化换取推理速度的策略逐渐成为研发焦点。Nemotron-Labs-TwoTower的推出为处理海量数据合成需求提供了工具参考,其双塔分离机制可能影响后续大模型在生成效率层面的技术演进方向。

该项目的开源性质降低了开发者的使用门槛,有助于推动相关技术在工业界的落地应用。相较于传统方法,这种架构调整在不牺牲过多精度的前提下显著提升了单位时间内的处理能力,对于需要批量处理文本数据的团队具有实际参考价值。随着更多开发者加入测试与调优,该模型的具体性能边界与适用场景将进一步清晰化。