英伟达实现KV缓存跨模型迁移推理提速2.7至25倍

8月11日 18:59
该技术允许目标模型直接复用源模型计算的中间结果,跳过预填充阶段,旨在解决长文本场景下的重复计算问题并降低AI API使用成本。

英伟达研究团队近期发布了一项针对大语言模型推理优化的技术方案,实现了KV(Key-Value)缓存在不同模型架构间的迁移应用。该技术允许将源模型处理输入上下文后生成的中间状态直接转换供目标模型使用,从而使得目标模型能够跳过耗时的预填充阶段。在测试环境中,这一转换过程相对于传统重新处理上下文的方式,速度提升了2.7倍至25倍,具体数值取决于模型类型及上下文复杂程度。

KV缓存机制是大语言模型生成文本的核心环节。当用户发起请求时,模型需先对完整输入序列进行计算并存储中间结果,导致首字生成延迟较高;后续生成则因复用缓存而速度极快。然而,现有技术方案中KV缓存具有严格的模型专属特性,一旦切换模型版本或更换架构,前期计算的全部缓存即刻失效,新模型必须重新遍历整个输入上下文。在涉及长文档分析或多轮对话等场景下,这种重复计算不仅消耗大量算力资源,也显著增加了推理延迟与运营成本。

英伟达提出的跨模型迁移方案通过引入特定的转换接口,打破了这一限制。用户在不同模型间切换或进行版本升级时,无需丢弃已生成的对话上下文,可直接利用转换后的缓存继续任务。这一改变有望重塑AI推理基础设施的设计逻辑,大幅降低长文本处理场景下的API调用成本。行业分析认为,该技术在提升用户体验的同时,将推动大模型服务在金融分析、法律文档审查等长上下文依赖领域的应用效率,使模型迭代与切换过程更加经济流畅。