高通展示第六代骁龙8至尊版配套Hexagon NPU

9月11日 00:01
这一单元随骁龙旗舰移动平台公开,面向端侧智能体的长上下文、跨应用协同、多任务并发与工具调用场景,并配套Element Accelerator及更大共享内存,用以减少数据搬运、降低延迟并改善能效。

2026年9月11日,高通通过官方渠道公布新一代Hexagon NPU,并称其属于第六代骁龙8至尊版系列移动平台的一部分。高通技术公司产品市场高级总监Cisco Cheng在署名文章中,把智能体AI概括为移动计算下一阶段的重点。该单元的定位不是单纯提高单项算力,而是把端侧智能体视为主要工作负载,围绕持续运行、低延迟响应和多模型协作组织硬件资源。

在该架构中,Element Accelerator承担针对Transformer类任务的加速职能,并与向量计算单元、标量计算单元形成分工:前者提供高吞吐AI运算能力,后者处理决策、路由与编排等控制逻辑。在内存层级上,更大的共享存储区域让模型状态、上下文缓存和KV-cache等数据停留在离加速器更近的位置,减少跨层搬运带来的带宽压力,使更长上下文、更多工具调用和更高并发任务下的响应保持平稳。

面向后续模型形态,高通还说明正与内存厂商和模型开发方推进混合专家模型的终端部署。以300亿参数规模的MoE为例,其路由机制可在每次生成一个词元时只激活约30亿个参数,相比密集模型降低实际参与计算的网络比例。围绕性能与功耗,材料中出现多组数值:一组数据将复杂任务响应速度描述为最高提升3倍,并将能耗描述为下降40%;另一组则将复杂任务响应描述为提升30%。在处理10万token以上上下文或长文本生成任务时,延迟降低数值也分别出现40%与45%。上述指标对应端侧AI由单轮问答扩展到连续智能体任务的应用路径。