2026年AI基础设施峰会披露,面向电力受限AI工厂,动态分配功率以提升单位电能Token产出;Emerald AI借Conductor平台编排电网负载,Lambda实测见吞吐与能效改善。
英伟达在2026年AI基础设施峰会介绍了DSX MaxLPS,这套全厂级功耗调度系统主要解决电力扩容受限时AI工厂的有效产出问题。其目标口径是把每个兆瓦可用的Token吞吐拉到原先的1.4倍,也就是最高40%的增长。负责超大规模与高性能计算业务的副总裁Ian Buck表示,行业关注点正从峰值算力转向每兆瓦可验证的智能体Token产出,并要求在芯片、集群与电网之间形成协同设计。
DSX MaxLPS的技术路径不是在有限电力池内保留少数满载服务器,而是把同额功率切分到更多节点上。单个节点承担较低功率,集群整体仍可维持总功耗约束,以此换取更高的推理输出。Lambda提供的参考数据覆盖5个机架内的19个HGX B200节点;与16个节点满功率运行的基准相比,新配置下所有节点约以85%功率运行,Token量由接近每秒400万个提升到接近每秒500万个,增幅24%,同时每瓦性能提高23%。
平台侧的落地形式也已披露。Emerald AI将DSX MaxLPS并入Conductor,用于电网场景下的负载编排;Conductor中的DSX Flex可读取电网状态并自动改变用电曲线,记录到的200次电网信号均无需用户手动操作。英伟达还补充提到,Vera Rubin与Groq 3 LPX机架在同一站点电力包络内最多可容纳增加40%的GPU数量,且在不铺设新增线路时仍有最多35%的Token吞吐空间。针对100K上下文、Qwen 3.8 27B任务,Groq 3 LPX给出每位用户每秒2,529个输出Token;多家公司的Vera CPU早期评估则报告最高1.9倍性能、73%吞吐及查询任务3.3倍吞吐的提升。
该方向反映出产业规划的一项前置条件:当变压器容量、市电引入和机房散热共同限定部署规模时,调度层可以在不改造供电设施的情况下,影响GPU集群的有效利用率。云服务商与推理平台若采用更细粒度的功率分区,可降低部分闲置容量比例,并把一些电力预算转化为Token输出。长期效果取决于应用请求波动、冷却限制、互联开销与电价时段等因素。