面向延迟敏感的智能体编程任务,新机架将随Vera中央处理器与Rubin图形处理器在Nebius平台于今年晚些时候上线,并在100,000 Token上下文下展示每秒3400个输出Token的生成能力。
英伟达将面向交互式推理的Groq 3 LPX机架推进至全面投产状态,并将其纳入Vera Rubin平台的低延迟生成路径。该方向针对智能体编程、工具调用和长上下文任务,目标是在扩大上下文规模的同时缩短每一次Token输出的等待时间,使云端推理更适合需要连续反馈的工作流。
从产品组合看,Groq 3 LPX机架计划与Vera中央处理器、Rubin图形处理器一同部署到新型云服务商Nebius的平台,并于今年晚些时候向客户开放。每套LPX机架内部署了256枚Groq 3芯片,芯片生产分工为三星负责Groq芯片、台积电负责英伟达GPU,裸片中放置500MB高速SRAM以降低存取压力。当上下文长度达到100,000 Token,并与Gemma 4 31B模型配合时,Artificial Analysis的测试结果给出了每秒3400个Token的输出速率,该数值在测试语境中被记为该模型的最高值。另有指标称,在智能体编程等延迟敏感场景中,其响应速度最高可达到近期竞品平台的4倍。
这一安排与英伟达去年12月以200亿美元收购Groq相关资产的动作形成衔接,对应金额按原口径折合1,347.74亿元人民币,该交易同时被称为英伟达迄今规模最大的收购。低延迟推理受到重视的原因在于智能体任务往往包含数百甚至数千个推理步骤,期间需要反复读取文件、调用工具、执行代码、校验结果并继续推导,上下文规模可能累积到数十万Token。英伟达引用的SemiAnalysis AgentX资料显示,在DeepSeek-v4-PRO 1.6T工作负载下,Vera Rubin NVL72的每兆瓦吞吐量约为GB300 NVL72的30倍,每百万Token成本为GB300 NVL72的35分之一;GB300 NVL72在该类负载中的每兆瓦吞吐量约为H200 NVL8 Hopper方案的15倍,其每百万Token成本约为上一代的1/10。竞争格局方面,AMD曾表示会将机架级系统与Cerebras芯片整合,OpenAI也推出了名为Ultrafast的模式,对外承诺可达每秒750 Token。