OpenAI 自研 Jalapeño 测试超 GB300

8月26日 01:03
披露信息覆盖大模型推理,使用 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T,并对照 GB200 与 GB300,列出吞吐、延迟、功耗。

OpenAI 将首款定制推理芯片 Jalapeño 的第一轮实测数据纳入公开视野。相关公开材料将其定位为面向大模型推理的基础设施部件,对比系统包括英伟达 GB200 与 GB300。公开口径覆盖吞吐、延迟、功耗以及单位电力可生成的 Token 数,测试样本包含中型 MoE 模型与万亿参数模型。

给出的测试条件中,公开基准 InferenceX 被统一为 8K 输入、1K 输出,并使用标准单 token 预测,推测解码保持关闭状态。参评模型包括 GPT-OSS 120B、DeepSeek R1 670B 与 Kimi K2.5 1T。在列出的数值中,GPT-OSS 120B 场景下的 Jalapeño 每秒 Token 数为 1459,GB200 对应 535;另一项任务耗时记录为 1.65 秒,GB300 为接近 6 秒,两者相对差距被记为 3.6 倍。还有段落指出,当 GB300 处于最快解码速度时,Jalapeño 的吞吐仍可达到其 104.3 倍。

功耗与能效部分给出了两组可比数字:Jalapeño 的标称功耗为 700W,GB300 为 1400W。SemiAnalysis 的实验记录在 GPT-OSS 120B 运行下给出另一组数值:Jalapeño 每兆瓦电力可产生 5300 万个 Token,GB200 NVL72 约为 1000 万个。其他汇总性表述则把改善幅度分为三项:每瓦特 AI 工作负载提高 1.5–1.9 倍,端到端延迟缩短 1.7–3.6 倍,高度交互式工作负载的性能增益为 2.1–4.1 倍。另一组架构描述还把每瓦 HBM 带宽记为 22GB/s,并分别给出相当于 Rubin 的两倍与 GB300 的近四倍。

开发节奏部分记录了设计至流片用时九个月,低于行业平均 18–36 个月的周期;未发布的 GPT-Astra 被接入芯片设计流程,外部将其推测为 GPT-6。结构层面的记录包含 SIMD 单元面积下降 8%、矩阵引擎面积缩小 10% 两项,主计算芯片面积则达到 840 平方毫米。器件层还出现 6 颗 HBM4 存储、顶部 I/O 小芯片互联等描述,并有指标称 FLOPs 与 Rubin 持平,能耗仅为对方的 38%。

行业背景上,这类器件通常服务于模型公司对算力供应链的再布局,目标是让软件栈与底层电路更早协同。同期信息中也出现小米、苹果等公司的自研芯片消息,显示数据中心与终端两侧都在增加专用算力投入。若上述实验室指标能够迁移到生产环境,推理服务的单位成本、供应商组合与采购议价都可能随之调整。