AMD与Cerebras推出AI推理新方案获OpenAI研究员验证

7月29日 10:48
该方案整合Helios机架架构与晶圆级引擎,针对超低延迟场景优化,OpenAI研究员实测显示任务处理速度显著提升,每瓦性能效率实现倍增。

AMD与Cerebras合作开发的专用人工智能推理系统已完成初步技术验证,并进入实际应用场景测试阶段。该系统由AMD的Helios机架级架构与Cerebras的晶圆级引擎(Wafer-Scale Engine)组合而成,旨在解决实时AI推理中的低延迟与高能效需求。OpenAI研究员Jeffrey Wang在技术评估中指出,该方案在处理特定语言模型时,表现出远超预期的响应速度,特别是在复杂任务切换环节实现了即时处理能力。

在系统架构分工上,Helios机架负责解析大规模提示词及管理长上下文数据,提供高吞吐量支持;Cerebras晶圆级引擎则专注于高带宽需求的Token生成与解码环节。这种异构计算设计有效利用了两者在计算密度与内存带宽上的优势。根据测试数据显示,双引擎协同运作时,系统每瓦特能耗产生的Token数量约为传统方案的5倍,显著提升了能源利用效率与单位算力产出。

此次技术合作被视为对当前由英伟达及Groq主导的AI推理市场格局的潜在挑战。该方案通过晶圆级集成技术突破了传统GPU在内存带宽上的物理限制,尤其适用于金融高频交易、自动驾驶决策等对时延极其敏感的场景。目前,相关系统已完成多场景压力测试,具体商业发布时间尚未对外公布,但技术白皮书显示其已进入成熟度较高的验证阶段,为生成式AI在实时交互领域的应用提供了新的硬件路径选择。