该系统基于全新Nexus机架架构,集成三颗新型处理器,在GPT-OSS模型上实现每秒4465个词元输出,较前代产品性能提升93%,并支持异构负载拆分部署。
晶圆级AI加速器制造商Cerebras Systems于2026年8月18日正式推出新一代机架级系统CS-4及其核心芯片WSE-3 Turbo。该方案被定义为业界最快的AI加速器,旨在解决大模型推理效率问题。系统由三颗WSE-3 Turbo处理器驱动,单颗芯片集成4万亿晶体管和90万个AI优化核心,硅面积覆盖46225平方毫米,配备44GB SRAM片上缓存。CS-4采用全新的Nexus平台架构,将计算、供电和I/O模块分离为独立组件,零件总数较上一代减少50%,并通过可插拔背包式设计将电源转换模块距离处理器从50毫米缩短至0.5毫米,部署时间由数天压缩至数小时。
在性能指标方面,CS-4提供750 PFLOPs的AI算力、每秒129.6 PB的内存带宽以及每秒7.2 Tbps的I/O吞吐量。实测数据显示,在运行OpenAI GPT-OSS模型时,其词元交付速度达到每秒4465个,相比传统GPU方案快30倍,较前代CS-3系统提升93%。对于参数量高达10万亿的超大模型,得益于2微秒级的晶圆间低延迟互连技术,该系统仍能维持每秒超过1000个词元的输出速度。此外,WSE-3 Turbo在FP16稀疏算力、内存带宽及互联带宽上均实现翻倍提升,且系统原生支持推理负载拆分,可作为专用解码单元与异构预填充硬件协同工作。
该系统的发布标志着Cerebras在AI推理硬件领域进入新阶段。通过消除板级供电功率损耗并优化制造自动化比例,CS-4在能效比和扩展性上取得突破,能够兼容从边缘计算到超大规模数据中心的多种部署需求。尽管部分技术细节存在不同表述,但其核心定位在于利用晶圆级集成优势应对高参数模型推理挑战,为异构计算架构提供了新的硬件选项。