智谱于8月26日开放该模型权重,并公布其第三方综合智能指数为57分;在匿名测试阶段,它以Ox-Alpha身份进入两个海外开发平台,并带动调用量达到新高。
8月26日,智谱将GLM-5.3-Flash(320B-A18B)纳入GLM-5序列,并将其界定为该序列首个原生多模态版本,同时公开模型权重。该版本此前以Ox-Alpha名称在OpenCode与OpenRouter开展匿名评估,中文社区也称其为“牛来”。在测试周期内,它对文本、图像和视频输入进行处理,调用量升至新高,并被描述为当周热门模型。
官方价格信息显示,标准档为GLM-5.3的1/10,促销窗口内降至1/20,与Claude Opus 4.8相比约为1/40;披露的单价包括每百万Token输入0.8元、输出2.8元、缓存命中0.23元。在Artificial Analysis Intelligence Index中,该模型获得57分,与Claude Opus 4.8的当前分数一致;智谱自研Z.ai Code Bench中,两者在编程任务上的表现被描述为相近。架构上,它采用稀疏注意力与线性注意力混合结构,并结合流形约束超连接;官方公布的数据显示,注意力计算量下降3.01倍,KV缓存缩减4.44倍,激活参数为18B、层数为45层,训练语料规模提到30T Token。
推理侧信息则集中在国产算力。团队表示,匿名阶段的大规模请求流量由国产芯片集群承接,并通过自研高带宽互联网络连接芯片;结合SGLang推理引擎、EPD分离式架构、ReplaySSM和混合缓存量化等方案后,端到端服务性能相对同一硬件基线提高3倍,硬件效率与单Token成本可达到主流英伟达GPU相近水平。发布后,权重在HuggingFace开放,API、在线体验和ZCode、AutoClaw、GLM Coding Plan等平台同步接入,面向开发者提供使用入口。