智谱发布GLM-5.3-FlashX模型

9月18日 12:45
智谱在BigModel平台推出该模型,面向企业与开发者开放调用,依托10万张国产芯片完成推理优化,最高输出速度达200tokens,并承接Ox Alpha阶段积累的需求。

智谱在9月18日通过BigModel平台推出GLM-5.3-FlashX,API同步开放。对外披露的最高输出速度为200 tokens/s,模型标识为GLM-5.3-FlashX。该版本的主要使用者是企业与开发者,适用场景集中在需要较低等待时间和较高吞吐量的推理任务;其发布方式更像是对已有GLM-5.3-Flash服务链路的再加速,而不是单独公布一条全新参数规模的产品线。

GLM-5.3-FlashX的基础来自GLM-5.3-Flash。前者曾以代号Ox Alpha在全球开发者渠道中与外界见面,并在相近参数规模的大模型比较中形成使用记录,相关调用量随着反馈积累而提高。为应对更大的请求压力,智谱在10万张国产芯片组成的推理算力底盘上继续增加基础设施投入,并对服务端推理流程做调整。目前的外部接口以Model Key形式给出,文档地址指向BigModel平台的对话补全能力说明;对不想立即编写代码的用户,平台还提供体验中心入口用于初步测试。

这一更新的参考价值在于它展示了模型厂商在生产环境中的另一层竞争。除了评测分数和功能覆盖之外,生成速度会直接影响客服问答、多轮对话、代码补全和高频工具调用等业务体的用户体验与运维成本。把速度上限推向更高档位,可能缩短排队或补全周期。GLM-5.3-FlashX同时强调国产算力支撑,说明其供给结构也在与本地芯片生态绑定。接下来能否转化为企业选择依据,还要观察真实并发下的延迟分布、计费方式,以及已有GLM-5.3-Flash调用方迁移到新标识的成本。