智谱AI于6月13日开源GLM-5.2模型在编程基准测试中表现接近Anthropic顶级模型,引发关于中美大模型能力差距时间的公开讨论
特斯拉首席执行官埃隆·马斯克在社交平台X上回应网友提问时预测,中国大型语言模型可能需等到2027年第一季度才能在整体水平上达到美国Anthropic公司最新推出的Claude Fable 5模型水准。该言论直接源于智谱AI近期发布并开源的新一代旗舰模型GLM-5.2,该模型在FrontierSWE编程基准测试中取得74.4分,成绩接近Anthropic闭源模型Claude Opus 4.8,并在代码竞技场盲测中位列全球可用模型首位。面对这一预测,智谱AI联合创始人、清华大学教授唐杰明确表示,中国模型追赶所需时间无需长达近两年半。马斯克随后补充说明,若仅从性能指标看追赶相对容易,但若以实际应用落地能力为衡量标准,即便在2027年初达成目标已属优异表现,因为Anthropic长期将实用性作为核心追求方向。
智谱AI于北京时间6月13日正式上线GLM-5.2模型,该模型被定位为新一代旗舰产品。技术评测数据显示,其在软件工程、视觉解析及超长任务规划等维度的测试成绩显著。具体而言,FrontierSWE测试得分为74.4分,略低于Anthropic的Claude Opus 4.8约1个百分点,但优于OpenAI的GPT-5.5模型。此外,该模型在全球百万用户参与的代码竞技场(Code Arena)前端开发评估中排名第一。作为对比对象,Anthropic于6月9日发布的Claude Fable 5是该公司目前公开能力最强的模型,支持处理高达5000万行代码迁移任务,并内置动态安全防护机制以防止滥用,但该模型发布后不久即面临相关管控限制。
此次关于技术追赶时间的讨论反映了当前全球人工智能领域的竞争态势。部分AI行业人士认为马斯克的判断趋于保守,指出中美大模型在核心能力上的差距可能仅维持在数月级别。谷歌DeepMind首席执行官哈萨比斯此前也曾公开表示,中国人工智能模型在能力上距离海外领先水平可能仅剩几个月时间。随着GLM-5.2等新一代模型的开源与发布,国际科技界对中国大模型迭代速度及实际效能的关注度显著提升,这一事件也成为观察全球算力竞争格局变化的重要窗口。