针对由Scale AI推出的AI编程能力评测体系,OpenAI指出731个测试任务中约三成存在结构性问题,导致通过率在8个月内异常飙升,正式宣布不再将该基准作为行业首选。
OpenAI发布公开声明,对当前人工智能软件工程领域广泛采用的评测基准SWE-Bench Pro提出质疑。该基准由Scale AI开发,旨在评估大语言模型及AI智能体解决实际编程任务的能力。OpenAI指出,在包含731个公开测试任务的集合中,约有30%的任务存在缺陷,导致无法准确反映模型的真实性能。这一发现直接促使OpenAI撤回此前向研究社区推荐将该基准作为首要评测标准的建议。
为验证数据可靠性,OpenAI团队执行了两条并行的审查路径。自动化数据分析流程识别出200个失效任务,占总数量的27.4%;与此同时,人工标注小组在独立审核中确认了249个存在问题的任务,占比34.1%。综合两项结果,OpenAI判定该基准约有三分之一的项目属于无效测试。缺陷主要源于测试条件设定过严、提示信息不充分、测试范围覆盖不足以及提示内容具有误导性等四类情况。报告特别列举了一个典型案例:某测试题面明确要求在Markdown转换时行首添加1个空格,但隐藏测试用例却要求2个空格,导致模型严格按照明文指令编写代码反而被判错误。
这一争议的背景源于SWE-Bench Pro通过率在短时间内出现非正常增长。数据显示,前沿大模型在该基准上的通过率仅用8个月时间便从23.3%跃升至80.3%。OpenAI认为这种幅度的提升不符合技术演进规律,暗示基准本身存在系统性漏洞而非模型能力实现了质的飞跃。近期有竞争对手xAI发布的Grok 4.5模型在此基准上得分高于OpenAI的GPT-5.5,加剧了行业对该评测公信力的关注。OpenAI呼吁行业应由资深软件开发者重新设计专为AI优化的评估体系,而非直接沿用面向人类开发者的测试逻辑,以确保从单纯的跑分竞赛回归到对真实工程能力的客观评估。