OpenAI专家Noam Brown呼吁重构AI评估体系

6月11日 14:03
针对GPT-5.5等模型在标准基准测试中表现被低估的现象,核心研究员指出推理计算预算差异是造成数据偏差的主因,建议行业引入计算成本维度进行重新评估。

OpenAI核心研究员Noam Brown发布长文《大规模推理计算的启示》,提出当前以单一分数衡量人工智能模型性能的行业标准已过时。该观点基于GPT-5.5发布后的实际反馈与测试数据矛盾展开:尽管官方基准测试显示其较前代版本提升有限,但在用户实际使用场景中,当给予充足推理时间或计算预算时,模型在代数几何应用构建及代码生成等任务上展现出显著优势。Brown指出,现有评测体系未能向公众披露达成特定分数所消耗的推理成本,导致对模型真实能力的误判。

在技术细节层面,GPT-5.5的API定价策略与性能表现呈现非线性关系。数据显示,GPT-5.4 Pro每百万输入输出令牌的价格分别为30美元和180美元,而GPT-5.5对应价格降至5美元和30美元,价格差异达6倍。然而,在标准排行榜中两者常被置于同一量级比较,忽略了预算控制带来的本质区别。一旦限制计算资源,GPT-5.5在网络安全评估等特定任务中的优势被掩盖;若开放更多推理步骤,其表现较前代提升幅度巨大。例如在MRCR v2长文本测试中,新模型得分达到74.0%,远超旧版的36.6%,但该数据未纳入常规报告。此外,ARC-AGI测试显示,当单题推理成本从0.2美元提升至3万美元时,准确率与解题策略发生质的变化,说明单纯对比排名而忽略成本差异缺乏比较价值。

Brown进一步分析指出,顶尖模型在MMLU等基准测试中得分普遍超过88%,细微分差多源于统计噪声而非真实能力差距。强模型具有持续优化特性,其性能曲线随推理时间延长而上升,弱模型则很快触及天花板。学术界研究显示覆盖率与采样次数呈对数线性关系,但最新发现表明强模型在长推理周期内的递减效应显著减弱。GPT-5.5 Pro通过并行推理链设计,具备自动调用更多计算资源以应对难题的能力。针对上述问题,Brown提出三项改革建议:实验室发布模型时须公开性能与计算量曲线;基准测试应追踪推理用量或设定预算上限;安全评估框架需将计算资源作为核心变量。他特别警示,现有仅关注“默认状态”的安全测试存在隐患,无法应对国家级攻击者通过增加计算投入发起的复杂攻击。