9月3日美国东部时间下午,OpenAI在完成GPT-6 Astra公告撤下与重发后,更新了包括ARC-AGI-3与幻觉率在内的指标,并向受信任机构和安全审核用户先行开放。
OpenAI在9月3日美国东部时间下午推出GPT-6 Astra公告,但该页面上线后一度撤下,约两小时后恢复访问。期间及恢复后的版本中,Astra的部分评测指标发生调整,外界因此关注其成绩稳定性与可复现性。
多家信息源显示,Astra的幻觉率最初为4.2%,其后被改为2.0%,随后又恢复为4.2%;GPT-5.6 Sol的相关数值也出现由12.2%改为9.4%再回退的记录。ARC-AGI-3方面,有报道称媒体事先获得的数值为98.6%,而OpenAI后续公布的数字为99.99%;另一种表述则区分测试环境,给出定制配置下的99.9%和统一标准下的62.7%。竞品侧,Anthropic的Fable 5.1或其他Claude模型的部分数学成绩也被描述为先下调后回升,其中一处说法为87.8%、78%与83%。
OpenAI将上述变化解释为不同系统配置、测试条件和运行噪声带来的修正,目标是得到更接近实际可用性能的数值,并否认撤稿与基准成绩直接相关。公司还说明Astra在初期并未向全部用户开放,只有部分受信任机构及通过审核的网络安全用户能够访问;后续报道则提到Plus、Pro和Business用户在开放阶段获得额外的额度重置机会。技术材料显示,Astra在德州Stargate站点以超过10万张GPU进行预训练,并在训练中引入旧代际模型辅助新一代模型的过程。
此次情况发生在头部实验室频繁更新模型的阶段,评分常被用于产品定位、采购判断与市场传播。发布前夕,ChatGPT、Claude和Grok等服务出现大面积故障,部分用户将其与部署环节联系,但没有形成结论。围绕数据修订,行业内出现的意见集中在建立统一约束:成绩变更需同步公开环境差异、参数设定和可核验记录,Benchmaxxing式优化也再次被讨论。Astra的应用演示扩展到GUI操作、KiCad与Excel等工具,以及Blender建模、生成STL并发送至拓竹P1S的物理打印环节,显示其面向长流程任务而非单纯文本问答。