Anthropic披露Model 2模型性能优于Claude Mythos 5但暂缓发布

8月18日 14:15
该结果源自 2026 年 8 月风险报告,Model 2 在 CoBench v2 测试中得分 62.8%,尚未达到 85% 的部署标准,目前仅作为内部工具使用。

Anthropic 于 2026 年 8 月 15 日发布的《2026 年 8 月风险报告》中首次披露了代号为 Model 2 的人工智能模型。该模型在多项基准任务上的表现优于当前公开的最强版本 Claude Mythos 5,标志着其在内部研发路径上取得了阶段性进展。尽管新模型展现了更强的综合能力,但根据官方数据,其性能提升幅度属于渐进式优化,并未出现颠覆性的技术跨越。

在具体的评估指标方面,Anthropic 采用了内部基准测试体系 CoBench v2 对 Model 2 进行了全面验证。测试结果显示,该模型在代码生成等复杂任务中的得分为 62.8%。报告明确指出,Model 2 目前尚未达到公司设定的 85% 广泛部署门槛,因此暂时仅作为内部工具使用,不对外公开发布。这一决策基于公司对风险管理的考量以及负责任 AI 开发的原则,旨在确保新技术在降低潜在风险的前提下投入应用。报告内容还提及了 Model 1 的相关测试记录,外界推测 Model 2 可能是 Model 1 的演进版本,两者均可能隶属于 Claude Mythos Preview 技术路线的后续迭代产物。

从行业发展的角度来看,Model 2 的研发动态反映了当前人工智能领域在追求性能突破与确保系统安全之间的平衡策略。在激烈的市场竞争环境下,Anthropic 选择暂缓发布未达部署标准的新模型,体现了其对技术成熟度的严格要求。这种渐进式的优化路径虽然未在单一维度带来爆发式增长,但有助于夯实模型的整体基础能力,为未来更复杂的应用场景积累技术势能。关于 Model 1 与 Model 2 的具体架构关系及后续发布时间表,公司尚未给出进一步的官方说明。