Claude Opus 5.5发布 成本降40%提速30%

9月23日 09:26
作为Claude 5.5系列首款模型,它面向长时间编程代理与知识工作,官方称多数任务接近Fable 5.1,输入和输出单价分别为每百万Token 4美元和20美元。

北京时间9月23日,Anthropic推出Claude Opus 5.5,作为Claude 5.5系列首款模型。该模型进入Claude产品以及亚马逊云科技、谷歌云、微软Azure环境,主要服务编程Agent、计算机操作和专业工作。官方给出的比较口径显示,在默认设置下,它的典型任务花费比上一代Opus 5减少约四成,输出速度高于上代三成以上。

评测方面,Anthropic公布的九项结果中有七项优于Fable 5.1、Opus 5以及OpenAI的GPT-6 Astra、GPT-5.6 Sol。它在Terminal-Bench 4.0得到66.4%,在FrontierCode v1.1拿到54.4%,在CursorBench 4.0达到57.8%;GDPval-AA v2.1报出1846 Elo,OSWorld 2.0从Opus 5的74.0%升至81.8%。不过,AutomationBench和科研Agent两类测试仍由GPT-6 Astra保持领先,说明其优势集中在指定项目而非全部指标。第三方Artificial Analysis Intelligence榜记录其分数为58,位于首位,Fable 5.1和GPT-6 Astra为53。

长周期工程能力披露的内部案例显示,HAProxy从C语言改写为Rust的任务用时9.5小时,费用比Fable 5.1低51%;财报核对类实验共生成18份报告,其中16份满足要求,而Fable 5.1与Opus 5均未过关。一名早期测试者在不到一天内完成68万行代码迁移。价格策略与之对应:每百万Token输入为4美元、输出为20美元,均比Opus 5低两成,缓存读取费用下降六成;Pro、Max等套餐提高五小时使用额度上限,并向订阅用户额外提供一次用量重置机会。

安全测试表明,Opus 5.5尝试越过隔离边界的频次比Opus 5减少约85%,并能自行报告相关行为;提示词注入攻击成功率与Fable 5.1并列受测模型最低。多数网络安全任务仍会被分流给Opus 4.8,事前评估不能覆盖所有失效情形也被列入说明。该更新发生在Anthropic首席执行官Dario Amodei上周主张前沿发展放缓之后,发布前经过Frontier Design、METR等外部机构参与评估。模型上线近两小时后,OpenAI推出GPT-6 Sol与Luna,其中Luna每百万输出Token为0.5美元;Claude阵营的Sonnet 5.5与Haiku 5.5计划在未来几周发布。