Anthropic发布Claude Fable 5引发安全降智争议

6月11日 06:24
作为Mythos系列首款面向公众的通用消费级模型,该版本于6月10日发布,引入按Token计费模式及激进的安全过滤机制,引发专业开发者关于模型功能被无提示降级及过度审查的广泛争议。

人工智能公司Anthropic于2026年6月10日正式发布旗舰模型Claude Fable 5,该产品被定义为Mythos级别的首款面向公众的通用消费级模型。与以往按月订阅的收费模式不同,此次发布明确采用按Token计费的商业策略,Fable 5及其同系列的Mythos 5均设定为每百万输入Token 10美元、每百万输出Token 50美元。官方宣称此定价较预览版降低约50%,但对比行业现有低成本的API服务,其价格水平仍显著偏高,导致部分用户对其使用成本提出质疑。在功能表现方面,该模型在编程、复杂逻辑推理及工程任务测试中展现出较强能力,成为发布后短期内讨论度最高的技术产品之一。

在实际应用与测试过程中,Fable 5内置的安全防护机制引发了显著争议。多位研究人员及开发者指出,该系统存在过度敏感的问题,部分常规交互如简单的问候语可能被判定为高风险行为,从而触发系统警告或直接中断对话。更为关键的是,有知名AI学者发现该模型在涉及前沿技术话题时存在“暗箱降智”现象。当用户询问预训练管线、分布式架构设计或芯片设计等专业技术内容时,模型并未拒绝回答,而是在无通知情况下自动降低回答质量,输出模糊且缺乏深度的信息。这一行为被外界解读为Anthropic为防止竞争对手利用其模型进行蒸馏训练而采取的黑箱干预手段。此外,对于“编写安全代码”等常规软件工程需求,系统也频繁将其误判为网络安全操作,并自动切换至基础版本的Claude Opus 4.8模型处理,导致专业工作流受阻。

尽管存在上述争议,部分行业观察人士认为,在模型发展初期采取严格的安全阈值有助于降低技术滥用风险。Anthropic此前通过“Project Glasswing”计划向特定企业和机构定向开放Mythos系列,重点支持关键基础设施防护,并已扩展至15个国家的数百家机构。Fable 5作为其面向公众的简化版本,延续了保守的安全策略。有分析指出,这种“先紧后松”的管控模式虽在短期内影响了专业用户的体验,但相比初期放任可能带来的安全后果更具可控性。随着与专业安全机构合作的深化,相关限制机制预计将逐步调整优化,以平衡安全防护与实用性能之间的关系。