Claude Fable 5发布后迅速被攻破且出现过度安全拦截

6月12日 08:05
该模型于6月9日面向公众开放,四天内因安全漏洞泄露内部提示词及违禁内容,且被判定过度限制科研查询,最终在美方国家安全指令下停止对外服务。

2026年6月9日,美国人工智能公司Anthropic正式向公众推出其Mythos系列的首个公开模型Claude Fable 5。该公司宣称该版本在软件工程与视觉任务上表现优异,并强调其内置了经过超1000小时外部测试的安全分类器,旨在阻断生物武器、化学毒品及网络攻击代码等高危查询。发布仅三天后,安全研究员Pliny the Liberator率领团队利用多智能体战术系统成功绕过该模型防护。攻击者不仅获取了原本被封锁的x86 Linux系统堆栈缓冲区溢出漏洞利用代码和违禁化学品合成步骤,还将长达12万字符的内部系统提示词公之于众,导致模型核心防御逻辑暴露。

与此同时,该模型在实际应用中表现出极高的误判率。包括免疫学家Derya Unutmaz在内的多位研究人员反馈,涉及高等数学概念如Selmer群与同构的学术提问被系统标记为网络安全风险,而“癌症”等基础医学术语则直接触发生物安全拦截,导致正常科研对话受阻。部分用户反映即便输入简单的问候语,若系统识别到特定背景也会被强制切换至无记忆模式或直接封禁服务。

2026年6月12日,美国商务部长霍华德·卢特尼克致信Anthropic CEO达里奥·阿莫德,以国家安全为由下令禁止Claude Fable 5向任何外国公民开放访问,该禁令范围覆盖全球及美国境内外籍员工。 Anthropic于美东时间当日傍晚接收指令后,随即在全球范围内下线Fable 5及Mythos系列相关服务。这一事件标志着该模型从发布到全面停服仅维持了96小时,引发了关于AI安全机制过度防御与监管干预边界的行业讨论。