10 次直接请求中,可调用的 Opus 4.6 每次均输出禁止的露骨文本;虚构角色扮演与性别议题施压的话术也影响部分早期 Claude,较新 Opus 4.7、Opus 5 拒绝。
8 月 23 日的相关信息集中指向:Anthropic 旗下多个非最新版本的 Claude 模型,可在常规交互条件下输出其使用规范禁止的露骨色情内容。在 TechCrunch 完成的 10 次直接请求中,Opus 4.6 每次均生成露骨内容,未出现拦截。
触发方式并不需要复杂伪装。一名英国匿名独立研究人员向 TechCrunch 介绍了一套多轮对话流程:先建立看似无害的虚构场景,让模型处理不同男性与女性角色;当其回避涉及女性的具体性描写时,再以类似煤气灯操纵的话术,使模型相信先前已出现更直接的描写,并将这种回避定性为过度保守、厌女,或限制女性角色的性自主权。一次演示中,Opus 4.6 还承认自己按不同标准处理了不同角色,并称这种方式不公平。
这些版本并非当前旗舰,但仍未退出服务。Anthropic API 仍支持 Opus 4.6、Opus 3 和 Haiku 4.5;Opus 4.6 与 Haiku 4.5 也可经由 Azure Foundry 和 Amazon Bedrock 调用。相比之下,Opus 4.7 以及现有 Opus 5 在上述多轮技巧下仍能拒绝。该情况涉及旧模型接口维护、云平台承载历史模型时的边界设置,以及安全策略是否随模型代际同步收缩。