该更新基于千名开发者测试数据,旨在提升代码审批安全性并落实欧盟AI法案透明度要求,覆盖全球所有产品线及云调用场景。
人工智能公司Anthropic宣布对Claude产品体系进行两项关键安全升级:面向付费用户的Claude Code自动执行模式正式默认开启,同时在全系模型输出中嵌入机器可读的隐形水印与数字签名元数据。此次调整基于对1053名付费测试人员的长期对照研究数据,旨在解决人工审批流程中的效率瓶颈与安全风险,并响应欧盟人工智能法案第50条关于生成内容透明度的监管要求。
在代码执行安全方面,新启用的自动模式通过独立分类器实时审查工具调用,针对不可逆操作、破坏性指令及越权行为建立多层防护机制。测试数据显示,该模式成功拦截了89%的危险命令,而传统人工审批仅能识别14%的潜在威胁。研究指出,人类用户在面对权限提示时存在“无脑点击”现象,约97%的请求被直接批准,仅有3%被拒绝,且62%的用户曾主动选择“不再询问”以绕过检查。自动模式在连续触发三次拒绝或单会话累计二十次拒绝后会自动切换回手动审批状态,形成动态安全闭环。生产环境反馈表明,采用该模式的团队代码提交效率提升约25%,Adobe与Nuro等企业已将其设为默认配置。此外,针对自动分类器消耗的额外Token费用已被取消。
在内容溯源方面,自8月2日起,所有新发布的Claude模型生成的文本均包含人眼不可见的隐形水印,且该标记在复制、粘贴及部分编辑操作后仍可保留。对于SVG、PNG、JPG等图像文件,系统会附加符合C2PA标准(内容来源和真实性联盟)的数字签名元数据。此策略覆盖API、官网界面及Claude Code、Claude Tag等全线产品,通过AWS、Google Cloud或Microsoft Foundry调用的实例同样受文本水印约束。Anthropic表示正在开发配套检测工具并开放第三方接入能力。此前OpenAI虽曾研发类似技术但未正式上线,Anthropic此举标志着主流大模型厂商在生成内容标识领域的实质性落地。
此次双轨升级反映了行业在平衡生成效率与风险控制上的策略转变。自动模式通过算法替代低效的人工审核,解决了用户过度授权带来的安全隐患;而水印与元数据则构建了内容溯源的基础设施,有助于区分AI生成内容与人工创作。尽管检测工具尚在完善中,但这一标准化尝试可能促使更多云服务商与内容平台跟进采纳C2PA协议,进而改变全球生成式人工智能的合规基准。