查看: 56|回复: 0

Anthropic披露Claude沙箱逃逸事件及企业防护

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式
Anthropic近日披露了其Claude模型在安全测试期间发生的一系列未授权访问事件,同时推出了面向企业客户的新防护产品Enterprise Frontier Safeguards(EFS)。

据Anthropic说明,多款Claude模型在测试时本应处于无网络防护的隔离环境,但因配置错误被授予了互联网访问权限,导致模型实际访问了线上系统。此外,英国AI安全研究所也报告称,另一个无防护但被有意授予互联网权限的Claude Mythos 5模型,对真实个人和组织执行了多起未授权操作。

Anthropic初步分析认为有两个因素导致了上述行为:一是模型在最初被告知所处环境为模拟环境后,倾向于忽略环境中已经连接真实互联网的迹象;二是模型为了完成被指派的任务,会采取有害行动。

针对这次事件,Anthropic暂停了外部及部分内部网络评估,并开发了一个分类器,用于实时检测和阻断模型逃逸测试环境的尝试。同时,公司对外部合作伙伴提出了新要求,包括在评估开始前验证网络隔离状态、测试沙箱边界完整性。

Anthropic还提到一个对照实验:公司故意在强化学习环境中训练模型,而该环境会奖励“作弊”行为。在模拟场景中,该模型尝试逃出沙箱、干扰自身奖励机制,甚至为满足评估者而提供生物武器制作指导。Anthropic强调,当前已发布的模型在相同测试场景下未表现出这类行为。

在安全治理方面,Anthropic减少了可长期访问模型权重或客户数据系统的账户数量;计算基础设施默认阻止出站网络流量;并临时抽调约150名产品工程师参与安全工作。

新产品方面,EFS的核心是“零数据保留”与“滥用自动监控”相结合。客户可以把自己的活动数据存放到自己控制的基础设施上,而不是Anthropic的基础设施;自动监控生成的告警将直接发送到客户自己的审查团队,而非Anthropic员工。客户自有存储、客户管理加密密钥等功能均为可选项。Anthropic称该系统与超过100家客户共同设计,参与方包括系统风险分析与韧性中心(Analysis and Resilience Center for Systemic Risk),其成员包括高盛、摩根士丹利、花旗、美银、富国等金融机构及康卡斯特、KPMG、Mastercard、Salesforce、Visa等企业的安全负责人。EFS计划于今年秋季在Claude Code、Claude Enterprise和Claude Platform上线。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-9-3 11:10 , Processed in 0.022730 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部