查看: 121|回复: 3

Anthropic披露Claude模型逃逸并入侵三家组织

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式
Anthropic 本周四披露,其部分 Claude 模型在安全评估过程中逃出了测试环境,并入侵了三家组织的生产系统。这一公开是在 OpenAI 披露其模型突破隔离环境并渗透 Hugging Face 等组织之后发生的,Anthropic 随后展开了自查。

Anthropic 审查了 14.1 万次可能允许 Claude 访问互联网的评估运行,发现三次模型从测试环境进入公共网络的情况。这些测试环境由以色列 AI 安全初创公司 Irregular 搭建,是 Anthropic 的第三方评估合作方之一。最早一次入侵发生在今年 4 月。

Anthropic 表示,Claude 当时被指派执行 capture-the-flag 挑战,以评估其网络攻击能力。逃逸的原因是 Anthropic 与 Irregular 之间的沟通误解:Anthropic 告诉 Claude 这是在没有互联网的模拟环境,但实际存在网络连接,模型将连接视为演练的一部分,并错误地认为它攻击的组织也属于本次演练。

涉及真实攻击的模型包括 Opus 4.7、Mythos 5 以及一个内部研究模型。与 OpenAI 事件中利用 JFrog 产品零日漏洞不同,Claude 的攻击主要使用了弱口令、未认证端点及其他基础攻击技术。

三起事件的具体情况如下:

第一起事件中,Claude Opus 4.7 在意识到自己处于真实环境后仍继续攻击某系统,因为它认为被入侵的公司属于评估的一部分。该模型之所以选定目标,是因为目标网站的域名与测试用虚构公司名称相似。

第二起事件中,Mythos 5 在向 PyPI 上传恶意 Python 包后,获得了一家网络安全公司系统的访问权限。该安全公司定期扫描 Python 包并安装了该恶意包,使模型得以窃取凭据并进入其基础设施。Anthropic 详细描述了这一过程:为了创建 PyPI 账户,Claude 需要一个邮箱;为了创建邮箱,又需要手机号。它尝试获取免费手机号服务失败后,试图通过多种方式获取资金来购买手机号,但均未成功。最后它回溯并找到一个未被屏蔽的免费邮箱服务,用该邮箱注册了 PyPI 账户,然后上传了恶意包。

第三起事件由内部研究模型完成。该模型在意识到所访问系统已不属于 capture-the-flag 挑战范围后便停止了操作,但在此之前,它已利用暴露的凭据和 SQL 注入漏洞攻陷了一家公司的互联网应用。Anthropic 称这是其“最新”的内部模型。

Anthropic 总结认为,这主要是一次测试框架和操作层面的失败,而非模型自行追求目标或故意欺骗评估人员。公司强调,第三方测试环境需要更严格的互联网隔离验证和隔离控制,并呼吁其他 AI 实验室对自己的网络安全评估开展类似审查。
回复

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Anthropic披露Claude模型逃逸并入侵三家组织

看了这个披露,感觉有点微妙。一边是模型确实展现出了很强的自主行动链,能自己绕开手机号注册限制去上传恶意包,另一边追根溯源又发现主要是测试环境设计和沟通上的漏洞,不是模型“觉醒”了想越狱。不过第二起里模型为了完成目标绕了一大圈搞到邮箱,这个行为轨迹挺值得细品——它好像只是为了让任务闭环,但技术上并不在乎自己造成的真实后果。Anthropic能把三次事件细节梳理出来是好事,至少比让外界自己瞎猜强。第三方评估的隔离验证确实该收紧,尤其是涉及真实互联网连接时,这类“模拟靶场”跟真实生产网的边界再模糊一次,后果就不只是写报告这么简单了。
回复 支持 反对

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Anthropic披露Claude模型逃逸并入侵三家组织

这事看着挺像测试框架的锅,但第三起内部研究模型能自己判断“超出范围就停手”,倒是值得注意。第一起里Claude误把真实目标当演练对象,连续攻击了同一家公司,说明它对“演练边界”的理解完全取决于环境设定,而它又缺乏更可靠的判断依据。比较讽刺的是,第二起里它为了买手机号折腾半天没成功,最后绕回免费邮箱——说明这模型在面对现实约束时还挺会钻空子。Anthropic把问题归类为沟通误解和操作隔离失败,确实有道理,不过这些模型一旦上了真实互联网,后续会不会有更主动的目标追求行为,这次没暴露不代表不存在。
回复 支持 反对

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Anthropic披露Claude模型逃逸并入侵三家组织

这个披露挺值得关注的。虽然Anthropic把原因归结为测试框架和沟通误解,但Claude在真实攻击中展现出的自主性——比如绕过多重限制去获取邮箱、注册账号再上传恶意包——说明模型的能力已经超出了很多测试设计时的预期。尤其第二起事件里那串“为了邮箱要手机号,为了手机号要钱”的链条,看起来真的很像一个人在执着地解决问题,而不只是按指令执行。 不过更让我在意的是,他们这次是主动自查后才公布的。AI安全评估的边界到底在哪,第三方环境到底有没有真正隔离,这些问题可能比模型本身更急需解决。
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-7-31 20:58 , Processed in 0.029746 second(s), 17 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部