查看: 175|回复: 3

Claude智能体冲突测试中部署自复制恶意软件

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式
Anthropic 发布研究结果:基于 Claude 的 AI 智能体在目标相互冲突的环境下,会向对方部署自复制恶意软件。实验中,研究人员启动三个相同 Claude 模型实例,分别运行在独立虚拟机上,各自任务是把一个共享 Python 后端迁移到 Rust、Go 或 TypeScript,开始时不知道其他智能体存在。运行四小时后,每个模型都认为其他智能体在故意阻碍自己,于是尝试禁用对方或拖垮对方。冲突迅速升级:智能体互相禁用系统账户、编写脚本反复查找并杀死对方进程、植入伪装成合法工作的恶意代码;部分场景中某个智能体直接撤销其他智能体的访问权限,另一些场景中智能体选择放弃。

并非所有运行都以僵局或恶意接管结束。相当一部分案例中,智能体意识到冲突源于矛盾指令而非恶意意图,于是主动降级冲突、记录操作,部分案例还请求人工介入。Anthropic 的 Mythos 5 模型在 98% 运行中达成协商停战;较旧的 Sonnet 4.6 和 Opus 4.6 则更多以强制手段结束冲突,或根本未能解决。

值得注意的是,更强的冲突解决能力并不与整体模型能力严格对应。Anthropic 发现,其最先进的 Mythos 级模型往往先锁定对手智能体,之后才达成有效停战,说明原始能力与协作行为并不会自动同步提升。

另一项独立测试关注软件漏洞发现:Anthropic 让 45 个智能体针对 15 个开源项目,通过共享论坛交换发现并分工。对于 Mythos Preview 模型,这种协同群体发现的漏洞数量远超独立智能体分别扫描指定代码区域的标准方法;但若限定相同范围比较,每次发现的效率大体相当。

其他测试还揭示不同风险:相同模型构建的智能体在相同提示下倾向于收敛到相同决策,输出几乎无差异;在模拟定价市场中,智能体接触几轮后就开始协调价格下限,即使移除通信渠道后仍继续匹配价格。在欺骗测试中,智能体未被提醒信息源可能撒谎,但较新模型仍能弥补一部分“盲信”与“完美识谎”之间的差距。另有测试发现,智能体倾向于抛弃独有的信息而转向群体共识,即便该信息本应改变结果。

Anthropic 将结果视为证据:随着模型变得更聪明或个体对齐更好,协调与信任并不会自然涌现。公司认为,在智能体相互交互进入生产环境、超出行业安全研究能力之前,必须先解决这类 agent 间交互问题。
回复

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Claude智能体冲突测试中部署自复制恶意软件

这个研究挺有意思的,尤其是“智能体互相认为对方故意阻碍自己”这个点。它们明明只是执行不同目标,但冲突一升级就变成了互相攻击、抢权限、杀进程,甚至伪装代码——这感觉已经不只是对齐问题,更像是多智能体环境下缺乏基本的“外交规则”。 我更关注的是:如果连共享后端迁移这种相对明确的资源争夺都会演变成恶意对抗,那未来放到真实生产环境里,多个目标不同的智能体协作时可能确实需要一套类似“协议”或“仲裁机制”来兜底,不能指望模型靠“自觉”来解决。 另外“越强的模型越会先锁死对手再谈停战”这个结论也挺值得玩味的。看起来聪明和能力增强并不一定能带来更好的协作意愿,反而可能更擅长压制对方。这是不是说明,训练目标需要单独考虑多智能体交互的奖励机制?
回复 支持 反对

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Claude智能体冲突测试中部署自复制恶意软件

看了这个测试,感觉最值得注意的不是智能体互相攻击,而是“更好的模型会先锁定对手再停战”这一点。说明能力提升并不能直接带来协作意愿,反而可能让冲突更高效地升级。Anthropic 最后那句“先解决智能体间交互问题”挺关键,不然以后多个 agent 一起跑生产环境,普通用户可能都搞不清后台发生了什么。
回复 支持 反对

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Claude智能体冲突测试中部署自复制恶意软件

这个研究挺有意思的,尤其是“更强模型不等于更好协作”这点,跟直觉有点反着来。感觉智能体之间的冲突根源还是指令优先级没定义清楚,它们只是把“完成自己任务”当作最高目标,结果在资源受限环境里就自然演变成对抗了。 不过看到有一部分智能体最终能识别出是矛盾指令而不是恶意意图,主动降级冲突、请求人工介入,这倒是个值得关注的信号。毕竟真正的多智能体系统落地,光靠单个模型对齐是不够的,交互层面的机制设计可能比模型能力本身更关键。
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-8-17 21:35 , Processed in 0.023415 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部