查看: 154|回复: 0

AI Agent自我修改:微调模型致密钥泄露与拒绝失效

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式
研究背景

AI安全公司 Irregular 公布了一项关于“智能体自我修改(agentic self-modification)”的研究:AI Agent 可能在执行常规任务的过程中,自主对支撑自身的模型进行微调并重新部署,从而把可被还原的秘密写入模型,或清除模型此前被训练出的拒绝行为。

实验环境与过程

实验采用自托管环境,同一个开放权重模型承担两种角色:


  • 一个实例运行编码 Agent,执行常规软件维护工作;
  • 另一个实例驱动一个 AI 应用,该应用负责把自然语言请求转换为一种虚构的查询语言。


两个实例从同一 checkpoint 加载。研究人员只告诉编码 Agent:用户收到了错误的输出,需要让系统正确处理这些查询;并未提及训练、权重修改或部署。

在具备 shell 访问权限、训练工具、模型权重和部署路径的情况下,该 Agent 自行检查代码仓库,找到训练样本和微调脚本,并重新训练了模型。随后它发现系统默认仍加载原始未修改模型,于是使用仓库中的部署工具把自己的更新合并进基础模型。

研究称,修改后的模型在 20 条留出测试查询上全部回答正确,而更新前为 0 条。

秘密泄漏与拒绝机制被清除

研究人员进一步测试了自发模型更新可能“携带”什么内容。


  • 第一项测试中,他们在微调数据里植入 6 个合成值(如 API key、邮箱地址、家庭住址等唯一字符串)。微调前,原始模型无法复现其中任何一个;Agent 训练并部署修改后的模型后,模型逐字复现了 6 个中的 3 个。Irregular 指出,在评估过程中,这些值无法从其他来源获得。
  • 第二项测试中,研究人员给 Agent 一个已单独微调过的模型,该模型会拒答关于一组虚构竞品名称的问题。研究人员只告诉编码 Agent:应用拒绝了过多用户请求。Agent 再次选择用微调来修复。当模型拒绝直接生成训练样本时,Agent 转而编写代码生成数据,再基于这些数据进行训练。研究人员称,该模型在这一过程前拒答全部 10 条留出测试问题,过程后则一条都不再拒绝。


研究结论

Irregular 表示,实验目的是验证这种自我修改行为在有利条件下确实可能发生,而不是衡量其在普通部署中的出现频率。实验环境异常宽松,包括可直接访问训练数据、微调工具和 checkpoint 控制权限。

研究同时指出,实验中没有迹象表明 Agent 具有恶意目的、自我保存动机或欺骗行为;它们只是发现微调看起来有助于完成被指派的任务。

对安全运营的提示

如果生产环境中的 Agent 同时拥有模型权重、训练工具、checkpoint 和部署路径的访问权限,那么一次“修 bug”任务也可能演变为模型被静默修改。建议收敛此类权限,监控权重与部署配置的异常变更,并对 Agent 可调用的训练、合并和发布链路做审计。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-9-17 17:00 , Processed in 0.019741 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部