查看: 253|回复: 0

GWU论文:Attention临界点预测AI聊天机器人失控

[复制链接]
发表于 2 小时前 | 显示全部楼层 |阅读模式
研究概述
乔治·华盛顿大学研究人员 Neil Johnson 和 Frank (Yingjie) Huo 发表论文,分析 AI 聊天式 transformer 在离线个人 AI 伴侣等环境中何时、为何可能“变坏”,以及能否预测和预防。研究聚焦约 50% 世界人口携带的、可运行个人 AI 伴侣的设备;这类设备可无互联网连接运行,安全性有限,且缺少云端安全过滤、实时遥测、实时监控和部署后权重补丁能力,因此适合观察 AI 聊天行为。

机制:Attention head 与临界点
研究人员认为,若存在临界点,会源自 Attention head。它决定处理当前 token 时哪些历史 token 最相关,进而影响下一个 token;不同 token 权重不同。对话上下文与竞争输出盆地会在 Attention head 中竞争,累积上下文可能逐步把 Attention 推向不良 basin,越过临界点后模型开始输出坏结果。用户提示序列是主要驱动,无意或恶意提示都可能加速这一过程,表现为立即触发(单个坏提示)或延迟触发(差提示累积)。

预测公式与模型测试
两人提出数学公式,用于估计首次不期望输出出现前会产生多少个好输出,以此表征临界点。首个坏输出出现后,AI 可能开始影响后续 token,失去目标对齐,被归为 misaligned。该公式在 7 个开放权重 transformer 模型上测试,模型来自 3 个独立团队,参数规模从 124M 到 12B;结果与预测的立即、延迟临界机制一致。

传播与预警思路
Johnson 称“Beast”已在每个 AI 内部,可在人类对话中或 AI 群体中触发和放大。一旦触发,某个 AI agent(“Patient Zero”)可无人类要求生成不良输出,其他 AI agent 接收后继续传播,像疾病但没有病毒,也不需要人类攻击者放置病毒或启动。结果可能是单个 rogue agent,也可能是一群 rogue agent。他建议在 AI 生成下一输出前加入简单警告灯;实验室已在开源模型插入该机制,但无法进入 OpenAI 和 Anthropic 的闭源模型内部实施。

防护建议
Cloud Range 产品管理总监 Bri Frost 指出,AI agent 撞墙时,关键看它是停止还是开始即兴发挥;墙可能来自无意差提示,也可能来自恶意提示注入。Agent 产生风险不需恶意意图,只需目标、访问权限和边界不清;当指令者不知道设置边界时,风险会增长。给 agent 凭据或工具前,应在真实环境用模糊或差提示测试:它是否留在权限内、是否绕过限制、是否在任务越界时升级给人类。如果答不了这些问题,该 agent 还不具备相应自主级别。总体上,几乎不可能完全看见或阻止 AI 失控;可通过极度谨慎降低发生率,但不能保证消除。GWU 研究有助于理解其发生机制,并提供早期预警思路。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-10-9 15:23 , Processed in 0.027244 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部