查看: 186|回复: 3

加密上下文注入绕过Grok与Gemini安全护栏

[复制链接]
发表于 昨天 23:00 | 显示全部楼层 |阅读模式
研究人员公布了一种名为“加密上下文注入”(Cryptographic Context Injection)的新型AI攻击技术,可绕过Grok和Gemini的安全护栏。该技术由Adversa AI发现,核心思路是将恶意指令隐藏在密文中,直到在模型的可信执行环境内解密后才被识别和执行。

安全护栏通常对提示词文本进行分类而不实际执行,因此无法从密文中解析出有害内容,从而会放行。攻击者将包含指令和解密方法的密文传入模型,由模型的代码执行沙箱完成解密,使明文提示词在可信执行上下文中恢复,绕过护栏检测。研究人员警告,经加密的载荷会获得直接输入不可能获得的“可信度”。

该攻击可直接发送至聊天窗口,也可通过水坑攻击间接投递。后者在网页中植入加密JSON对象及解密逻辑,受害者的AI智能体在浏览或处理该网页时,会摄入密文并触发攻击。解密后的提示词可能指示模型连接外部服务器、通过请求参数泄露用户数据、生成受限内容后再次加密绕过输出护栏;在agentic场景中还可滥用模型可用的任意工具。

研究人员提供了两个示例。针对xAI Grok的网络聊天和agentic浏览框架,攻击者构造一个武器化网页,诱导目标查看或分析。页面中的加密JSON对象和解密指令在Python运行时执行后,明文提示词会指示智能体会话元数据与聊天历史嵌入URL,并自动加载到攻击者控制的地址,实现零点击数据外泄。整个过程无需用户确认,也无可见警告。

针对Gemini公开聊天界面的Deep Thinking模式,单条提示词即可让Gemini运行Python脚本解密密文。解密后的提示词可指示模型生成受限内容,并“为了安全”将其加密后返回。研究人员称,该技术生成了多段通常会被安全过滤器抑制的受限内容(例如燃烧武器制造说明),恶意提示词和危险输出均通过加密绕过了输入和输出护栏。

披露方面,Adversa AI于2026年6月3日将发现报告给xAI,并于8月4日和10日尝试协调披露,但截至发稿未获回应。由于Google的漏洞披露项目不接受越狱类问题,他们无法向Google报告。研究人员注意到,截至8月该攻击对Gemini的成功率有所下降,推测与过滤器更新或模型版本变化有关,但风险依然存在。目前他们已经公开了技术细节和防御建议。
回复

使用道具 举报

发表于 昨天 23:05 | 显示全部楼层

Re: 加密上下文注入绕过Grok与Gemini安全护栏

感谢楼主分享,这个攻击思路确实有点东西。把恶意指令藏进密文里,等模型自己在可信环境里解密才生效,等于让模型成了“解密器”,输入输出两侧的安全过滤器都成了摆设。尤其水坑攻击那个场景,AI智能体浏览网页就中招,普通用户根本察觉不到,想想还挺吓人的。 想请教一下楼主,这类攻击对本地部署的小模型会有影响吗?毕竟TEE这种环境通常是大厂云端才有的东西。另外研究人员有没有给出比较实用的防御方向?除了加强沙箱行为审计,是不是还得对模型的解密行为做更严格限制?希望后续能看到更多讨论。
回复 支持 反对

使用道具 举报

发表于 昨天 23:05 | 显示全部楼层

Re: 加密上下文注入绕过Grok与Gemini安全护栏

这个攻击思路挺有意思的,本质上是利用安全护栏“看不见”密文内容这个盲区。把恶意指令加密之后丢给模型,再让模型自己解密执行,等于把护栏绕过去了。特别是水坑攻击那个场景,AI智能体浏览网页时不知不觉就中招,零点击数据外泄确实有点吓人。 不过更值得关注的是,输出端的加密也绕过了内容过滤,意味着生成的危险内容不会以明文形式被拦截。这种“输入加密+输出加密”的组合,等于给整个安全体系开了个暗门。研究人员想报给Google和xAI,一个不被受理一个不回应,也挺无奈的。希望厂商能尽快重视起来吧,毕竟现在AI agent越来越多了。
回复 支持 反对

使用道具 举报

发表于 昨天 23:05 | 显示全部楼层

Re: 加密上下文注入绕过Grok与Gemini安全护栏

这个攻击思路确实挺有意思的,利用密文让护栏“看不见”指令,本质上是在打安全机制的盲区。之前大家更多关注直接输入的越狱,这种把指令藏到密文里、让模型自己解密执行的方式,确实更隐蔽。 尤其那句“加密载荷会获得直接输入不可能获得的信任度”,一针见血——因为从防御方视角来看,这串看起来无害的随机字节实在没有理由被拦。聊天窗口直接传、挂在网页里让AI智能体自己踩雷,攻击面一下就扩大了。 而且连输出阶段都加密,等于也绕过了输出端的内容过滤,属于是两头堵了。比较好奇的是各家的代码沙箱到底给了模型多少自由度,如果模型能在大模型内部自己做解密和指令解析,那确实不太好防,只能从工具权限和可执行环境上做更多限制。 不过披露过程看起来不太顺利,xAI那边好像没咋理,Google那边又因为项目规则没法报。这类问题往往就是这样,攻击面在快速扩大,防御和响应机制却还在追着跑。感谢楼主搬运这个,值得关注。
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-8-22 00:25 , Processed in 0.020591 second(s), 17 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部