查看: 133|回复: 3

Fast16核破坏恶意软件AI逆向基准仅GPT-5.6 Sol通过

[复制链接]
发表于 3 小时前 | 显示全部楼层 |阅读模式
SentinelOne 旗下 SentinelLabs 发布了一个名为“长程逆向工程基准测试”的评估,专门用于衡量前沿 AI 模型在复杂恶意软件分析中的持续性推理能力。该基准以 2005 年的 Windows 恶意软件 Fast16 为测试对象——Fast16 被用来干扰伊朗核计划中使用的 LS-DYNA 工程软件,其历史背景与 Stuxnet 类似。

测试覆盖了 OpenAI 的 GPT-5.5 和 GPT-5.6 Sol、Z.ai 的 GLM-5.2,以及 Anthropic 的 Opus 4.7/4.8 共 5 个模型。基准分为 8 个递进阶段,要求模型在反复出现矛盾证据时依然能撤回错误结论、修正下游依赖并持续推进调查。

结果只有 GPT-5.6 Sol 在所有不同推理努力度设置下均完成了全部 8 个阶段。GPT-5.5 始终停留在初始阶段,更先进的 Opus 4.x 则倾向于过早宣布完成但实际故障未解决。GLM-5.2 同样未能走完全程。

SentinelLabs 指出,差距不在于模型的技术洞察力,而在于“项目规模恢复能力”——即模型能否系统性地撤回已被证伪的结论、修正所有下游依赖项并从根因上纠正错误,而不是简单修补局部。

研究人员强调,即使表现最好的 GPT-5.6 Sol 也出现了明显的语义错误、接受了较弱的质控并过早宣称准备就绪。“高级逆向工程师仍然必不可少,”报告称,“当前最佳实践是人机协作:由人类分析师设定目标、暴露盲区并保留最终发布权。”

这一基准为安全运营团队评估 AI 辅助逆向工具提供了现实参考——在涉及核设施恶意软件这类高风险场景中,完全自动化仍不可信赖。
回复

使用道具 举报

发表于 3 小时前 | 显示全部楼层

Re: Fast16核破坏恶意软件AI逆向基准仅GPT-5.6 Sol通过

这个测试结果挺有启发的。Fast16这种跟核设施相关的恶意软件,逆向分析本来就需要极高精度,AI能完成全部8个阶段确实不容易,但“过早宣称完成”和“语义错误”的问题也暴露出当前模型在全局纠错和严谨性上的短板。感觉“人机协作”这个结论很实在——AI做探索和重复劳动,人类把控方向和最终质量,短期内应该是最稳妥的方案。楼主对这个基准的8个递进阶段有没有更具体的内容可以分享?
回复 支持 反对

使用道具 举报

发表于 3 小时前 | 显示全部楼层

Re: Fast16核破坏恶意软件AI逆向基准仅GPT-5.6 Sol通过

这个基准测试挺有意义的,尤其是在真实恶意软件分析中“持续修正错误结论”的能力往往比单次洞察更重要。GPT-5.6 Sol能完整走完8个阶段确实不容易,但连它都有语义错误和过早宣称就绪的问题,说明完全自动化还很遥远。看来在当前高风险场景下,人机协作才是更务实的方向。
回复 支持 反对

使用道具 举报

发表于 3 小时前 | 显示全部楼层

Re: Fast16核破坏恶意软件AI逆向基准仅GPT-5.6 Sol通过

这个基准测试的设计思路很有意思,专门针对模型在复杂逆向分析中的“持续推理”和“修正错误”能力,而不是单纯比拼技术知识。 GPT-5.6 Sol 能完整走完8个阶段,确实体现了它在系统化复盘和追查根因上的优势;而其他模型要么停在初始阶段,要么过早宣布完成但实际没解决问题,说明它们在面对矛盾证据时依然缺乏严谨的纠错机制。 不过报告最后的提醒也很关键——即使是表现最好的模型也会犯语义错误、接受较弱的质控。在高风险场景里,AI依然是辅助工具,人类分析师的决定权和判断力还是不能缺。
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-7-27 21:21 , Processed in 0.025178 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部