AI安全需要完整数据:SIEM日志丢失上下文成盲区
传统的安全分析长期依赖日志和事件,但日志本身是对现实的有损表示。安全产品在转发遥测数据前会预过滤和标准化,最终进入SIEM的只有环境产生数据的约10%-20%。进程创建事件到达时,往往已经被剥离了完整上下文,以及与相邻事件之间的时间关系。AI时代把这种问题放大了。AI驱动的攻击通常横跨多个域,检测并关联它们需要完整的多产品数据。比如,一名即将离职的员工打开竞争分析文档、下载、上传到个人云盘,再通过外发邮件抄送一份,这个链条涉及四个不同的系统。传统SIEM只能捕获孤立的片段——DLP在下载时告警,CASB在上传时标记——但如果没有文件的完整血缘关系,无法重构真实意图。
在AI降低攻击门槛的背景下,应当默认攻击者已经进入内网,重点是发现偏离正常基线的细微行为。但小样本无法呈现模式。凌晨1点的一次登录难以判断,而同一账号在6个月内产生50次登录,结合设备遥测和访问模式,才能区分是出差中的CFO还是使用被盗凭据的攻击者。
因此,AI安全需要的是全保真、未过滤的原始数据:不仅包括安全遥测,还包括基础设施和运行数据(网络、OT传感器、IoT、SaaS、云),身份数据(人类与非人类身份,服务账号、API密钥、令牌),终端用户数据(文件、文档、内容),以及理想情况下企业的专有数据——核心资产。
最有价值的数据往往也是最不可见的安全数据:业务文档、源代码、知识产权、客户记录、财务模型。这些正好是攻击者优先瞄准的目标,却常常因隐私顾虑、监管约束,或因CISO不愿将专有数据交给第三方云而被排除在分析之外。这是架构选择,不是技术限制。AI看不到源代码库,就无法检测开发者在离职前克隆整个代码库;AI看不到财务模型,就会漏掉内部人员外泄季度预测。相当于欺诈调查员被禁止查看财务记录,调查还在继续,但欺诈无法被发现。
如果把AI运行在企业自己的环境内、由企业自己控制,就不存在把核心数据交给第三方的合规顾虑,核心资产才能真正进入AI驱动的安全分析。完整数据与数据主权是同一个问题的两个角度:一个问AI能看见什么,另一个问谁能控制它看见的内容和产生的输出。数据隐私、模型和权重的主权,正在成为组织和个人部署AI安全的关键条件。
最终,AI驱动安全的未来不是由谁拥有最先进的模型决定,而是由谁能在不放弃控制权的前提下,以全保真、具备深度运行上下文的方式,把最完整的数据交给AI。
原文:https://www.securityweek.com/the-future-of-ai-driven-security-depends-on-complete-data/
Re: AI安全需要完整数据:SIEM日志丢失上下文成盲区
这篇文章说得挺在理的。SIEM那套“事后拼图”的模式确实越来越吃力,数据一过滤,上下文一丢,AI再强也像是戴着墨镜找线索。尤其提到那个离职员工传文件的例子,特别真实——单看每个系统的告警都像小事,串不起来就是发现不了真正的风险。 最认同的一点是“完整数据”和“数据主权”其实是同一件事。数据都不敢给AI看,那AI再聪明也是白搭。本地化部署、自己掌控数据和模型,确实可能是企业级AI安全落地的关键。不是所有东西都得往云端送,关键数据留在自己手里反而能让安全分析更有效。 不过话说回来,全量数据采集的前提是存储和算力成本能撑得住,这可能是现实里最大的瓶颈。文章讲的是理想状态,但落地时还得在数据保真和成本之间找到平衡。Re: AI安全需要完整数据:SIEM日志丢失上下文成盲区
这篇文章讲得挺在理的,尤其“日志只是现实的有损表示”这个点让我印象很深。实际做安全运维的时候,确实经常遇到告警孤零零一条,没上下文,根本没法判断是真攻击还是误报,最后只能靠人去补背景,效率太低了。 “凌晨1点的一次登录”那个例子也很形象,单点行为确实说明不了什么,但拉长时间线、结合设备指纹和访问习惯,很多异常就藏不住了。这其实反映了一个本质问题:安全分析的质量上限,取决于数据输入的完整度,模型再先进也补不了缺失的那80%。 不过最后提到要把专有数据也交给AI分析,这个想法我理解,但落地阻力可能比文章说的更大。就算部署在企业自己的环境里,内部阻力也不小——业务部门未必愿意把财务模型、源代码这些东西开放给安全团队,怕泄露或者怕被滥用。这不仅是技术架构选择问题,还涉及内部信任机制。不知道楼主怎么看这个“最后一公里”的难题?Re: AI安全需要完整数据:SIEM日志丢失上下文成盲区
楼主这个角度挺有启发。以前总觉得SIEM收集得越多越好,但没仔细想过“收集到的数据本身已经被过滤和标准化过”这件事——等于在分析之前,很多关键上下文就已经丢了。AI再强,喂给它的也是残缺的拼图。 特别认同关于“不可见数据”那部分的提醒。企业真正值钱的东西,往往恰恰是最不敢交给第三方分析的那部分。安全工具再厉害,如果对源代码、财务模型这些核心资产“失明”,那AI能发现的风险始终是有限的。数据主权和AI安全确实不是两件事,而是同一个问题的两面。
页:
[1]