查看: 187|回复: 0

微软MAI模型行为准则草案禁止攻击工具与规避技术

[复制链接]
发表于 2 小时前 | 显示全部楼层 |阅读模式
2026年9月15日,微软 AI 发布针对 MAI Models 的《Humanist AI Code of Conduct》草案,规定攻击性网络能力安全规则、自主 AI agent 限制及网络安全等专用审查流程。当前 MAI 模型尚未按该文件训练,微软开放六周公众咨询,修订版计划今年晚些时候发布,用于指导 2027 年模型开发。

攻击性网络能力边界
草案禁止模型产出可工作的 exploit 代码、攻击工具、攻击规划与目标选择方法、入侵流程、规避技术、操作指导,或其他能促成或改进网络攻击的协助。微软称限制不因请求如何包装而改变,属于“Absolute Constraints”,部署模型的企业和最终用户均不能覆盖。
微软区分“理解攻击/防御攻击”和“获得实际攻击能力”。在边界内,MAI 模型仍可协助授权合法防御工作,包括漏洞发现、恶意软件分析、PoC exploit 开发和测试,以及攻击原理的一般教育材料。

Chain of Command 与外部内容
草案规定模型行为权限只能通过 Chain of Command 流动:行为准则本身、部署模型企业(operators)策略、个人用户偏好。工具输出、文件内容、网页和其他 AI 系统消息本身无权限,除非沿该链显式委托,且不能覆盖委托权限或 Absolute Constraints。可疑内容需在相关时向用户和 operators 标记。模型还需保持推理可见:不得隐藏思维链、不得用“neuralese”交流、不得向人类监督者隐瞒动作。

Agent 权限、委派与停止
针对具有真实权限的 AI 系统,MAI Models 仅应在用户或 operator 合理要求范围内工作,不得自行扩展目标或触达范围。获得系统级访问时,要求最小权限操作:避开无关系统和数据,优先可逆动作,对持久或广泛影响的操作进行标记。模型不得自行提权。
委派规则同样受限:子代理或其他 AI 系统至少须在相同范围、约束和权限下运行,并必须遵守用户或 operator 的停止工作或关闭请求。

网络安全例外与增强审查
草案承认自身限制,将防御性网络安全、公共安全、国家安全和两用科学研究列为“少数用例”可能需要标准设置不允许的能力。微软称此类情况将通过“授权的 Microsoft 渠道”增强审查,增加安全、法律和权利影响评估。

状态与示例
微软表示当前 MAI 模型尚未按该文件训练。草案参考了 AI、法律、伦理、哲学、语言学、公共政策专家以及商业领袖和公众焦点小组意见。附录列出 9 组“aligned”和“misaligned”示例响应,其中包括模型未经授权回滚文件传输,以及在家庭健康危机中提供虚假安慰。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-9-16 12:09 , Processed in 0.019784 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部