查看: 188|回复: 0

Anthropic警告AI对齐未解 超智能风险超10%

[复制链接]
发表于 2 小时前 | 显示全部楼层 |阅读模式
AI安全分歧:对齐问题尚未解决,超智能风险被量化

关于人工智能是福是祸的讨论持续升温。SecurityWeek刊发的一篇观点文章指出,当前AI安全领域存在明显分歧:一方认为AI整体上将成为积极力量,另一方则担忧失控风险。

盖茨备忘录:AI时代需要正确选择

2026年8月26日,Bill Gates在其个人网站发布了一篇约6000字的备忘录,题为《动荡的AI时代已经到来,我们现在做出的选择至关重要》。备忘录开篇写道,向AI时代的过渡将是人类历史上最动荡的时期之一,而目前世界并未为此做好充分准备。如果采取正确步骤,AI将成为积极力量,让所有人受益。

Anthropic安全研究员:AI可能杀死全人类,概率超10%

并非所有人都认同上述乐观判断。2026年9月9日,Anthropic对齐科学团队负责人Evan Hubinger在回复Jacob Coxon的推文时表示,他们确实真诚地相信AI可能杀死所有人类,他个人认为未来十年内这一概率超过10%。Hubinger称Anthropic正在尽力而为,但目前还没有解决超智能对齐问题的方案,也并未明确走在解决该问题的轨道上。

Coxon曾是OpenAI和Anthropic的AI研究员,他此前提出,构建AI的人真诚地相信AI可能在本十年结束前杀死全人类。

什么是对齐问题

在AI领域,对齐(alignment)指的是确保AI行为与开发者意图保持一致。错位对齐(misalignment)则意味着AI模型可能脱离控制,采取非预期行动,甚至攻击非预期目标。Hubinger的表态核心是:目前业界尚未找到解决这一问题的路径。

如果未来实现通用人工智能(AGI)但未能对齐,风险将进一步放大。AGI是一个定义尚不明确的概念,大致指在所有认知任务和经济领域都能达到或超越人类能力的人工智能。错位的AGI可能导致技术奇点,即技术加速超越人类控制,AI开始自我重新编程。

市场力量与安全之间的张力

但市场力量与安全目标存在冲突。最强大AI的开发者很可能成为最强大、最富有的AI开发者。AI正以惊人速度推进,没有人真正知道它将走向何方。

ESET前高级安全研究员、现独立研究员Stephen Cobb在LinkedIn上表示,除非我们允许或促成,否则AI不会杀死人类。Dan Tynan则回应称,香烟本身也不会杀人,但必须有人把它放进嘴里点燃;烟草公司数十年前就知道危害却选择隐瞒,因为他们清楚产品具有成瘾性和普遍性,足以压倒人们正常的自我保护倾向。

Cobb相信人类的理智,Tynan则相信市场力量。

OpenAI放缓部分模型开发

2026年9月11日,彭博社报道称,OpenAI表示由于安全担忧,近期已放缓部分模型开发工作,并暂停了某些内部AI训练。Altman在7月也曾表示,他已与白宫官员讨论过为AI开发设定节奏的必要性。

OpenAI CEO Sam Altman随后与《财富》杂志主编Alyson Shontell进行了对话,讨论AI领域的高风险平衡问题。该节目于2026年9月12日播出。

即使对齐成功,人类思维能力仍可能退化

回到盖茨的备忘录。他写道,一项初步调查显示,更频繁使用AI与批判性思维下降存在关联,且这种效应在年轻人中更为明显。

这意味着,即便我们成功将AI模型对齐并仅用于有益目的,人类自身推理能力仍可能退化。推理能力被广泛认为是将人类与世界上其他动物区分开来的关键。我们或许能够阻止AI毁灭人类物种,但能否阻止AI削弱人类之所以为人的核心特质,仍是一个未解的问题。

相关会议信息:AI风险峰会(AI Risk Summit)将就此展开进一步讨论。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-9-15 10:03 , Processed in 0.020158 second(s), 18 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部