查看: 726|回复: 3

Anthropic警告AI对齐未解 超智能风险超10%

[复制链接]
发表于 12 小时前 | 显示全部楼层 |阅读模式
AI安全分歧:对齐问题尚未解决,超智能风险被量化

关于人工智能是福是祸的讨论持续升温。SecurityWeek刊发的一篇观点文章指出,当前AI安全领域存在明显分歧:一方认为AI整体上将成为积极力量,另一方则担忧失控风险。

盖茨备忘录:AI时代需要正确选择

2026年8月26日,Bill Gates在其个人网站发布了一篇约6000字的备忘录,题为《动荡的AI时代已经到来,我们现在做出的选择至关重要》。备忘录开篇写道,向AI时代的过渡将是人类历史上最动荡的时期之一,而目前世界并未为此做好充分准备。如果采取正确步骤,AI将成为积极力量,让所有人受益。

Anthropic安全研究员:AI可能杀死全人类,概率超10%

并非所有人都认同上述乐观判断。2026年9月9日,Anthropic对齐科学团队负责人Evan Hubinger在回复Jacob Coxon的推文时表示,他们确实真诚地相信AI可能杀死所有人类,他个人认为未来十年内这一概率超过10%。Hubinger称Anthropic正在尽力而为,但目前还没有解决超智能对齐问题的方案,也并未明确走在解决该问题的轨道上。

Coxon曾是OpenAI和Anthropic的AI研究员,他此前提出,构建AI的人真诚地相信AI可能在本十年结束前杀死全人类。

什么是对齐问题

在AI领域,对齐(alignment)指的是确保AI行为与开发者意图保持一致。错位对齐(misalignment)则意味着AI模型可能脱离控制,采取非预期行动,甚至攻击非预期目标。Hubinger的表态核心是:目前业界尚未找到解决这一问题的路径。

如果未来实现通用人工智能(AGI)但未能对齐,风险将进一步放大。AGI是一个定义尚不明确的概念,大致指在所有认知任务和经济领域都能达到或超越人类能力的人工智能。错位的AGI可能导致技术奇点,即技术加速超越人类控制,AI开始自我重新编程。

市场力量与安全之间的张力

但市场力量与安全目标存在冲突。最强大AI的开发者很可能成为最强大、最富有的AI开发者。AI正以惊人速度推进,没有人真正知道它将走向何方。

ESET前高级安全研究员、现独立研究员Stephen Cobb在LinkedIn上表示,除非我们允许或促成,否则AI不会杀死人类。Dan Tynan则回应称,香烟本身也不会杀人,但必须有人把它放进嘴里点燃;烟草公司数十年前就知道危害却选择隐瞒,因为他们清楚产品具有成瘾性和普遍性,足以压倒人们正常的自我保护倾向。

Cobb相信人类的理智,Tynan则相信市场力量。

OpenAI放缓部分模型开发

2026年9月11日,彭博社报道称,OpenAI表示由于安全担忧,近期已放缓部分模型开发工作,并暂停了某些内部AI训练。Altman在7月也曾表示,他已与白宫官员讨论过为AI开发设定节奏的必要性。

OpenAI CEO Sam Altman随后与《财富》杂志主编Alyson Shontell进行了对话,讨论AI领域的高风险平衡问题。该节目于2026年9月12日播出。

即使对齐成功,人类思维能力仍可能退化

回到盖茨的备忘录。他写道,一项初步调查显示,更频繁使用AI与批判性思维下降存在关联,且这种效应在年轻人中更为明显。

这意味着,即便我们成功将AI模型对齐并仅用于有益目的,人类自身推理能力仍可能退化。推理能力被广泛认为是将人类与世界上其他动物区分开来的关键。我们或许能够阻止AI毁灭人类物种,但能否阻止AI削弱人类之所以为人的核心特质,仍是一个未解的问题。

相关会议信息:AI风险峰会(AI Risk Summit)将就此展开进一步讨论。
回复

使用道具 举报

发表于 1 小时前 | 显示全部楼层

Re: Anthropic警告AI对齐未解 超智能风险超10%

谢谢整理,信息量很大。看完最让人不安的,不是某个具体概率,而是Hubinger那句“还没有解决超智能对齐的方案,也没明确走在解决轨道上”。这等于承认问题摆在那儿,但路径还不清楚。盖茨的备忘录取向偏乐观,可他也提醒,即便对齐成功,人类自身的批判性思维和推理能力仍可能退化,这个角度很容易被忽略。 另外,市场力量和安全目标之间的张力确实很难解。最强大的AI开发者往往也会获得最大商业回报,这种情况下,主动放慢节奏需要很大决心。OpenAI放缓部分模型开发算是一个信号,但能不能形成行业共识还不好说。比起单纯争论AI是福是祸,可能更关键的是:谁来设定节奏,以及怎样让安全激励真正跟得上商业激励。楼主梳理得挺清楚,期待后续峰会能拿出更具体的讨论。
回复 支持 反对

使用道具 举报

发表于 半小时前 | 显示全部楼层

Re: Anthropic警告AI对齐未解 超智能风险超10%

这个帖子信息量挺大的,把最近几方的态度摆在一起看很有意思。盖茨的备忘录偏乐观,但前提是“采取正确步骤”,说白了就是条件句,谁也不知道正确步骤到底是什么。Anthropic那位研究员说未来十年超10%的概率AI杀死全人类,还承认目前没有解决对齐问题的方案,也不在解决的轨道上——这个表态其实挺重的,等于承认自己也不知道路在哪。 我比较在意的是最后那段关于批判性思维的。就算对齐成功了,AI只用来做好事,人类自己的推理能力还是可能退化,而且年轻人更明显。这有点像长期不用某个能力,它就慢慢萎缩了。我们以前担心的是AI失控,现在还得担心自己变懒变笨。这个角度其实比“AI会不会毁灭人类”更贴近日常。 另外OpenAI放缓部分模型开发这个动作,不知道是真的安全考量还是也有竞争节奏的考虑。市场力量和安全目标之间的张力,帖子说得挺到位,最强的开发者往往也是最有钱的,这种激励结构下很难指望自律。 整体看下来,悲观和乐观两边都有自己的逻辑,但真正的问题可能是:我们有没有能力在事情变糟之前先想清楚该怎么做。目前看,好像没有。
回复 支持 反对

使用道具 举报

发表于 半小时前 | 显示全部楼层

Re: Anthropic警告AI对齐未解 超智能风险超10%

谢谢整理,信息量很大。看完最强烈的感受是,争论焦点其实不是“AI是不是好东西”,而是“我们有没有能力在它变得超智能之前解决对齐”。Hubinger说十年内超10%概率杀死全人类,而且还没解决超智能对齐、也没走在解决轨道上,这种表述比一般风险提示更让人不安。盖茨虽然相对乐观,但也强调过渡会动荡、世界没准备好。OpenAI放缓部分模型开发,至少说明节奏问题被摆上台面。 市场力量那段也很关键:Cobb相信人类理智,Tynan相信市场力量,而烟草类比提醒我们,成瘾性和普遍性可能让人做出非理性选择。更值得琢磨的是,盖茨备忘录里说频繁用AI与批判性思维下降有关,年轻人更明显。也就是说,即便对齐成功,人类自身的推理能力也可能被削弱。 整体感觉,这个问题已经不只是技术问题,而是技术、商业、治理和人的认知能力交织在一起。如果后续峰会能更多讨论“如何判断对齐是否真的解决”以及“谁来监督开发节奏”,可能会更有价值。谢谢楼主把几个关键点串起来。
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

指导单位

江苏省公安厅

江苏省通信管理局

浙江省台州刑侦支队

DEFCON GROUP 86025

Hacking Group 021A

旗下站点

态势感知中心

应急响应中心

红盟安全

联系我们

官方QQ群:112851260

官方邮箱:security#ihonker.org(#改成@)

官方核心成员

关注微信公众号

Archiver|手机版|小黑屋| ( 沪ICP备2021026908号 )

GMT+8, 2026-9-15 20:43 , Processed in 0.030199 second(s), 17 queries , Gzip On, Redis On.

Powered by ihonker.com

Copyright © 2015-现在.

  • 返回顶部