Y’all are over-complicating these AI-risk arguments

Dynomight

你们把AI风险的论证搞得太复杂了

原文由 Dynomight 发布,订阅该博客

假设有一艘外星飞船正飞向地球。船上有30个外星人。这些外星人弱小矮小,没有武器,也不携带任何疾病。它们的繁殖速度和人类差不多,也没有带来任何新技术。没有其他飞船会跟来。这里面没有什么花招——除了它们每个人的智商都有300。你会觉得这令人担忧吗?

当然,这些外星人也可能是友善的。它们或许会治愈癌症,帮助我们实现世界和平、提升意识境界。但你能确定它们一定是友善的吗?

假设你对外星人感到担忧,而我却嗤之以鼻地说:“你具体说说,外星人要怎么伤害我们?它们又小又弱!除非我们允许,否则它们什么也做不了。”你会觉得这种反驳有说服力吗?

我的看法是,大多数人对外星人的到来感到担忧,不会确信它们的到来一定是好事,也不会觉得那种反驳有说服力。

我之所以提起这个,是因为我看到的多数AI风险论证都是这样的:

  1. AI能力会出现快速起飞
  2. 由于对齐难题正交性,它会去追求危险的趋同子目标
  3. 这些会赋予AI决定性战略优势,使其变得无法被控制,并最终导致灾难。

这些论证在我看来一直都过于复杂了。所以我想提出一个相反的、极简的替代版本:

  1. 显然,如果一个智商高达300的外星种族即将抵达地球,那将是令人担忧的。
  2. 在未来几十年里,智商达到300的AI完全有可能出现。说真的,这真的可能会发生。
  3. 没人知道智商300的AI会是什么样子。所以,它和外星人也没什么两样。

我们今天要讨论的是:为什么有人会更偏好其中一种论证,而不是另一种?

支持简单论证的理由

偏好简单论证最显而易见的理由是,它更有可能成立。复杂论证包含很多环节。就我个人而言,我觉得每一步单独看都算合理。但我们真的能确信,AI能力会出现快速起飞,并且AI会去追求危险的子目标,并且会因此获得决定性战略优势吗?

我觉得这种确信是不合理的。我常常感到困惑,为什么那么多看似理性的人在讨论这些论证时,却不去质疑这种确信。

我认为,解释在于复杂论证其实隐含了两个版本。“强”版本断言快速起飞等情况一定会发生,而“弱”版本只是说这是一个值得严肃对待的合理情景。人们究竟在支持哪一个版本,往往很难分辨。

这种区分至关重要,因为两个版本各有不同的弱点。我觉得强版本自信得离谱。我认同弱版本,但仍觉得它不够令人满意。

假设你认为,事情不按复杂论证所描述的那样发展的概率超过50%。也许是缓慢起飞,也许是AI无法建立决定性战略优势,诸如此类。那接下来呢?

也许,一切都会迎来美好的结局,你将活上数百万年,探索银河,读诗、冥想、吃派。那当然很好。但人类仍有可能以另一种方式完蛋。复杂论证并没有说明当其中某一步没有发生时会怎样。这可能会给人一种印象,好像只要其中任何一步不成立,就万事大吉了。但事实并非如此。

简单论证也更有说服力。部分原因我觉得是——嗯——当一件事本身是真的时,说服别人就更容易。但除此之外,简单论证不需要任何新概念或抽象,它利用的是我们已有的直觉:更聪明的实体会以意想不到的方式带来危险。

其实我更喜欢把简单论证倒过来说:如果你声称不存在AI风险,那么下面这几项中,你打算接受哪一项?

  1. “如果一个智商300的外星种族来到地球,那肯定没问题。”
  2. “智商300的AI在未来几十年内绝不可能出现。”
  3. “我们知道AI肯定会具有某种特殊属性,这种属性肯定能阻止外星人可能造成的所有坏结果。”

我认为这些说法没有一个能站得住脚。因此,我认为AI风险是真实存在的。

但如果你提出的是复杂论证,你似乎就背上了必须去论证快速起飞、对齐困难等等的负担。听到这种论证的人也常常会要求你解释AI究竟会如何伤害人类(“纳米技术?生物武器?什么样的生物武器?”)我认为这是一种误判,就像非要弄清车祸会如何发生才肯系安全带一样是错误的。只要复杂情景是有可能发生的,它就是我们需要管控的风险。但很多人并不这么看。

但我认为简单论证最大的优势还在于另一点:它揭示了分歧的关键所在。

我和许多觉得复杂论证完全不可信的人聊过。鉴于我认为它可信的——只是并非确定会发生——我常常会问为什么。人们给出的理由五花八门。有人声称对齐很容易,有人说AI永远不会真正成为“主体”,有人谈论进化系统与工程化系统的危险差异,还有人基于NP难问题或意识本质提出技术性论据。

我从来没能很有效地说服这些人改变想法。我倒是成功说服过一些人,让他们相信某些论据站不住脚。(例如,我曾让一些人相信NP难和意识本质很可能与此无关。)但当人们放弃这些论据后,他们并没有转而接受整个情景是可信的。他们只是换了别的反对理由。

于是我开始改用我的简单论证。这样做之后,我发现了这一点:这些人其实没有一个真正相信智商300的AI有可能出现。

当然,他们常常嘴上说接受这一点。但如果你追问下去,就会发现他们脑海中设想的AI总是缺少某种核心的人类能力。往往在他们看来,AI可以证明定理或回答问题,但它不是一个会有所欲求、会采取行动、会建立关系、会制定长期计划的“主体”。

所以我推测,这才是关于AI风险争论的关键所在。真正接受智商300且具备人类全部能力的AI可能出现的人,几乎无一例外都会至少在一定程度上担忧AI风险。而那些不担忧AI风险的人,几乎无一例外都没有真正相信智商300的AI会出现。如果这就是关键,那么我们就应该尽快直抵核心。而简单论证正是做到这一点的方式。

支持复杂论证的理由

我不标榜中立。正如标题所暗示的,我写这篇文章本是想为简单论证辩护,而且我仍然认为它的理由很充分。但我想我也应该考虑一下另一方的论据——而且确实有一些不错的论点。

上文我提到,复杂论证其实有两种版本:一种是“强”版本,断言它所描述的情景一定会发生;另一种是“弱”版本,只是说这是一个值得严肃对待的合理情景。我否定了强版本,认为它过于自信。我也否定了弱版本,因为人类可能走向糟糕结局的情景还有很多,为什么要如此聚焦于这一个?

不过,复杂论证还有一个“中间”版本:你可以主张,它所描述的情景并非一定会发生,但如果人类真的出了问题,那么很可能就是以那种方式出问题。这就避开了我的两个反对意见——它不那么过度自信,也为聚焦于这一特定情景提供了充分的理由。

就我个人而言,我并不认同这一点,因为我认为像渐进式失权这样的其他糟糕情景也是可信的。但也许我错了。认为复杂情景涵盖了不良后果的大部分概率,并非什么疯狂的主张。如果真是这样,我也想知道。

现在,有些人出于形象考虑,建议偏好某些论证:即便你接受复杂论证,也许你仍会想去提简单论证,因为它更有说服力,或者对AI风险社群的对外形象更有利。(“我们不想看起来像疯子。”)

就我个人而言,我对这类论调十分反感。我强烈主张,你应该为你真正相信的东西去辩论,而不是为了操纵他人去相信你想让他们相信的东西,就编造一个稀释过的版本。所以,即便我的简单论证更有说服力,那又怎样?

但假设你接受复杂论证的中间版本,同时又觉得我的简单论证更有说服力。再假设你不像我这么固执,所以想调整自己的表达方式以达到更好的效果。那么你该用我的简单论证吗?我不确定你应该这么做。

人类典型的偏见是以为别人和自己相似。(有多少人支持用地价税来资助强制性宠物保险?至少80%吧,对吧?)但就我观察,关于AI风险的情况恰恰相反。我认识的大多数人至少都有点担忧,却又觉得“普通人”会认为AI风险是科幻小说里的无稽之谈。

然而,来看几项最近的民调:

民调日期表述赞同比例
Gallup2025年6月2日至15日[AI]与以往的技术进步截然不同,并有可能危害人类和社会49%
Reuters / Ipsos2025年8月13日至18日AI可能危及人类的未来58%
YouGov2025年3月5日至7日您对人工智能(AI)可能导致人类在地球上灭绝的可能性感到担忧吗?(非常担忧或有点担忧)37%
YouGov2025年6月27日至30日您对人工智能(AI)可能导致人类在地球上灭绝的可能性感到担忧吗?(非常担忧或有点担忧)43%

对AI感到担忧绝非什么边缘立场。人们已经在担忧了,而且担忧程度还在加深。

我过去曾把我的简单论证视为一种合理的中间立场,主张严肃对待AI风险,但不过度自信:

光谱图1

但我开始怀疑,我那个“显而易见的论证”其实真的就是显而易见的,是人们自己就能想明白的东西。从民调数据来看,实际情况似乎更像是这样,左边的人正在逐渐向中间靠拢:

光谱图2

如果真要说形象问题,或许自信的论证反而比我的简单论证更有利。原则上,两者都指向相似的行动:迅速采取措施以降低生存风险。但我实际看到的是,大多数人——甚至包括从事AI工作的人——都感到无能为力,只是绷紧神经、寄希望于最好的结果。

我不认为你应该去倡导你自己都不相信的东西。但如果你真的认同复杂论证,却为了形象而有所保留,我实在看不出这样做的意义。

本文章由 muse-spark-1.2-contributor 进行翻译

评论