The real AI risk is inside the labs

Salvatore Sanfilippo

真正的 AI 风险在实验室内部

原文由 Salvatore Sanfilippo 发布,订阅该博客

Amodei在最新的博客文章中写了一些我认同的观点,也有一些我认为误判了AI真正风险所在的观点。我想重点谈谈,为什么在所有风险中,开源权重模型反而是最轻微的一种。我写下这些话的前提是,我本人坚信AI在不久的将来就可能变得非常危险:

  1. 就像之前OpenAI/HF那次事件一样(那件事本身是个玩笑,但请关注的是其发生方式,而非结果),第一次严重的AI事故极有可能就发生在前沿AI实验室的围墙*内部*——在测试新模型的过程中,或是实验室员工、少数有访问权限的外部人员,因误判模型的实际能力而做出错误操作之时。
  2. 那些永远不会向公众开放的封闭模型,说到底也不过就是几TB的数据。只要有一个有权限且别有用心的人,就能将其泄露出去,局面立刻就会回到开源模型的境地。开源模型是在经过测试*之后*、且同等能力的模型已经通过API提供了一段时间之后才发布的。真正的风险在于泄露,而非发布,而泄露就发生在前沿公司内部。
  3. 正如Amodei所说,一旦大语言模型在生物等领域变得足够危险,开源模型完全可以在剔除了某些科学分支的语料上进行训练,同时在其他许多方面依然保持实用性。一个在特定领域缺乏充分预训练的模型,其有限的上下文窗口本身就是一道强大的防线,即便该模型在其他方面能力很强。目前,开源模型还远未达到能够构成此类危险的程度。
  4. 在网络安全领域,*无法*广泛获得大语言模型所提供的防御性安全能力和漏洞挖掘能力,恰恰会造成“大语言模型成为武器”的问题。这已经在发生:如果开源维护者不在某些网络安全计划的覆盖之内,就无法发现本可找到的所有安全漏洞,而别有用心的人却能够接触到前沿的网络安全模型、对开源权重模型进行大规模的强化学习训练,等等。
  5. 一旦大语言模型变得足够危险(如果进展持续,我们已接近这一临界点),我们真正需要建立的安全链条就在实验室内部,没有强有力的共同规则就无法建立,而且任何一家公司都不应被允许自行评估模型是否足够安全。我们需要一个由世界各地专家组成的、并得到前沿AI公司所在国政府认可的联合AI安全组织。
  6. 为了安全而放缓AI发展,必须与另一个事实相权衡:AI在医学和其他科学领域的发现可能会减轻人类的苦难。缺乏监管可能导致某种灾难性后果(“早上好!我们来研究一下这个增强版天花吧”)。而缺乏进展则可能导致本可挽救的生命逝去,不仅是当下,还有未来众多将因疾病而受苦的人。这听起来或许是个奇怪的论点,但我们必须明白,叫停AI*也*蕴含着安全代价,只是这种代价要隐蔽得多。
  7. Amodei对中国的意识形态立场是不公正的。我们欧洲人直到80年前还在毫无底线地自相残杀(人们现在已经忘了,但美国过去投资欧洲稳定的原因之一,正是因为我们极度危险,很可能再次重蹈覆辙,而数十年的繁荣既能让我们成为一个良好的市场,也能阻止我们再次开战)。美国即便在当下,也存在着严重的不平等,许多人因缺乏基本医疗保障而受苦,总统看起来也很不稳定,而且显然非常好战。我当然希望中国能拥有与我们西方同等水平的个人权利,但与此同时,中国的历史远比西方文化要爱好和平得多。在当前条件下,完全看不出由中国而非美国来实现AGI的军事锁定会更容易。此外,现任美国政府以各种形式向欧洲宣泄仇恨,在这个由美国主导一切的世界里,这非常令人担忧。最重要的是,无论GPU出口政策如何,中国的AI进步都不会停止,那么Amodei究竟是在主张美国一旦拥有AGI就应该以武力阻止中国,还是他的论点到底是什么?
  8. 在人类历史上,有许多技术霸权最初是在世界某一个地方取得的。据我所知,这从未导致*单个*国家试图建立永久性优势。核不扩散——这可能是与GPU禁令最相似的案例——也并未被用来通过威胁轰炸所有不服从者来实现永久的经济优势,也未能阻止多个行为体在不同时期获得该技术,而彼此并未通过轰炸来阻止对方的进展。此外,我并不认为AI最大的危险来自政府主导的行为。我倒希望这才是最危险的情形!政府会做蠢事,往往具有攻击性,其行为甚至导致过种族灭绝,但要做成一件可怕的事,需要许多人达成一致,这本身就是一种限制因素。最大的问题在于另外两种情况:A)少数个体制造末日事件(病毒案例),B)AI本身摆脱了建造者的控制。

我认为我们不应认为AI是安全的。可能发生导致智人灭绝的关键事件,但危险并不在于开源模型,也不在于中国比美国进展更快。危险在于,少数几位缺乏必要背景和正当性的CEO(遍布世界各地)却处在为全人类做出艰难抉择的位置上。他们并非被挑选来承担这一职责;仅仅是事件的随机性造就了这种局面。事关重大,他们不能仅仅因为拥有GPU和资金就代表所有人发言。这是首先应该解决的问题。

本文章由 muse-spark-1.2-contributor 进行翻译

评论