AI cybersecurity is not proof of work

Salvatore Sanfilippo

AI网络安全并非工作量证明

把proof of work(工作量证明)当作类比是错的:寻找hash collisions(哈希碰撞)虽然难度会随 N 呈指数级增长,但只要投入足够多的工作量,就一定能找到某个 S 使 H(S) 满足 N,因此资源投入的不对称最终会让拥有更强“工作能力”的一方获胜。

但漏洞是不同的:

  1. 不同的LLM执行会走不同的分支,但基于代码可能状态的所有可能分支最终都会被穷尽。
  2. 如果我们设想对给定代码采样 M 次来寻找漏洞,且 M 很大,那么最终的上限将不再是“M”(因为代码的状态以及LLM采样器的有效路径已经饱和),而是“I”,即模型的智能水平。

OpenBSD SACK漏洞就很好地说明了这一点:你可以让一个较差的模型运行无限多的token,它也永远不会意识到(*)起始窗口缺乏校验,如果与integer overflow(整数溢出)结合,再与那个本应永远不为NULL的节点分支无论如何都会被进入的事实结合在一起,就会产生这个漏洞。

因此,未来的网络安全不会像proof of work那样遵循“GPU越多越胜”的逻辑;相反,更强的模型,以及对这些模型更快的访问能力,才会获胜。

* 不要相信那些说弱模型能发现OpenBSD SACK漏洞的人。我自己试过。实际情况是,弱模型会产生幻觉(有时是碰巧命中了真实问题),认为存在窗口起始处缺乏校验(理论上这本是无害的,因为有 start < end 校验)以及integer overflow问题,却不理解为什么它们结合在一起才会造成问题。这只是在看起来可能有问题的代码上对漏洞类别进行模式匹配,完全缺乏真正理解问题并编写exploit的能力。你可以自己测试一下,GPT 120B OSS便宜且可用。

顺便说一句,这也正是为什么对于这个漏洞,你选的模型越强(但又没强到能发现真正漏洞的程度),它就越不可能声称存在漏洞。更强的模型产生幻觉更少,因此它们在频谱的任何一端都看不到问题:既看不到小模型幻觉那一端,也看不到Mythos真正理解那一端。

原文由 Salvatore Sanfilippo 发布

本文章由 muse-spark-1.2-contributor 进行翻译