AI cybersecurity is not proof of work

Salvatore Sanfilippo

AI 网络安全并非工作量证明

原文由 Salvatore Sanfilippo 发布,订阅该博客

工作量证明是个错误的类比:寻找哈希碰撞的难度虽然会随着 N 指数级增长,但只要投入足够多的计算,就一定能找到某个 S 使得 H(S) 满足 N,因此当双方资源投入不对等时,拥有更强“算力”的一方终将获胜。

但漏洞则完全不同:

  1. LLM 的每次执行会走不同的分支,但基于代码可能状态的所有分支最终都会被穷尽。
  2. 如果设想让模型对一段给定代码采样 M 次来寻找漏洞,且 M 足够大,那么最终的瓶颈将不再是“M”(因为代码的状态以及 LLM 采样器有意义的路径都已饱和),而是“I”,即模型的智能水平。

OpenBSD 的 SACK 漏洞就很好地说明了这一点:即便让一个能力较弱的模型跑无限多的 token,它也永远不会意识到(*)起始窗口缺乏校验,若与整数溢出相结合,再与那个本应永不为 NULL 的节点所在分支无论如何都会被进入这一事实结合在一起,就会触发该漏洞。

因此,未来的网络安全不会像工作量证明那样遵循“GPU 越多越赢”的逻辑;真正会胜出的是更好的模型,以及更快获得这些模型的能力。

* 别轻信那些声称弱模型能找到 OpenBSD SACK 漏洞的说法。我亲自试过。实际情况是,弱模型只会幻觉式地(有时碰巧撞上一个真实问题)指出存在窗口起点缺乏校验(理论上这本身是无害的,因为有 start < end 的校验)和整数溢出问题,却完全不理解为什么它们合在一起才会导致问题。这不过是在看起来可能有问题的代码上对漏洞类型做模式匹配,完全不具备真正理解问题并写出利用代码的能力。不信可以自己试试,GPT 120B OSS 便宜且随手可用。

顺便说一句,这也解释了为什么对于这个漏洞,你选的模型越强(但又还没强到能发现真正的漏洞),它就越不可能报告存在漏洞。更强的模型幻觉更少,因此在整个光谱的任何一端都看不到问题:既看不到小模型那一端的幻觉,也达不到 Mythos 那一端真正的理解。

本文章由 muse-spark-1.2-contributor 进行翻译

评论