The Eternal Sloptember

George Hotz

永恒的 Sloptember

原文由 George Hotz 发布,订阅该博客

我现在就把话放在这里:将 AI 智能体引入软件开发,将会是这个领域历史上代价最为高昂的错误之一。智能体根本不会编程,而人们需要越来越长的时间才能意识到这一点。它们只是一个高度复杂的统计模型,被设计用来拟合编程的分布。它的产出是错的,只不过这种错越来越难以被察觉。而这恰恰就是一个越来越精确的统计模型应有的表现。


起初,我是拒绝接受这一点的。我当时相信了推特上那种关于“地位焦虑”的解释。我的部分自我价值就建立在编程能力之上,那么当这种价值面临丧失时,产生防御心理不是很正常吗?为了维护自尊,就尽可能久地否认模型会写代码?

我的意思是,它们能解开一些我穷尽一生也无望解开的数学难题,这一点是显而易见的。那为什么它们就不能编程呢?也许只是我自己的编程水平不够,才看不出它们的天才之处。

过去 6 个月里我真的尽力尝试了。我用智能体写了 tinygrad 的一部分,也用智能体逆向了一块 USB <-> PCIe 芯片。但每一次我都感觉,如果我亲手去做,本可以做得更好、更快。智能体把所有的进展都提前堆在前面,然后递给你一根老虎机的拉杆,让你指望它能把最后的打磨工作完成。但它永远都差那么一点。

先别急着说“是你不会用”。我已经试过了各种不同的模型、不同的框架、不同的提示词。问题不在这里。那些这么说的人,大概也会对老虎机说同样的话——你看,你拿到樱桃之后得押 5 条线,难怪你赢不了!

我不是说 AI 没用,它显然是有用的。对于大多数搜索来说,它绝对是一个更好的谷歌。每当你需要一个快速原型,又不在乎精细打磨时,它的速度快得离谱。但它算得上是软件工程师吗?离我待过的任何一家公司的标准都还差得远。关键在于知道什么时候该用它,什么时候不该用。

我又仔细想了想那个“维护自我价值”的说法。AFL 找到的漏洞比大模型还多,也没见谁为此感到焦虑。国际象棋和围棋现在比以往任何时候都更受欢迎。我他妈迫不及待地想要拥有一支支可以信赖、能帮我清理代码的机器人助手大军!我并不害怕地位的丧失,我甚至觉得这有点像是为了推销智能体而搞的心理战。害怕失去是为数不多的能让大公司行动起来的方式之一。只不过我认为,在这种恐惧中,他们正在犯一个巨大的错误。


智能体最终对大型组织的伤害,会比对高水平的个人或小团队更大。过去 6 个月里,我观察了朋友和同事们对这些工具的采用情况。你会在所有高水平的人身上发现一个共同特质,那就是纠错能力,他们大多都很擅长分辨什么是垃圾。确实需要花一点时间去探索、权衡,并调整何时使用它们、何时信任它们、如何使用它们等等的外层策略……但除了在一些受限的领域,我还没见过他们中有谁会转向一种不再逐行仔细阅读和理解代码的模式。

反观大型组织,反馈循环要慢得多,一致性也要差得多。表现垫底的人不会有那种自我检验。他们正是那些用智能体实现了 10 倍产出的人。你觉得这个组织的平均产出会发生什么?全世界的平均产出又会发生什么?

智能体最终会产出比以往任何时候都更多的代码、更多的应用和更多的功能。这将是一个成桶成桶的垃圾遍地的黄金时代,也是一个高质量精品暗淡无光的黑暗时代。

我听说苹果正在向旗下所有工程师力推 AI。当人们抽象地去想时,会觉得 AI 能搞定所有这些事,但让我们聚焦到一个具体的例子上。你觉得未来两年里 macOS 会变好还是变差?


当人们看到一件成品时,会对创造它所用的过程做出假设。甚至无需思考,他们就会默认创作者拥有一种基本的人类心智状态。这个假设如今已经不再成立。事物可能会以过去不可能的方式损坏,而语法、文法这些过去用来衡量底层质量的代理指标已经毫无用处。AI 产出的成品并非通过与人类相同的过程产生的,这种差异虽然在统计上极其微妙,但当你试图以人类的方式去与成品交互、并在其之上继续构建时,它就会显露无遗。

在不完全赞同他们所有观点的情况下,在大模型的问题上,我现在站在了 LeCun/Marcus 那一边。我认为这类模型永远也无法真正学会编程,我认为过程很重要。我认为深度学习仍然是出路,但真正的编程智能体需要的是世界模型,而不是那种把失败的测试注释掉然后告诉你所有测试都已通过的 RLVR 垃圾。

这个时代真正的故事,将会是谁能够在 AI 狂热中避免自我伤害。

本文章由 muse-spark-1.2-contributor 进行翻译

评论