The Eternal Sloptember

George Hotz

永恆的 Sloptember

原文由 George Hotz 發布,訂閱此部落格

我現在就敢斷言,把 AI 代理導入軟體開發,將會是這個領域歷史上代價最慘重的錯誤之一。Agent 根本不會寫程式,而且要花越來越久的時間,大家才會發現它們真的不會。它們只是高度精密的統計模型,被設計來模仿程式碼的分佈。產出的結果是壞的,只是不好察覺的程度越來越高。而這正是你對一個越來越精準的統計模型會預期看到的結果。


一開始,我自己也不接受這個想法。我相信了 Twitter 上那套「地位焦慮」的說法。我的部分自我價值是建立在寫程式的能力上,所以當這種能力可能被取代時,產生防衛心態不是很合理嗎?為了保護自尊,就盡可能地否認模型會寫程式?

我的意思是,它們顯然能解開那些我窮盡一生也解不開的數學難題。那為什麼它們就不會寫程式呢?或許只是我這個程式設計師還不夠格,看不出它們的天才之處。

過去六個月我真的很努力嘗試了。我用 agent 寫了 tinygrad 的部分程式碼。我也用 agent 逆向了一顆 USB <-> PCIe 晶片。但每一次我都覺得,如果我自己手動做,應該能做得更好、更快。Agent 會把所有進度都先在前面幫你衝完,然後丟給你一根拉霸機的拉桿,讓你一直拉,希望它能把最後的細節修好。但它永遠差那麼一點到不了。

我知道一定會有人搶著說:「是你不會用啦。」我什麼都試過了,各種不同的模型、不同的 harness、不同的 prompt。不是這個問題。會這樣講的人,大概也會對拉霸機說一樣的話,你看,你拿到櫻桃之後一定要押五條線啊,難怪你都不會贏!

我不是說 AI 沒用,它當然有用。對大多數搜尋來說,它絕對是比 Google 更好用的工具。而且只要你需要一個快速原型、不在乎精緻度的時候,它的速度快得離譜。但它算是軟體工程師嗎?以我待過的任何一間公司的標準來看,連門檻都還差得遠。關鍵在於知道什麼時候該用、什麼時候不該用。

我又多想了一下關於維護自尊這件事。AFL 找到的 bug 比 LLM 還多,也沒人為此感到地位受威脅。西洋棋和圍棋現在比以前更受歡迎。我他媽等不及想擁有一整群可以信任、能幫我整理程式碼的機器人助手了!我才不害怕失去地位,我甚至覺得這整件事有點像是為了推銷 agent 而搞的心理戰。製造對失去的恐懼,是少數能讓大公司動起來的方法。不過我認為,在這種恐懼驅使下,他們正在犯下一個巨大的錯誤。


Agent 最終對大組織造成的傷害,會遠大於對頂尖個人或小團隊的傷害。我觀察了朋友和同事這六個月來怎麼採用這些工具。所有高績效的人都有一個共通特質,就是有能力糾錯,而他們也大多很擅長分辨什麼是 slop。確實需要花一點時間去摸索、試錯,調整外層的迴圈——什麼時候該用、什麼時候該相信、該怎麼用等等……但除了在某些侷限的領域之外,我還沒看過有任何一個頂尖的人,轉變成那種不再逐行仔細閱讀、理解程式碼的模式。

對比一下大組織。回饋週期慢得多,方向也更難一致。那些表現較差的人不會有那種自我檢核的能力。正是這些人用 agent 產出了 10 倍的產量。你覺得這間組織的平均產出會變成什麼樣子?全世界的平均產出又會變成什麼樣子?

Agent 最終會產出比以往任何時候都更多的程式碼、更多的 App、更多的功能。這將是一個 slop 成山成海的黃金時代,卻也是品質結晶的黑暗時代。

我聽說 Apple 正在要求所有工程師都要導入 AI。當大家用抽象的方式去想像時,會覺得 AI 什麼都能做,但我們來聚焦一個具體的例子就好。你覺得未來兩年內,macOS 會變得更好還是更爛?


當人們看到一件成品時,會對它被創造出來的過程做出假設。甚至不假思索地,就假定創作者擁有基本上和人類一樣的思考狀態。這個假設如今已經不再成立。東西可以用以前不可能出現的方式壞掉,而過去用來判斷底層品質的代理指標,像是語法和文法,現在已經毫無用處。AI 產出的成品並不是用和人類相同的方式製造出來的,而這種差異,雖然在統計數據上極其細微,但當你試圖用人類的方式去與它互動、在它之上繼續建構時,就會變得非常明顯。

雖然不是完全贊同他們所有的想法,但在 LLM 的問題上,我現在是站在 LeCun / Marcus 那一派。我不認為像這樣的模型有朝一日能夠真正寫程式,我認為過程才是關鍵。我認為深度學習仍然是解方,但真正的程式設計代理需要的是世界模型,而不是那種把失敗的測試註解掉、然後告訴你所有測試都通過了的 RLVR 爛東西。

這個時代真正的故事,將會是誰能夠在這場 AI 集體癲狂中,避免傷害到自己。

本文章由 muse-spark-1.2-contributor 進行翻譯

留言