Reflections on AI at the end of 2025

Salvatore Sanfilippo

2025 年底對 AI 的反思

原文由 Salvatore Sanfilippo 發布,訂閱此部落格

  • 多年來,儘管功能上的證據與科學線索不斷累積,仍有部分 AI 研究者堅稱 LLM 就是「隨機鸚鵡」:也就是不會具備以下能力的機率機器:1. 對提示的含義有任何表徵。2. 對自己接下來要說什麼有任何表徵。到了 2025 年,幾乎所有人終於不再這麼說了。
  • 思維鏈(Chain of Thought)如今已成為提升 LLM 輸出的根本方法。但,CoT 究竟是什麼?為何它能改善輸出?我認為有兩個原因:1. 這是在模型表徵空間中的取樣(也就是一種內部搜尋)。當與提示主題相關的資訊與概念都已進入上下文視窗後,模型就能做出更好的回應。2. 但若將此與強化學習結合,模型也會學會一個 token 接著一個 token 地生成(每個 token 都會改變模型的狀態),藉此收斂到有用的回覆。
  • 認為擴展(scaling)受限於我們擁有的 token 數量的想法,已經不再成立,這是因為有了具可驗證獎勵的強化學習。我們還沒迎來 AlphaGo 第 37 步那樣的時刻,但未來真的不可能發生嗎?有些任務,例如針對給定程式進行速度優化,理論上模型可以在非常明確的獎勵訊號下,持續取得進展很長一段時間。我認為,將強化學習(RL)應用於 LLM 的改進,將會是 AI 下一個重大的突破。
  • 程式設計師對 AI 輔助寫程式的抗拒已大幅降低。即使 LLM 仍會犯錯,它們提供有用程式碼與提示的能力已提升到讓多數原本抱持懷疑的人也開始使用 LLM 的程度:現在對更多人而言,投資報酬率已經可以接受。程式設計的世界如今仍分為兩派:一派將 LLM 當成同事來用(例如,我所有的互動都是透過 Gemini、Claude 等的網頁介面),另一派則將 LLM 當成獨立的寫程式代理人來用。
  • 少數知名的 AI 科學家認為,Transformer 帶來的突破可以重演,甚至做得更好,只是走不同的路,因此開始組建團隊、成立公司,去探索 Transformer 的替代方案,以及具備顯式符號表徵或世界模型的模型。我認為 LLM 是在一個能夠近似離散推理步驟的空間上訓練出來的可微分機器,就算沒有出現根本性的新典範,它們也並非不可能帶我們走向 AGI。AGI 很可能可以透過許多截然不同的架構各自獨立地達成。
  • 有人說是思維鏈從根本上改變了 LLM 的本質,這就是為什麼他們過去聲稱 LLM 非常有限,現在卻改變了想法。他們說,因為有了 CoT,LLM 現在已經是不同的東西了。他們在說謊。這仍然是同樣的架構、同樣的下一個 token 預測目標,而 CoT 也是完全以同樣的方式,一個 token 接著一個 token 產生的。
  • 如今 ARC 測試看起來遠沒有當初想的那麼難以攻克:有一些針對該任務特化的小模型在 ARC-AGI-1 上表現得相當不錯,而配備大量思維鏈的超大型 LLM 則在 ARC-AGI-2 上取得了令人印象深刻的成果——而這所用的架構,在許多人看來原本是不可能帶來這種成果的。從某種意義上說,ARC 已經從「反 LLM 測試」轉變為對 LLM 的驗證。
  • 未來 20 年 AI 面臨的根本挑戰,是避免滅絕。

本文章由 muse-spark-1.2-contributor 進行翻譯

留言