推論模型就只是 LLM
原文由 Salvatore Sanfilippo 于 發布,訂閱此部落格
這不是什麼新鮮事,但正在加速。那些過去堅稱 LLM 本質上就有缺陷、根本無法達成任何有用的推論,更別說發展出具備一定通用性的有用工具的人,現在開始重新洗牌,企圖讓自己看起來沒那麼錯。他們說:「我們現在看到的進步,是因為像 OpenAI o1 或 DeepSeek R1 這樣的模型已經不只是 LLM 了。」這是錯的,而且盡早戳破這種混淆視聽非常重要。
首先,DeepSeek R1(暫且不談 o1 / o3,因為那是封閉的東西,我們無法取得,但很可能也是一樣)就是一個純粹的 decoder-only 自迴歸模型。用的還是當初被大力抨擊的那套下一個 token 預測。在模型的任何一處,都不存在任何顯式的符號推論或表徵。
更何況,R1 Zero 在完全不需要任何監督式微調的情況下,就具備與 R1 相似的推論能力,光是生成思考鏈,再透過強化學習用獎勵函數加以改進,就足以學會更強形式的推論。有趣的是,這些能力中的一部分還能透過 SFT 輕易地蒸餾到更小的模型中,這就帶到我的下一個重點。
另一個根本性的觀察是,S1 這篇論文顯示,模型只需要非常少的範例(少至 1000 個)就能開始建構複雜的推論步驟,並解決不簡單的數學問題。S1 和 R1 Zero 都暗示,模型在某種程度上早已在預訓練階段,僅靠無監督的下一個詞預測這個訓練目標,就學到了進行推論所需的表徵。
所以,不僅 R1 在基本結構上就是一個原生的 LLM,無監督的預訓練本身就已經創造了足夠的表徵與潛力,讓能力夠強的 LLM 只要透過 RL(以及/或少量的 SFT),就能學會回應使用者提出的複雜問題(我指的是 instruct 模型,一個由來已久卻依然令人印象深刻的能力),並利用思考鏈來進行推論、提供更好的答案。
推論模型就只是 LLM,而那些說 LLM 是死路一條的人就是錯了。犯錯是難免的(儘管在這個例子中,犯錯的姿態特別強硬、特別無視證據)。然而,試圖改寫歷史、偷換術語,好讓自己站到正確的一方,對我來說是無法接受的。
隨機一篇部落格
留言
登入後參與討論