推理模型就只是 LLM
這不是新鮮事,但正在加速。那些曾經宣稱 LLM 本質上就是一條錯誤的路,根本無法實現任何有用的推理,更遑論發展出具備一定通用性的有用工具的人,現在開始洗牌重來,希望讓自己看起來不那麼錯誤。他們說:「我們所看到的進展,是因為像 OpenAI o1 或 DeepSeek R1 這樣的模型已經不只是 LLM 了。」這是錯誤的說法,盡早揭露這種混淆視聽非常重要。
首先,DeepSeek R1(不想談 o1/o3,因為那是我們無法取得的封閉模型,但極有可能也是如此)是一個純粹的 decoder only autoregressive model(僅解碼器自迴歸模型)。它採用的仍是當初被大力批評的那套 next token prediction(下一個詞元預測)。在模型的任何一處,都不存在任何顯式的 symbolic reasoning(符號推理)或表徵。
此外,R1 Zero 在完全不需要*任何* supervised fine tuning(監督式微調)的情況下,就擁有與 R1 相似的推理能力;僅僅是生成 chain of thoughts(思維鏈),並透過 reward function(獎勵函數),利用 reinforcement learning(強化學習)加以改進,就足以學會更強形式的推理。有趣的是,這些能力的一部分還能透過 SFT 輕易地蒸餾到更小的模型中,這就帶到了我的下一個重點。
另一個根本性的觀察是,S1 論文顯示,你只需要極少量的範例(少至 1000 個),模型就能開始建構複雜的推理步驟並解決不平凡的數學問題。S1 與 R1 Zero 暗示著,在某種程度上,模型早在 pre-training(預訓練)階段,僅透過 unsupervised next word prediction(非監督式下一個詞預測)這個訓練目標,就已經學到了執行推理所需的表徵。
因此,不僅是 R1 在基本結構上就是一個 vanilla LLM(原生 LLM),其 unsupervised pre-training 本身就創造了足夠的表徵與潛力,使得能力足夠強大的 LLM,只要經過 RL(和/或一些少量的 SFT),就能學會回應使用者提出的複雜問題(我指的是 instruct models(指令模型),一項由來已久卻依然令人印象深刻的能力),並利用 chain of thoughts 來進行推理、提供更好的答案。
推理模型就只是 LLM,而那些曾說 LLM 已走到死胡同的人就是錯了。犯錯是人之常情(即便在這個例子中,犯錯的方式特別強硬、特別否認證據)。然而,試圖改寫歷史、偷換術語以讓自己站在正確的一方,對我而言是無法接受的。
隨機一篇部落格