Reasoning models are just LLMs

Salvatore Sanfilippo

推理模型不过是 LLM

这并不是什么新鲜事,但正在加速上演。那些曾经断言 LLM 是一条从根本上走不通的路、既无法实现任何有用的推理,也无法构建任何具备一定通用性的有用工具的人,如今开始改口换说法,希望让自己显得没那么错。他们说:“我们所看到的进步,是因为像 OpenAI o1 或 DeepSeek R1 这样的模型不仅仅是 LLM。”这是错的,而且有必要尽快戳穿这种混淆视听。

首先,DeepSeek R1(我不想谈 o1 / o3,因为那是我们接触不到的私有东西,但很可能也是同样的做法)是一个纯 decoder-only 的自回归模型。它用的正是当初被强烈批评的那种 next token prediction。在模型的任何地方,都不存在任何显式的符号推理或符号表示。

此外,R1 Zero 在不进行*任何*监督微调(SFT)的情况下,就具备了与 R1 相当的推理能力——仅仅生成思维链,再用一个奖励函数通过强化学习加以改进,就足以让它学到一种更强的推理形式。有趣的是,其中一部分能力可以通过 SFT 轻松蒸馏到更小的模型中,这就引出了下一点。

另一个关键观察是,S1 论文表明,只需要极少的样本(少到 1000 条),模型就能开始构建复杂的推理步骤,并解决非平凡(non-trivial)的数学问题。S1 和 R1 Zero 都暗示,在预训练阶段,模型在某种程度上已经学到了执行推理所需的表示,而训练目标仅仅是无监督的 next word prediction。

所以,不仅是 R1 在基本结构上就是一个原汁原味的 LLM,而且无监督预训练本身就创造了足够的表示和潜力,使得足够强大的 LLM 在经过强化学习(RL)(和/或少量 SFT)之后,就能学会回答用户提出的复杂问题(我指的是 instruct 模型,一项由来已久但依然令人印象深刻的能力),并利用思维链对事物进行推理,给出更好的答案。

推理模型不过是 LLM,那些说 LLM 是死路一条的人就是错了。当然,人都会犯错(尽管这一次的错,错得特别激进,特别是在无视证据方面)。然而,为了让自己站到“正确的一边”而篡改历史和术语,在我看来是不可接受的。