推理模型就是大语言模型
原文由 Salvatore Sanfilippo 于 发布,订阅该博客
这不是什么新鲜事,但正在愈演愈烈。那些曾断言大语言模型在实现任何有用的推理、乃至开发任何具有一定通用性的有用工具方面都存在根本性缺陷的人,如今开始重新洗牌,指望让自己显得没那么错。他们说:“我们看到的这些进展,是因为像 OpenAI o1 或 DeepSeek R1 这样的模型已经不只是大语言模型了。”这种说法是错的,必须尽快戳穿这种故弄玄虚。
首先,DeepSeek R1(不想谈 o1/o3,因为那是闭源的,我们接触不到,但很可能也是一回事)就是一个纯粹的仅解码器自回归模型。还是那个曾被猛烈批判的下一个词元预测。在模型的任何地方,都不存在显式的符号推理或符号表征。
此外,R1 Zero 在完全不需要任何有监督微调的情况下,就具备了与 R1 相似的推理能力——仅仅通过生成思维链,并用奖励函数通过强化学习加以优化,就足以学到更强的推理形式。有意思的是,这些能力中的一部分还很容易就通过有监督微调蒸馏到了更小的模型中,这就引出了下一点。
另一个根本性的观察来自 S1 论文:模型只需要极少的样本(少至 1000 个)就能开始构建复杂的推理步骤,并解决非平凡的数学问题。S1 和 R1 Zero 都暗示,在某种程度上,模型早已在预训练阶段,仅通过无监督的下一个词预测这一训练目标,就学到了执行推理所需的表征。
所以,不仅仅是 R1 在基本结构上就是一个原生大语言模型,无监督预训练本身就创造了足够的表征和潜力,使得足够强大的大语言模型只需通过强化学习(和/或少量有监督微调),就能学会回答用户提出的复杂问题(我指的是指令模型,这是一项由来已久但依然令人印象深刻的能力),并利用思维链进行推理、给出更好的答案。
推理模型就是大语言模型,那些说大语言模型是死胡同的人就是错了。当然,人都会犯错(尽管在这一次,犯错的方式尤其咄咄逼人,尤其是在否认证据方面)。然而,为了让自己站在正确的一边而试图改写历史、偷换概念,在我看来是不可接受的。
随机一篇博客
评论
登录后参与讨论