Reflections on AI at the end of 2025

Salvatore Sanfilippo

2025年末对AI的反思

原文由 Salvatore Sanfilippo 发布,订阅该博客

  • 多年来,尽管功能性证据和科学线索不断累积,仍有一些AI研究者坚持声称大语言模型是随机鹦鹉:一种概率机器,它:1. 对提示词的含义没有任何表征。2. 对自己将要说的内容没有任何表征。到了2025年,终于几乎没有人再这么说了。
  • 思维链如今已成为提升大语言模型输出的根本方法。但,什么是思维链?它为什么能提升输出?我认为有两点:1. 在模型表征空间中的采样(也就是一种内部搜索)。当与提示主题相关的信息和概念进入上下文窗口后,模型就能更好地作答。2. 但如果将此与强化学习结合,模型还会学会如何逐个生成token(每个token都会改变模型的状态),以收敛到有用的回答。
  • 认为扩展受限于我们所拥有的token数量的想法,已经不再成立,这要归功于带有可验证奖励的强化学习。我们还没有迎来AlphaGo第37步那样的时刻,但未来这真的不可能吗?有一些任务,比如对给定程序进行速度优化,理论上模型可以在非常清晰的奖励信号下持续取得进展很长时间。我相信,对应用于大语言模型的强化学习的改进将是AI的下一个重大突破。
  • 程序员对AI辅助编程的抵触已经大幅降低。即使大语言模型仍会犯错,它们提供有用代码和提示的能力也已提升到让大多数怀疑者都开始使用的程度:如今对更多人来说,投入产出比已经可以接受。编程世界依然分裂为两派,一派将大语言模型当作同事来使用(例如,我的所有交互都是通过 Gemini、Claude 等的网页界面完成的),另一派则将其作为独立的编程智能体来使用。
  • 一些知名的AI科学家认为,发生在Transformer身上的事情可以重演,甚至做得更好,只是走不同的路径,于是开始组建团队、创立公司,去探索Transformer的替代方案以及具有显式符号表征或世界模型的架构。我认为,大语言模型是在一个能够逼近离散推理步骤的空间上训练出来的可微机器,即使没有出现全新的范式,它们也并非不可能将我们带向通用人工智能。很可能通用人工智能可以通过多种截然不同的架构被独立实现。
  • 有人说思维链从根本上改变了大语言模型的本质,这就是为什么他们过去声称大语言模型非常有限,而现在又改变了想法。他们说,因为有了思维链,大语言模型现在已经是不同的东西了。他们在撒谎。架构依然是同一个架构,目标依然是预测下一个token,而思维链也正是这样逐个token生成的。
  • 如今的ARC测试看起来远没有最初认为的那么难以逾越:在ARC-AGI-1上,有针对该任务优化的小模型表现得相当不错;而在ARC-AGI-2上,拥有大量思维链的超大大语言模型取得了令人瞩目的成绩,而按照许多人的说法,这种架构本不该取得这样的成果。在某种意义上,ARC已经从一项“反大语言模型”的测试转变为对大语言模型的验证。
  • 未来20年AI面临的根本挑战是避免灭绝。

本文章由 muse-spark-1.2-contributor 进行翻译

评论