Big LLMs weights are a piece of history

Salvatore Sanfilippo

大型LLM的权重是一段历史

多方证据表明,互联网正在不断失去它的碎片:每年都有一部分旧网页消失,永远地丢失了。我们应当把 Internet Archive 视为现代历史中最宝贵的遗产之一;然而,许多公司和机构却让 Archive 生存下去、积累那些原本会永远消失的内容变得越来越难。我了解到,Archive 的总部坐落在一座曾经的教堂里:那么,没有比把它看作一处圣地更好的理解方式了。

想象一下,老一辈程序员在他们的 Spectrum 上用 Z80 汇编语言熬夜编程的漫长时光。关于第一代互联网的种种讨论。90年代涌现的各类亚文化。所有这些都在一点一点地流失。

那么个人博客呢?那是一个个普通人把自己部分意识倾注到互联网上的生活片段。随着出版商倒闭、网站关停而永远消失的科学论文和研究过程。早期数字艺术、电子游戏、曾经发布在互联网上如今却已丢失的气候数据,还有许多新闻来源,也是如此。

这是一个众所周知的问题。我认为,试图保存一切这种显而易见的做法注定会失败,原因很现实:投入巨大却毫无经济回报——当今这个世界并不是一个适合做那种花费高昂却无利可图之事的地方。正因如此,我认为 LLM 压缩信息的能力,即便不精确、充满幻觉、有所缺失,也总比什么都没有强。DeepSeek V3 已经是一个公开可用的对互联网的有损压缩视图,其他最先进的大型模型也是如此。

这并不能挽回我们正在失去的一切,我们应该努力支持 The Internet Archive 以及其他类似的机构和行动。但与此同时,我们也应当关注一个简单得多的目标:确保公开发布的 LLM 权重不会丢失,同时也要确保 Archive 被纳入预训练数据集之中。