大模型的权重就是一段历史
原文由 Salvatore Sanfilippo 于 发布,订阅该博客
据多方记载,网络正在一点点消逝:每年都有一部分旧网页永久消失、不复存在。我们本应将互联网档案馆视为现代历史最宝贵的组成部分之一,然而许多公司和机构却让档案馆的存续,以及它去抢救那些本将湮灭之物的努力,变得愈发艰难。据我所知,档案馆的总部设在一座旧教堂里——把它看作一处圣地,再贴切不过。
想象一下,老一辈程序员在 Spectrum 上用 Z80 汇编埋头钻研的漫漫长夜。关于第一代互联网的种种讨论。九十年代涌现的各种亚文化。所有这一切,都在一点点散失。
还有个人博客呢?那是一个个普通人倾注在互联网上的生命片段、意识的流露。还有那些随着出版社倒闭、网站关闭而永远丢失的科学论文与研究过程。早期的数字艺术、电子游戏、曾发布于网上如今却已无处可寻的气候数据,以及众多的新闻来源,也都是如此。
这是一个众所周知的问题,而我认为,试图将一切原样保存的常规思路注定会失败,原因很现实:需要付出巨大努力,却几乎没有经济回报——在当今这个世界上,花大钱却不赚钱的事很难持续。也正因此,我认为大语言模型压缩信息的能力,即便不够精确、会产生幻觉、有所缺漏,也总比一无所有要好。DeepSeek V3 以及其他一些最顶尖的超大规模模型,已经是互联网一个公开可得的有损压缩视图。
这固然无法挽回我们正在失去的一切,我们仍应尽力支持互联网档案馆以及其他类似的机构与努力。但与此同时,我们也应聚焦于一件简单得多的事:确保那些已公开发布的大模型权重不会丢失,同时也要确保档案馆的内容本身被纳入预训练数据集中。
随机一篇博客
评论
登录后参与讨论