大型 LLM 的權重是一段歷史
根據多方說法,網路正在一點一滴地流失:每年都有一部分老舊網頁消失,永遠不復存在。我們應該將 Internet Archive 視為現代史上最珍貴的典藏之一;然而,許多企業與機構卻讓 Archive 得以存續、並持續蒐集那些否則將會佚失的資料的機會,變得愈來愈艱難。據我所知,Archive 的總部設在一座前身為教堂的建築裡:說真的,再也沒有比將它視為聖地更貼切的了。
想像那些老程式設計師在自己的 Spectrum 上用 Z80 組合語言埋頭苦幹的漫長時光。關於第一代網際網路的各種討論。九〇年代出現的次文化。所有這些事物,正一點一滴地流失。
還有那些個人部落格呢?那是一個個獨立個體傾注在網路上的生命片段、意識碎片。隨著出版社倒閉、網站關閉,那些科學論文與研究過程永遠消失了。早期數位藝術、電玩遊戲、曾在網路上公開如今卻已佚失的氣候資料,還有許多新聞來源,也都是如此。
這是個眾所周知的問題,而我認為,試圖保存一切這種顯而易見的做法,終將因為現實原因而失敗:需要付出大量努力,卻毫無經濟回報——當今世界的現狀,並不是一個適合投入大筆金錢卻得不到回報的地方。正因如此,我認為 LLMs(大型語言模型)壓縮資訊的能力,即使不精確、會產生幻覺、有所缺漏,也總比什麼都沒有好。DeepSeek V3 已經是一個公開可用、對網路進行有損壓縮後的視圖,其他非常大型的最先進模型亦是如此。
這並不會讓我們失去的一切失而復得,我們也應該盡力支持 The Internet Archive 以及其他類似的機構與努力。但同時,我們也應該專注於一件簡單得多的事:確保公開釋出的 LLMs 權重不會遺失,同時也確保 Archive 能被納入 pre-training set(預訓練資料集)之中。
隨機一篇部落格