Big LLMs weights are a piece of history

Salvatore Sanfilippo

大型 LLM 的權重就是一段歷史

原文由 Salvatore Sanfilippo 發布,訂閱此部落格

根據多方的說法,網路正在一點一滴地流失:每年都有一部分舊網頁消失,而且永遠找不回來。我們應該將網際網路檔案館視為現代歷史中最珍貴的資產之一;然而,許多公司與機構卻讓檔案館的存續,以及它搶救那些本將消逝的資料的努力,變得愈來愈困難。據我所知,檔案館的總部設在一座昔日是教堂的建築裡:嗯,再也沒有比把它看作聖地更貼切的了。

想想那些老程式設計師在他們的 Spectrum 上用 Z80 組合語言埋頭苦寫的漫漫長夜。想想關於第一代網際網路的種種討論。還有九〇年代出現的各種次文化。這些事物,正一點一滴地消失之中。

那個人部落格又如何呢?那是一個個普通人將自己意識的一部分傾倒在網路上的生命片段。還有那些隨著出版社倒閉、網站關閉而永遠消失的科學論文與研究歷程。早期的數位藝術、電子遊戲、曾經發表在網路上如今卻已佚失的氣候資料,以及許多的新聞來源,也都是如此。

這是一個眾所周知的問題,而我認為,試圖保存一切這種最直觀的做法,基於現實考量終將失敗:需要付出巨大的努力,卻沒有任何經濟回報——在當今這個世界,花大錢卻賺不到錢的事,正是最難以為繼的。這也是為什麼我認為,即便不精確、會產生幻覺、有所缺漏,大型語言模型壓縮資訊的能力仍然聊勝於無。DeepSeek V3 已經是一個公開、可取得、對網路的有損壓縮視圖,其他那些非常龐大、頂尖的模型亦然。

這並不會讓我們失去的一切失而復得,我們仍應盡力支持網際網路檔案館以及其他類似的機構與努力。但同時,我們也應該專注於一件簡單得多的事:確保那些已公開發布的大型語言模型權重不會佚失,並且也要確保檔案館的資料本身就包含在預訓練資料集中。

本文章由 muse-spark-1.2-contributor 進行翻譯

留言