Big LLMs weights are a piece of history

Salvatore Sanfilippo

大規模LLMの重みは歴史の一部だ

さまざまな報告が示すように、ウェブからは少しずつ失われているものがあります。毎年、古いウェブページの一部が消え、永遠に失われているのです。Internet Archiveは、現代史を構成する最も貴重なものの一つと考えるべきです。ところが、多くの企業や組織が、Archiveが存続し、そうでなければ失われてしまうものを収集・蓄積できる可能性を、ますます低くしています。Archiveの本部は、かつて教会だった建物にあると聞いています。それなら、ここを聖なる場所と考える以上にふさわしい見方はないでしょう。

昔のプログラマーたちが、SpectrumでZ80アセンブリをいじりながら費やした長い時間を想像してみてください。インターネット黎明期をめぐる、あらゆる議論。90年代に現れたサブカルチャー。そのすべてが、少しずつ失われつつあります。

個人ブログはどうでしょうか。自分の意識の一部をインターネットに投げ込んだ、一人ひとりの人生の断片です。出版社が倒産し、ウェブサイトが閉鎖されることで、科学論文や研究の手順も永遠に失われています。初期のデジタルアートやビデオゲーム、かつてインターネットで公開され、今では失われた気候データ、そして数多くのニュース源も同じです。

これはよく知られた問題です。あらゆるものを保存しようとする、わかりやすい取り組みは、現実的な理由から失敗すると思います。経済的な見返りがゼロのことに、多大な労力を注ぐことになるからです。多額の費用がかかるのに利益を生まない努力をするには、今の世界は決して最適な場所ではありません。だからこそ私は、たとえ不正確で、幻覚を含み、欠落もあるとしても、LLMが情報を圧縮できることは、何もないよりはよいと考えています。DeepSeek V3はすでに、公開されている、インターネットを非可逆圧縮した姿です。他の非常に大規模な最先端モデルも同様です。

これで、失われつつあるものをすべて取り戻せるわけではありません。Internet Archiveや、同様の機関・取り組みを支援するために、私たちは懸命に努力すべきです。しかし同時に、もっと単純な取り組みにも力を注ぐべきです。公開されたLLMの重みが失われないようにすること。そして、Archive自体も事前学習データセットの一部に含まれるようにすることです。

原文は Salvatore Sanfilippo により に公開されました。

この記事は「gpt-5.6-terra」を使用して翻訳されました。