Big LLMs weights are a piece of history

Salvatore Sanfilippo

거대 LLM 가중치는 역사의 한 조각이다

원문은 Salvatore Sanfilippo님이 에 게재했습니다. 이 블로그 구독하기

여러 증언에 따르면 웹은 조금씩 사라지고 있다. 매년 오래된 웹페이지 중 일부가 영원히 사라진다. 우리는 인터넷 아카이브를 현대사의 가장 귀중한 유산 중 하나로 여겨야 마땅하다. 하지만 오히려 많은 기업과 단체들이 아카이브가 살아남아 그렇지 않으면 사라질 자료들을 축적할 가능성을 점점 더 어렵게 만들고 있다. 아카이브 본부가 과거 교회였던 건물에 자리하고 있다고 들었다. 그곳을 성스러운 장소로 여기는 것만큼 적절한 비유도 없을 것이다.

스펙트럼에서 Z80 어셈블리로 해킹에 몰두하며 보낸 옛 프로그래머들의 긴 시간을 상상해 보라. 초기 인터넷에 대해 오갔던 모든 토론을. 90년대에 등장했던 하위문화들을. 이 모든 것이 조각조각 사라져 가고 있다.

개인 블로그는 어떤가. 인터넷에 자신의 의식 일부를 쏟아부은 개개인의 삶의 조각들이다. 출판사가 문을 닫고 웹사이트가 폐쇄되면서 영원히 사라진 논문과 연구 과정들. 한때 인터넷에 공개됐다가 이제는 사라져 버린 초기 디지털 아트와 비디오 게임, 기후 데이터, 그리고 수많은 뉴스 소스들까지.

이는 이미 잘 알려진 문제이며, 모든 것을 보존하려는 가장 당연해 보이는 접근은 현실적인 이유로 실패할 것이라고 생각한다. 경제적 이득은 전혀 없는데 막대한 노력이 필요하기 때문이다. 지금의 세상은 돈은 많이 들고 수익은 되지 않는 일에 힘을 쏟기에 그다지 좋은 환경이 아니다. 그래서 나는 LLM이 정보를 압축하는 능력 — 비록 부정확하고 환각을 일으키며 부족하더라도 — 이 없는 것보다는 낫다고 믿는다. DeepSeek V3는 이미 공개된, 인터넷에 대한 손실 압축본이며, 다른 초대형 최신 모델들도 마찬가지다.

이것이 우리가 잃고 있는 모든 것을 되돌려주지는 못할 것이다. 우리는 인터넷 아카이브와 그와 유사한 기관 및 노력을 적극적으로 지원해야 한다. 하지만 동시에 훨씬 더 단순한 일에 집중해야 한다. 공개된 LLM의 가중치가 사라지지 않도록 하는 것, 그리고 아카이브 자체가 사전 학습 데이터셋에 포함되도록 하는 것이다.

이 글은 muse-spark-1.2-contributor 모델을 사용해 번역했습니다.

댓글