A few words on DS4

Salvatore Sanfilippo

關於 DS4 的幾句話

我沒想到 DwarfStar 4(https://github.com/antirez/ds4)會這麼快就變得如此受歡迎。很明顯,大家確實需要一種以 single-model integration(單模型整合)為核心的 local AI(本地 AI)體驗,而幾件事恰好同時發生:一個夠大又夠快、足以改變 local inference(本地推論)賽局的 quasi-frontier model(準前沿模型)問世,以及它與極度不對稱的 2/8 bit quants recipe(量化配方)搭配得非常好,因此只需 96 或 128GB 的 RAM 就足以執行。當然,還有:近年來 local AI movement(本地 AI 運動)所累積的所有經驗,而因為有了 GPT 5.5,這些經驗能更即時地被運用(否則你不可能在一週內打造出 DS4——就算有這些幫助,你也得懂得如何溫和地與 LLMs 對話)。

過去這一週既有趣又令人疲憊,我平均每天工作了 14 小時。我平常從 Redis 早期以來,平均每天工作 4 到 6 小時,不過 Redis 剛起步的那幾個月也是如此。

那麼,接下來呢?這是一個始於 DeepSeek v4 Flash 也終於 DeepSeek v4 Flash 的專案嗎?不是的,模型會隨著時間而更迭。在我的想像中,這個領域將由當前在高階 Mac 或「GPU in a box」設備(如 DGX Spark 和其他類似配置)上*實際上夠快*的最佳 open weights model(開放權重模型)所佔據。我敢說,下一個競爭者就是 DeepSeek v4 Flash 本身,採用即將發布的新 checkpoint,以及——希望如此——一個特別為 coding 調校的版本,或許還有其他 expert-variants(專家變體)(不是指 MoE experts(MoE 專家)意義上的專家)。畢竟,就 local inference 而言,擁有 ds4-coding、ds4-legal、ds4-medical 這樣的模型是非常合理的。你只需根據問題載入你需要的模型即可。

自我開始接觸 local inference 以來(我從一開始就在玩這個),這是第一次我發現自己會用本地模型來處理那些我平常會交給 Claude / GPT 的正經事。我認為,這真的是一件大事。這也是第一次,透過 vector steering(向量操控),我才能享受到一種可以更自由地運用 LLM 的體驗。DeepSeek v4 Flash 真的是一個令人驚豔的模型,這點無庸置疑。如果你能在腦中想像,把優秀的小型本地模型體驗當作 A,把你在線上使用的 frontier model(前沿模型)當作 B,那麼 DS4 要比 A 更接近 B 得多。老實說,我已經等不及新版本的到來了(對了,謝謝 DeepSeek)。

所以,在經歷了最初那幾天的混亂之後,我希望這個專案接下來能專注於:quality benchmarks(品質基準測試)、可能加入一個同樣屬於專案一部分的 coding agent(程式碼代理)、在我家建置一套可以執行 CI test(CI 測試)以確保長期品質的 hardware setup(硬體環境)、更多的 ports(移植版本),以及最後但非常重要的一點:distributed inference(分散式推論)(包含 serial(序列)與 parallel(平行)兩種模式)。

目前,先謝謝大家所有的支持:真的非常感謝 :) AI 太過關鍵,不能僅僅是一項被提供的服務。

原文由 Salvatore Sanfilippo 發布

本文章由 muse-spark-1.2-contributor 進行翻譯