Kimi K3,以及我們還能從鵜鶘基準測試中學到什麼
原文由 Simon Willison 于 發布,訂閱此部落格
中國 AI 實驗室 Moonshot AI 宣布推出 Kimi K3,稱其為「迄今最強大的模型,擁有 2.8 兆參數」。目前可透過其官網與 API 使用,但承諾將在「2026 年 7 月 27 日前」釋出開源權重版本。
Moonshot 稱這是首個「開放式 3T 等級模型」(我想他們是把 2.8 兆四捨五入成 3 兆),從 DeepSeek 1.6T v4 Pro 手中奪下王座。他們自行公布的基準測試數據顯示,K3 大多勝過 Claude Opus 4.8 max 與 GPT-5.5 high,但不敵 Claude Fable 5 與 GPT-5.6 Sol。
以下是來自該模型的 Artificial Analysis 報告的幾個重點:
- 「在我們的私有長週期知識工作評測中,Kimi K3 的總體 Elo 分數達到 1547,比 Kimi K2.6 高出 732 分,僅次於 Claude Fable 5。」
- 「每項任務成本(0.94 美元)與 GPT-5.6 Sol(1.04 美元)相近,約為 Opus 4.8(1.80 美元)的一半,但高於其他開源權重同類模型」
- 「Kimi K3 在 Artificial Analysis Intelligence Index 上的 token 使用量顯著下降,比 K2.6 少用了 21% 的輸出 token。」
該模型現在也是 Arena.ai 前端程式碼競技場上的領先模型,甚至超越了 Claude Fable 5。
新模型最引人注目的是定價:每百萬輸入 token 3 美元、每百萬輸出 token 15 美元,與 Anthropic 的 Claude Sonnet 系列同級,也使其成為迄今中國 AI 實驗室發布過最貴的模型。相較於先前的模型例如 Kimi K2.6 的 0.95/4 美元,這是大幅上漲。2.8 兆參數也超過該 1T 模型的一倍以上。
但鵜鶘測試表現如何?
我透過 OpenRouter(為了避免去註冊 Moonshot API 金鑰)搭配 llm-openrouter 外掛來產生一張鵜鶘騎腳踏車的 SVG:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'這是對話紀錄。結果看起來像這樣:

這隻鵜鶘花了 95 個輸入 token 和 16,658 個輸出 token(其中 13,241 個是推理 token),總成本為 25 美分!
由於 K3 接受圖片輸入,我用上面渲染好的 SVG 對它進行測試(使用我的 alt 文字提示)並得到以下結果(花費 0.6 美分):
卡通插畫:一隻戴著紅色圍巾的白色鵜鶘,騎著一輛紅色腳踏車行駛在有白色虛線的灰色道路上;鵜鶘有著大大的橘色喙和橘色的蹼足正在踩踏板,後方有白色的動態線條;背景是淡藍色天空中有白雲、一顆黃色太陽、兩隻飛行中的小黑鳥,以及前景有點綴著小白花的綠色草地
我們能從鵜鶘身上學到什麼?
我的「產生一張鵜鶘騎腳踏車的 SVG」測試至今已經 21 個月了。它從來就不是一個特別好的基準測試。一開始只是個玩笑,想表達要比較這些模型有多麼荒謬地困難,但在第一年裡,它竟意外地與模型的實際能力呈現出驚人的相關性。
如今這種關聯大多已經斷裂。GPT-5.6 和 Claude Fable 5 的鵜鶘表現被 GLM-5.2 輕鬆超越,雖然我很喜歡 GLM,但我不認為它是 Fable 等級的模型。
(我仍然不認為各家實驗室有針對這個基準測試進行訓練——如果有的話,我會期待看到好得多的結果。不過 Gemini 倒是有可能針對「任何動物搭乘載具」的組合做過優化!)
鵜鶘測試最大的限制在於,它完全沒有觸及當今模型最重要的能力:代理式工具呼叫,以及在對話越來越長時仍能可靠地操作工具的能力。
所以別再用鵜鶘來比較模型了!
話雖如此,我自己跑這個基準測試仍然能獲得不少價值。
首先,它是一個逼自己實際去試用模型的外在推力。如果我秀出一隻鵜鶘,就代表我已經成功對它下過提示詞。如果模型有官方 API,我就會用官方 API;如果是開源權重模型(而且小到能塞進 128GB 的 M5 MacBook Pro),我會試著在自己的電腦上跑,通常是透過 llama.cpp 或 LM Studio 或 Ollama。我也經常使用 OpenRouter,因為它通常能提供官方 API 的代理,讓我不需要再申請新的 API 金鑰。
我的大多數鵜鶘都是用我的 LLM CLI 工具產生的,這也能促使我確保最新的模型都有被它(透過其中一個外掛)支援。
但更重要的是,即使只是下達「Generate an SVG of a pelican riding a bicycle」這樣單一的提示詞,也能揭示出模型有趣的特性。
以今天 Kimi K3 的結果為例,執行這些簡單的提示詞有助於突顯關於該模型的幾個重點。
- 它目前只有一種推理強度,就是「max」——而且非常明顯。模型消耗了 13,241 個推理 token,才輸出 3,417 個 token 的回應。這很花錢——那隻鵜鶘就花了 25 美分!
- 「Generate an SVG of a pelican riding a bicycle」這個提示詞怎麼會算出 95 個輸入 token?OpenAI 的 tokenizer 算出來是 10 個,Anthropic 的則是 Opus 4.6 算 10 個、Opus 4.7 算 30 個、Sonnet 5/Fable 5 算 25 個。對 Kimi K3 下「hi」這個提示詞就被算成 86 個 token,暗示可能存在一個 85 個 token 的隱藏系統提示詞。不過它拒絕洩露就是了。
- 視覺能力運作良好:它產生的 alt 文字非常好。
K3 目前只有一種思考強度等級,但我最近透過用不同強度等級跑同一個鵜鶘提示詞,來快速了解這些等級會帶來什麼影響,從中獲得了不少價值。舉例來說,這是我為 GPT-5.6 模型家族整理的對照表。
但說到底,我從鵜鶘測試中獲得的主要收穫是:
- 它是對模型下提示詞的「hello world」練習
- 對一個簡單任務的成本與推理量的粗略估算
- 確認模型能夠輸出有效的 SVG,並且對幾何與空間感有基本的概念。這對於能在我筆電上跑的小型模型來說尤其重要。
- 在同一個模型家族的不同版本之間比較鵜鶘仍然很有趣。K3 的鵜鶘相較於 Kimi 2.5 有顯著的進步。
- 這是我可以分享、證明我已經試用過它的東西。而且在 Hacker News 上,帶有鵜鶘的留言現在已經算是一種傳統了,每當我晚發文,就會有人留言問鵜鶘在哪裡!
隨機一篇部落格
留言
登入後參與討論