Kimi K3, and what we can still learn from the pelican benchmark

Simon Willison

Kimi K3,以及我們還能從鵜鶘基準測試中學到什麼

原文由 Simon Willison 發布,訂閱此部落格

中國 AI 實驗室 Moonshot AI 宣布推出 Kimi K3,稱其為「迄今最強大的模型,擁有 2.8 兆參數」。目前可透過其官網與 API 使用,但承諾將在「2026 年 7 月 27 日前」釋出開源權重版本。

Moonshot 稱這是首個「開放式 3T 等級模型」(我想他們是把 2.8 兆四捨五入成 3 兆),從 DeepSeek 1.6T v4 Pro 手中奪下王座。他們自行公布的基準測試數據顯示,K3 大多勝過 Claude Opus 4.8 max 與 GPT-5.5 high,但不敵 Claude Fable 5 與 GPT-5.6 Sol。

以下是來自該模型的 Artificial Analysis 報告的幾個重點:

  • 「在我們的私有長週期知識工作評測中,Kimi K3 的總體 Elo 分數達到 1547,比 Kimi K2.6 高出 732 分,僅次於 Claude Fable 5。」
  • 「每項任務成本(0.94 美元)與 GPT-5.6 Sol(1.04 美元)相近,約為 Opus 4.8(1.80 美元)的一半,但高於其他開源權重同類模型」
  • 「Kimi K3 在 Artificial Analysis Intelligence Index 上的 token 使用量顯著下降,比 K2.6 少用了 21% 的輸出 token。」

該模型現在也是 Arena.ai 前端程式碼競技場上的領先模型,甚至超越了 Claude Fable 5。

新模型最引人注目的是定價:每百萬輸入 token 3 美元、每百萬輸出 token 15 美元,與 Anthropic 的 Claude Sonnet 系列同級,也使其成為迄今中國 AI 實驗室發布過最貴的模型。相較於先前的模型例如 Kimi K2.6 的 0.95/4 美元,這是大幅上漲。2.8 兆參數也超過該 1T 模型的一倍以上。

但鵜鶘測試表現如何?

我透過 OpenRouter(為了避免去註冊 Moonshot API 金鑰)搭配 llm-openrouter 外掛來產生一張鵜鶘騎腳踏車的 SVG:

llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'

這是對話紀錄。結果看起來像這樣:

見下方描述

這隻鵜鶘花了 95 個輸入 token 和 16,658 個輸出 token(其中 13,241 個是推理 token),總成本為 25 美分

由於 K3 接受圖片輸入,我用上面渲染好的 SVG 對它進行測試(使用我的 alt 文字提示)並得到以下結果(花費 0.6 美分):

卡通插畫:一隻戴著紅色圍巾的白色鵜鶘,騎著一輛紅色腳踏車行駛在有白色虛線的灰色道路上;鵜鶘有著大大的橘色喙和橘色的蹼足正在踩踏板,後方有白色的動態線條;背景是淡藍色天空中有白雲、一顆黃色太陽、兩隻飛行中的小黑鳥,以及前景有點綴著小白花的綠色草地

我們能從鵜鶘身上學到什麼?

我的「產生一張鵜鶘騎腳踏車的 SVG」測試至今已經 21 個月了。它從來就不是一個特別好的基準測試。一開始只是個玩笑,想表達要比較這些模型有多麼荒謬地困難,但在第一年裡,它竟意外地與模型的實際能力呈現出驚人的相關性

如今這種關聯大多已經斷裂。GPT-5.6Claude Fable 5 的鵜鶘表現被 GLM-5.2 輕鬆超越,雖然我很喜歡 GLM,但我不認為它是 Fable 等級的模型。

(我仍然不認為各家實驗室有針對這個基準測試進行訓練——如果有的話,我會期待看到好得多的結果。不過 Gemini 倒是有可能針對「任何動物搭乘載具」的組合做過優化!)

鵜鶘測試最大的限制在於,它完全沒有觸及當今模型最重要的能力:代理式工具呼叫,以及在對話越來越長時仍能可靠地操作工具的能力。

所以別再用鵜鶘來比較模型了!

話雖如此,我自己跑這個基準測試仍然能獲得不少價值。

首先,它是一個逼自己實際去試用模型的外在推力。如果我秀出一隻鵜鶘,就代表我已經成功對它下過提示詞。如果模型有官方 API,我就會用官方 API;如果是開源權重模型(而且小到能塞進 128GB 的 M5 MacBook Pro),我會試著在自己的電腦上跑,通常是透過 llama.cppLM StudioOllama。我也經常使用 OpenRouter,因為它通常能提供官方 API 的代理,讓我不需要再申請新的 API 金鑰。

我的大多數鵜鶘都是用我的 LLM CLI 工具產生的,這也能促使我確保最新的模型都有被它(透過其中一個外掛)支援。

但更重要的是,即使只是下達「Generate an SVG of a pelican riding a bicycle」這樣單一的提示詞,也能揭示出模型有趣的特性。

今天 Kimi K3 的結果為例,執行這些簡單的提示詞有助於突顯關於該模型的幾個重點。

  1. 它目前只有一種推理強度,就是「max」——而且非常明顯。模型消耗了 13,241 個推理 token,才輸出 3,417 個 token 的回應。這很花錢——那隻鵜鶘就花了 25 美分!
  2. 「Generate an SVG of a pelican riding a bicycle」這個提示詞怎麼會算出 95 個輸入 token?OpenAI 的 tokenizer 算出來是 10 個,Anthropic 的則是 Opus 4.6 算 10 個、Opus 4.7 算 30 個、Sonnet 5/Fable 5 算 25 個。對 Kimi K3 下「hi」這個提示詞就被算成 86 個 token,暗示可能存在一個 85 個 token 的隱藏系統提示詞。不過它拒絕洩露就是了。
  3. 視覺能力運作良好:它產生的 alt 文字非常好。

K3 目前只有一種思考強度等級,但我最近透過用不同強度等級跑同一個鵜鶘提示詞,來快速了解這些等級會帶來什麼影響,從中獲得了不少價值。舉例來說,這是我為 GPT-5.6 模型家族整理的對照表

但說到底,我從鵜鶘測試中獲得的主要收穫是:

  1. 它是對模型下提示詞的「hello world」練習
  2. 對一個簡單任務的成本與推理量的粗略估算
  3. 確認模型能夠輸出有效的 SVG,並且對幾何與空間感有基本的概念。這對於能在我筆電上跑的小型模型來說尤其重要。
  4. 在同一個模型家族的不同版本之間比較鵜鶘仍然很有趣。K3 的鵜鶘相較於 Kimi 2.5 有顯著的進步。
  5. 這是我可以分享、證明我已經試用過它的東西。而且在 Hacker News 上,帶有鵜鶘的留言現在已經算是一種傳統了,每當我晚發文,就會有人留言問鵜鶘在哪裡!

本文章由 muse-spark-1.2-contributor 進行翻譯

留言