Kimi K3,以及我们仍能从鹈鹕基准测试中学到的东西
原文由 Simon Willison 于 发布,订阅该博客
中国AI实验室Moonshot AI发布了Kimi K3,称其为“迄今为止最强的模型,拥有2.8万亿参数”。目前可通过其官网和API使用,但承诺“在2026年7月27日前”发布开源权重版本。
月之暗面称这是首个“3T级别开源模型”(大概是把2.8万亿四舍五入到了3万亿),从DeepSeek 1.6T v4 Pro手中夺过了桂冠。据其自测基准,K3在多数项目上击败了Claude Opus 4.8 max和GPT-5.5 high,但不敌Claude Fable 5和GPT-5.6 Sol。
Artificial Analysis关于该模型的报告中有几个亮点:
- “在我们私有的长周期知识工作评估中,Kimi K3的总体Elo达到1547分,较Kimi K2.6提升732分,仅次于Claude Fable 5。”
- “单任务成本(0.94美元)与GPT-5.6 Sol(1.04美元)相近,约为Opus 4.8(1.80美元)的一半,高于开源权重的同类模型”
- “Kimi K3在Artificial Analysis智能指数上的token用量显著下降,输出token数比K2.6减少了21%。”
该模型目前也是Arena.ai前端代码竞技场的榜首模型,甚至超过了Claude Fable 5。
新模型最引人注目的是定价:输入每百万token 3美元,输出每百万token 15美元,与Anthropic的Claude Sonnet系列持平,成为迄今为止中国AI实验室发布的最贵的模型。相比Kimi K2.6等早期模型的0.95美元/4美元有大幅上涨。2.8万亿参数也超过了那个1万亿参数模型的两倍多。
但它画鹈鹕画得怎么样?
我通过OpenRouter(为了避免注册Moonshot API密钥)配合llm-openrouter插件,让它生成了一张鹈鹕骑自行车的SVG:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'这是对话记录。效果如下:

这只鹈鹕消耗了95个输入token和16,658个输出token(其中13,241个是推理token),总成本为25美分!
由于K3支持图像输入,我用上面渲染好的SVG(配合我的alt文本提示词)对它进行了测试,并得到了如下结果(花费0.6美分):
戴着红色围巾的白色鹈鹕的卡通插画,正骑着一辆红色自行车行驶在一条带有白色虚线的灰色道路上;鹈鹕长着巨大的橙色喙,橙色的蹼足正在蹬踏,身后有白色的运动线条;背景是淡蓝色的天空,点缀着白云、一轮黄色的太阳、两只飞翔的小黑鸟,前景则是长着白色小花的绿草地
我们能从鹈鹕身上学到什么?
我的“生成一张鹈鹕骑自行车的SVG”测试至今已有21个月了。它从来都不是一个特别好的基准测试。最初它只是个玩笑,用来吐槽对比这些模型有多么荒谬,但在第一年里,它竟然与模型的实际能力呈现出惊人的相关性。
如今这种关联已基本消失。GPT-5.6和Claude Fable 5的鹈鹕图被GLM-5.2超越了,尽管我很喜欢GLM,但我并不认为它是Fable级别的模型。
(我仍然不相信各家实验室在针对这个基准做特训——如果真做了,我会期待更好的结果。不过Gemini倒是有可能针对“任意动物乘任意载具”的组合做过优化!)
鹈鹕测试最大的局限在于,它完全没有触及当今模型最重要的能力:智能体工具调用,以及在对话不断变长时仍能可靠地操作工具的能力。
所以别再用鹈鹕来对比模型了!
话虽如此,我自己跑这个基准测试仍然能获得不少价值。
首先,它是一个逼我亲自上手试用模型的机制。如果我给你看了一只鹈鹕,就说明我已经成功向它发送过提示词。如果模型提供了官方API,我就会直接用;如果是开源权重(并且小到能在128GB的M5 MacBook Pro上运行),我会尝试在本地机器上运行,通常通过llama.cpp、LM Studio或Ollama。我也经常使用OpenRouter,因为它通常能代理官方API,让我无需再申请新的API密钥。
我的大多数鹈鹕都是用我的LLM命令行工具生成的,这也促使我确保最新模型都能通过其插件得到支持。
更重要的是,哪怕只是发送一句“生成一张鹈鹕骑自行车的SVG”这样的单一提示,也能揭示出模型一些有趣的特性。
以今天Kimi K3的结果为例,运行这些简单的提示词就能凸显出该模型的几个特点。
- 它目前只有一种推理强度,即“max”——这一点很明显。该模型消耗了13,241个推理token才输出了3,417个token的响应。这很费钱——这只鹈鹕就花了25美分!
- “Generate an SVG of a pelican riding a bicycle”这句提示词怎么会算出95个输入token?OpenAI的分词器算出来是10个,Anthropic的分词器则是Opus 4.6算10个、Opus 4.7算30个、Sonnet 5/Fable 5算25个。向Kimi K3发送“hi”会被计为86个token,暗示可能存在一个85个token的隐藏系统提示词。不过它拒绝泄露。
- 视觉能力不错:它生成的alt文本非常好。
K3目前只有一种思考强度级别,但我最近通过用不同强度级别运行同一个鹈鹕提示词,来快速了解不同强度带来的影响,并从中获得了不少价值。例如,这是我为GPT-5.6模型家族做的对比矩阵。
但说到底,鹈鹕测试带给我的主要收获是:
- 这是对模型进行提示的“hello world”练习
- 对简单任务的成本和推理量做一个大致估算
- 确认模型能够输出有效的SVG,并具备基本的几何与空间感知能力。对于能在我笔记本上运行的小模型来说,这一点尤为重要。
- 比较同一模型家族不同版本之间的鹈鹕图仍然很有意思。K3的鹈鹕相比Kimi 2.5有了明显进步。
- 这是我可以分享、证明我已经试用过它的东西。而且,带鹈鹕的评论在Hacker News上已经算是一种传统了,每次我发晚了,都会有人留言问鹈鹕在哪!
随机一篇博客
评论
登录后参与讨论