Kimi K3 发布:2.8 万亿参数与“鹈鹕测试”的启示

Simon Willison11 天前

中国 AI 实验室 Moonshot AI 发布了 Kimi K3,称其为“迄今最强模型”,参数规模为 2.8 万亿。目前该模型已可通过网页和 API 使用,并承诺在 2026 年 7 月 27 日前开放权重。

Moonshot 将 Kimi K3 称为首个“开放 3T 级模型”。这里的 3T 应是将 2.8 万亿参数向上取整后的说法。按这一口径,它超过了 DeepSeek 1.6T 参数规模的 v4 Pro。

根据 Moonshot 自报的基准结果,Kimi K3 在多数项目上超过 Claude Opus 4.8 max 和 GPT-5.5 high,但落后于 Claude Fable 5 和 GPT-5.6 Sol。

第三方评测机构 Artificial Analysis 对该模型给出了一些值得注意的结果:

  • 在其私有的长周期知识工作评测中,Kimi K3 总体 Elo 为 1547,比 Kimi K2.6 高 732 分,仅次于 Claude Fable 5。
  • 单任务成本为 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,约为 Opus 4.8 的一半,但高于其他开放权重模型。
  • 在 Artificial Analysis Intelligence Index 上,Kimi K3 的输出 token 用量显著下降,比 Kimi K2.6 少 21%。

此外,Kimi K3 目前在 Arena.ai 的前端代码竞技场中排名第一,超过了 Claude Fable 5。

定价:更贵的中国大模型

Kimi K3 的价格也很突出:

  • 输入:每百万 token 3 美元
  • 输出:每百万 token 15 美元

这一价格与 Anthropic Claude Sonnet 系列大致处于同一档,也使其成为目前中国 AI 实验室发布的最昂贵模型之一。相比此前 Kimi K2.6 的每百万输入 0.95 美元、输出 4 美元,涨幅明显。

参数规模方面,Kimi K3 的 2.8 万亿参数也超过 Kimi K2.6 约 1 万亿参数规模的两倍。

“骑自行车的鹈鹕”测试

作者使用 OpenRouter 调用 Kimi K3,让模型完成一个简单任务:

llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'

这个提示要求模型生成“一只骑自行车的鹈鹕”的 SVG。

结果显示,这次生成消耗了:

  • 输入 token:95
  • 输出 token:16,658
  • 其中推理 token:13,241
  • 总成本:约 0.25 美元

对于这样一个看似简单的 SVG 任务来说,成本并不低。

由于 Kimi K3 支持图像输入,作者又把生成出的 SVG 渲染图交给 Kimi K3,让它生成图像描述。模型返回的描述大意为:

一幅卡通插画:一只白色鹈鹕戴着红围巾,骑着红色自行车沿灰色道路前进,道路上有白色虚线;鹈鹕有橙色大喙和橙色蹼足,正在踩踏板,身后有白色运动线;背景包括浅蓝天空、白云、黄色太阳、两只飞行的小黑鸟,以及前景中的绿色草地和白色小花。

这次视觉描述任务成本约为 0.006 美元。作者认为,Kimi K3 的视觉理解表现不错,生成的替代文本质量较高。

这个测试还能说明什么?

“生成一只骑自行车的鹈鹕 SVG”这个测试已经存在 21 个月。它一开始并不是严肃基准,更像是对模型比较困难程度的玩笑。但在早期一年里,它和模型整体能力之间曾出现过一定相关性。

不过,这种相关性现在已经明显减弱。比如 GPT-5.6 和 Claude Fable 5 在这个任务上的结果,被 GLM-5.2 超过;但作者并不认为 GLM-5.2 因此就是 Claude Fable 5 同级别模型。

作者也不认为主流实验室正在专门针对“鹈鹕骑车”训练模型。如果真是这样,结果理应更好。当然,也不排除某些模型对“动物 + 交通工具”这类组合有过优化。

更重要的是,这个测试并不能覆盖当下模型最关键的能力:

  • 智能体式工具调用
  • 长对话中的工具稳定操作
  • 多步骤任务执行可靠性

因此,作者明确提醒:不要用“鹈鹕测试”来严肃比较模型。

但它仍然有实用价值

尽管如此,作者仍然会继续运行这个测试,因为它至少能提供几个方面的信息。

首先,它是一个强制自己实际调用模型的方式。如果作者展示了某个模型生成的鹈鹕,就意味着他确实把提示跑通了。对于有官方 API 的模型,会优先使用官方 API;对于开放权重且能在本地设备上运行的模型,则会尝试用 llama.cpp、LM Studio 或 Ollama 等工具本地运行;有时也会通过 OpenRouter 这类服务间接调用官方 API。

其次,一个简单提示也可能暴露模型特征。以 Kimi K3 为例:

  1. 目前似乎只有一种推理强度:“max”
    这在 token 用量上非常明显。模型消耗了 13,241 个推理 token,最终输出 3,417 个响应 token。一次简单 SVG 生成花费约 0.25 美元。

  2. 输入 token 计数偏高
    “Generate an SVG of a pelican riding a bicycle”这个提示,在 OpenAI tokenizer 中约为 10 个 token;Anthropic 的不同模型计数在 10 到 30 个 token 不等。但在 Kimi K3 中计为 95 个输入 token。另有用户测试发现,向 Kimi K3 输入“hi”会计为 86 个 token,这暗示可能存在约 85 个 token 的隐藏系统提示。不过模型拒绝泄露相关内容。

  3. 视觉能力表现良好
    Kimi K3 对生成图像的描述准确、细节丰富,说明其图像输入能力可用。

一个“Hello World”式模型检查

作者总结称,这个测试真正的价值并不是排名,而是作为一种轻量级检查:

  1. 它相当于大模型提示调用的“Hello World”。
  2. 它能粗略估计简单任务的成本和推理 token 消耗。
  3. 它可以确认模型是否能输出有效 SVG,并具备基本几何与空间理解能力。
  4. 对同一模型家族的不同版本进行比较时,仍然有一定观察价值。例如 Kimi K3 的鹈鹕结果相比 Kimi 2.5 有明显提升。
  5. 它是一种可分享的“我确实试过这个模型”的证据。

总体来看,Kimi K3 的发布展示了 Moonshot AI 在超大参数开放模型上的进一步推进:参数规模、基准成绩、视觉能力和前端代码表现都值得关注。但它的高价格、推理 token 消耗,以及当前推理强度选择有限,也提示开发者在实际使用中需要认真评估成本与任务收益。

评论

请登录后发表观点

暂无数据