Kimi K3 与鹈鹕基准测试的现存价值

Kimi K3 与鹈鹕基准测试的现存价值

Hacker News 摘要

原标题:Kimi K3, and what we can still learn from the pelican benchmark

中国 AI 实验室月之暗面(Moonshot AI)于 2026 年 7 月 16 日上午发布了其性能最强的模型 Kimi K3。该模型拥有 2.8 万亿参数,目前已通过其官网和 API 提供,并承诺在 2026 年 7 月 27 日前发布开源权重版本。月之暗面称其为首个开源的 3T 级模型,超越了深度求索(DeepSeek)拥有 1.6 万亿参数的 v4 Pro。

在自测基准中,Kimi K3 在大多数指标上超越了 Claude Opus 4.8 max 和 GPT-5.5 high,但在性能上逊于 Claude Fable 5 和 GPT-5.6 Sol。根据 Artificial Analysis 发布的报告,Kimi K3 的亮点包括:

性能与评价

• 在私有的长周期知识工作评估中,Kimi K3 的 Elo 分数达到 1547 分,比上一代 Kimi K2.6 提升了 732 分,仅次于 Claude Fable 5。

• 在单次任务成本上,Kimi K3 约为 0.94 美元,与 GPT-5.6 Sol 的 1.04 美元相近,约为 Opus 4.8 价格的一半,但高于同类开源模型。

• 在智能指数评估中,Kimi K3 的 Token 使用量显著下降,输出 Token 比 K2.6 减少了 21%。

• 该模型目前在 Arena.ai 的前端代码竞技场中排名第一,甚至超过了 Claude Fable 5。

定价策略

Kimi K3 的定价为每百万输入 Token 3 美元,每百万输出 Token 15 美元。这一价格水平与 Anthropic 的 Claude Sonnet 系列持平,也是中国 AI 实验室迄今为止发布的最昂贵的模型。相比 Kimi 2.6(0.95 美元输入 / 4 美元输出),其价格涨幅巨大。Kimi K3 的参数量也是之前 1T 模型的两倍以上。

鹈鹕基准测试

作者 Simon Willison 使用其惯用的测试方式,即要求模型生成一个 骑自行车的鹈鹕 的 SVG 图像。他通过 OpenRouter 运行了 llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle' 命令。

测试结果显示,Kimi K3 生成这张图片消耗了 95 个输入 Token 和 16658 个输出 Token,其中包含 13241 个推理 Token。这次生成的总成本达到了 25 美分。

此外,作者还测试了 Kimi K3 的视觉能力。他将生成的 SVG 图像输入模型要求其撰写替代文本(alt text)。模型成功识别并描述了画面内容:一只戴着红色围巾、骑着红色自行车的白色鹈鹕,背景包含蓝天、白云、黄太阳以及飞鸟和草地。这次视觉任务仅花费了 0.6 美分。

关于鹈鹕测试的思考

生成骑自行车的鹈鹕这一测试方法已有 21 个月。虽然它最初只是一个玩笑,但第一年确实与模型性能呈现出惊人的相关性。不过,这种相关性现在已经减弱。例如,GPT-5.6 和 Claude Fable 5 在这项测试中反而不如智谱的 GLM-5.2,但这并不意味着 GLM-5.2 的综合实力更强。

该测试最大的局限性在于无法衡量当前模型最重要的能力:智能体工具调用以及在长对话中稳定操作工具的能力。尽管如此,作者认为这项测试仍有其价值:

1. 作为上手练习:它是强制自己实际运行新模型的一种方式。

2. 验证模型基础能力:确认模型是否能输出有效的 SVG 格式,以及是否具备基础的几何感和空间意识。

3. 估算成本与推理水平:通过简单任务快速了解模型的推理消耗。

4. 家族对比:可以直观看到同一系列模型在不同版本间的改进。

针对 Kimi K3 的具体发现

通过这次简单的提示词测试,作者发现了关于 Kimi K3 的几个特点:

高昂的推理成本:Kimi K3 目前似乎只有一个名为 max 的推理级别。在测试中,它消耗了超过 1.3 万个推理 Token 才产出 3417 个响应 Token,导致单次成本很高。

隐藏的系统提示词:简单的提示词在 Kimi K3 中被计算为 95 个输入 Token。相比之下,OpenAI 的计数器仅显示 10 个,Anthropic 约为 25 到 30 个。即使只输入 hi,Kimi K3 也会计算 86 个 Token,这暗示该模型可能携带了大约 85 个字符的隐藏系统提示词。

优秀的视觉功能:它生成的替代文本质量非常高。

总的来说,Kimi K3 在图像生成和空间理解上比 Kimi 2.5 有了显著进步。虽然这种测试不再是万能的基准,但它依然是观察模型特征的有效手段。


原文:https://simonwillison.net/2026/Jul/16/kimi-k3/

评论:https://news.ycombinator.com/item?id=48947717

Report Page