Kimi K3:2.8万亿参数的中国开源模型,以及我们还能从"鹈鹕基准测试"中学到什么(2026-07-21)
本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:Kimi K3, and what we can still learn from the pelican benchmark 原文链接:https://simonwillison.net/2026/Jul/16/kimi-k3/ 原文发布:2026-07-16 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。
译者按
上周(7月16日),月之暗面(Moonshot AI)正式发布了 Kimi K3——2.8 万亿参数的巨型模型,号称首个”开源 3T 级”模型,承诺于 7 月 27 日前开放权重。Simon Willison 在第一时间用自己标志性的”鹈鹕骑自行车”测试对它做了上手体验,并写下了一篇既有趣又有深度的评测。
这篇译文的价值在于:第一,Kimi K3 是目前中国 AI 实验室发布的规模最大的开源模型,它的定价策略($3/$15 per million tokens)直接将中国模型拉到了 Claude Sonnet 的价位段;第二,Simon 作为全球最受尊敬的 AI 博主之一,他的评测方式——用”鹈鹕测试”作为快速上手手段——为中文读者提供了一种实用的模型评估方法论。中文圈讨论 Kimi K3 的帖子不少,但像 Simon 这样把定价、benchmark、token 消耗、推理深度和实用性结合在一起的零基础评估极少见。
正文
中国 AI 实验室月之暗面(Moonshot AI)今早宣布了 Kimi K3,称其为”迄今为止能力最强的模型,拥有 2.8 万亿参数”。该模型目前已通过官网和 API 提供服务,开源权重版本承诺”将于 2026 年 7 月 27 日前”发布。
月之暗面称这是首个”开源 3T 级模型”(我猜他们把 2.8 万亿四舍五入到了 3 万亿),从 DeepSeek 的 1.6T v4 Pro 手中接过了王冠。根据他们自报的基准测试结果,K3 在多数指标上超越了 Claude Opus 4.8 max 和 GPT-5.5 high,但落后于 Claude Fable 5 和 GPT-5.6 Sol。
来自 Artificial Analysis 报告的几个亮点:
- “在我们私有的长期知识工作评估中,Kimi K3 的总 Elo 得分为 1547,比 Kimi K2.6 提升了 732 分,仅次于 Claude Fable 5。”
- “每次任务成本($0.94)与 GPT-5.6 Sol($1.04)相近,约为 Opus 4.8($1.80)的一半,但高于开源同行。”
- “在 Artificial Analysis Intelligence Index 上,Kimi K3 的 token 使用量显著降低,输出 token 比 K2.6 减少了 21%。”
该模型目前在 Arena.ai 的前端编程竞技场上也位居榜首,甚至超越了 Claude Fable 5。
新模型的定价值得关注:输入 token $3/百万,输出 token $15/百万,与 Anthropic 的 Claude Sonnet 系列处于同一水平,成为迄今为止中国 AI 实验室发布的最贵模型。相比其早期模型 Kimi K2.6($0.95/$4)有显著提价。2.8 万亿参数也超过了那个 1T 模型的两倍。
但它画鹈鹕怎么样?
我用 OpenRouter(避免注册月之暗面 API 密钥)配合 llm-openrouter 插件,生成了一个骑自行车的鹈鹕 SVG:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'
这只鹈鹕消耗了 95 个输入 token 和 16,658 个输出 token(其中 13,241 个是推理 token),总共花费了 25 美分!
由于 K3 支持图像输入,我把上面渲染出的 SVG 喂给它(配合我的替代文本提示),结果如下(花费 0.6 美分):
一只白鹈鹕的卡通插画,戴着红色围巾,骑着红色自行车,行驶在一条带有白色虚线的灰色道路上;鹈鹕有着巨大的橙色喙和正在蹬车的橙色蹼足,身后有白色运动线;背景是浅蓝色天空点缀着白云,一轮黄色的太阳,两只小黑鸟在飞翔,前景是绿色的草地和细小的白花。
我们能从鹈鹕中学到什么?
我的”生成一个骑自行车的鹈鹕 SVG”测试已经 21 个月了。它从来不是一个特别好的基准测试。它最开始只是一个玩笑,用来调侃比较这些模型有多么荒谬的难度,但在第一年里,它却出人意料地与模型实际能力有着惊人的相关性。
现在这种关联基本已经断了。GPT-5.6 和 Claude Fable 5 的鹈鹕已经被 GLM-5.2 超越——尽管我非常喜欢 GLM,但我不认为它是 Fable 级别的模型。
(我仍然不相信实验室在针对这个基准训练——如果是的话,我期待看到好得多的结果。不过 Gemini 确实有可能针对”某种动物在某种交通工具上”的任何组合做了优化!)
鹈鹕测试最大的局限性在于,它完全没有触及当今模型最重要的事:智能体工具调用(agentic tool calling),以及对话长度增长时可靠操作工具的能力。
所以,不要用鹈鹕来比较模型!
但话虽如此,我仍然从自己运行这个基准测试中获得了很多价值。
首先,它是我真正上手尝试模型的强制驱动力。如果我展示给你一只鹈鹕,意味着我已经成功通过提示跑通了它。如果模型有官方 API,我会用它;如果是开源权重且小到能塞进 128GB M5 MacBook Pro,我会在本地机器上运行,通常通过 llama.cpp、LM Studio 或 Ollama。我经常用 OpenRouter,因为它通常可以提供官方 API 的代理,而无需我注册新的 API 密钥。
我的大多数鹈鹕都是用我自己的 LLM CLI 工具生成的,这促使我确保最新模型都能通过它的某个插件得到支持。
更重要的是,即使是一个”生成一个骑自行车的鹈鹕 SVG”提示也能揭示有趣的模型特性。
以 Kimi K3 的结果为例。运行这些简单提示帮助强调了关于模型的几个关键点:
它目前只有一个推理强度——“max”——而且这很明显。 模型消耗了 13,241 个推理 token 来输出 3,417 个 token 的响应。这很昂贵——这只鹈鹕花了 25 美分!
提示 “Generate an SVG of a pelican riding a bicycle” 怎么可能有 95 个输入 token? OpenAI 的 tokenizer 统计为 10 个,Anthropic 对 Opus 4.6 统计为 10 个,对 Opus 4.7 统计为 30 个,对 Sonnet 5/Fable 5 统计为 25 个。向 Kimi K3 输入 “hi” 会统计出 86 个 token,说明可能存在一个约 85 token 的隐藏系统提示。但它拒绝泄露出来。
视觉能力表现出色: 它生成的替代文本非常好。
K3 目前只有一个思考(thinking)强度级别,但我最近发现将同一个鹈鹕提示以不同的强度级别运行,能快速了解它们的影响——这非常有价值。例如,这里是我为 GPT-5.6 模型家族做的矩阵。
实际上,我从鹈鹕测试中获得的主要收获是:
- 它是提示模型的”Hello World”练习
- 对简单任务给出粗略的成本和推理估算
- 确认模型能输出有效的 SVG,并且对几何和空间意识有基本理解——对于在笔记本上运行的小模型来说,这点重要得多
- 在同一模型家族的不同版本之间比较鹈鹕仍然很有趣——K3 的鹈鹕相比 Kimi 2.5 有显著提升
- 它是我可以分享的东西,证明我已经尝试过这个模型
- 而且在 Hacker News 上,带有鹈鹕的评论已经成为一种传统——每当我发晚了,就会有人留言问鹈鹕在哪里!
译者注
- “鹈鹕骑自行车”测试:Simon Willison 在 2024 年底首创的非正式基准测试,要求模型生成一个鹈鹕骑自行车的 SVG。因为 SVG 是结构化格式(需要几何理解),又涉及常识推理(鹈鹕、自行车),加上”骑”这一动作的空间关系,能很好地测试模型的综合能力。
- Moonshot AI(月之暗面):中国 AI 初创公司,创始人杨植麟毕业于卡内基梅隆大学,前清华大学助理教授。Kimi 是其主力产品线。
- 3T 级模型:T = Trillion(万亿)。2.8T 参数意味着模型有约 2.8 万亿个可训练参数,是典型的 MoE(混合专家)架构——并非全部参数在每次推理时都被激活。
- $15/百万输出 token:一个 token 大约 0.75 个英文单词或 0.4 个汉字。$15/百万 token 意味着生成约 75 万英文单词的成本为 15 美元(约 108 元人民币)。
- OpenRouter:聚合多家 AI 模型 API 的平台,用户无需为每个模型注册单独账号。
- 关于开源协议:Kimi K3 承诺以”开源权重”形式发布,但截至 Simon 发稿时尚未公开。这与 DeepSeek 的完全开源策略有所不同。
- Claude Opus 4.8 max / Claude Fable 5 / GPT-5.5 / GPT-5.6 Sol:均为 2026 年上半年发布的顶尖前沿模型,代表了当时 AI 能力的上限。