上线 72 小时,Kimi K3 交出第一份成绩单
7 月 17日凌晨,月之暗面(Moonshot AI)发布 Kimi K3。这是一个总参数量2.8万亿的MoE(Mixture of Experts,混合专家)模型,每个token激活896个专家中的16个,原生支持视觉输入和100万token上下文窗口。官方称其为「**首个开放的 3T 级模型**



7 月 17日凌晨,月之暗面(Moonshot AI)发布 Kimi K3。这是一个总参数量2.8万亿的MoE(Mixture of Experts,混合专家)模型,每个token激活896个专家中的16个,原生支持视觉输入和100万token上下文窗口。官方称其为「首个开放的 3T 级模型」。
新模型发布之后,基准测试往往是理解其能力边界的第一参照。但单看分数意义有限,重要的是每项测评各自回答了一个具体问题——这个模型能不能写代码、能不能干律师的活、能不能替你做表格。
作为 Moonshot AI 的第一轮投资者,这三年多来,我们支持并见证了从Kimi Chat 到 Kimi K3的每一次进化。
这次,我们汇总了发布后 72 小时内,关于 Kimi K3 已经出炉的部分第三方测试结果。我们看到,在多项综合性测试中,排在 K3 前面的,只有Anthropic两周前、OpenAI一周前刚发布的最新模型——追上最前沿所需要的时间,已经缩短到以周计。
这也验证了我们三年前投资时的判断:无论行业叙事如何起落,这支团队都有能力长期留在模型竞争的最前沿,将自己带到牌桌中央。
综合智力
Artificial Analysis 的「智能指数」(Intelligence Index)是一场测试 AI 综合智力的全科统考:它把 9 项高难度评测——涵盖推理、数学、编程、智能体任务、知识工作等——的成绩汇总成一个总分,由独立第三方统一测试、统一核算成本和 token 效率,让各家模型在完全相同的考卷和评分标准下直接对比。
Kimi K3得分57分,位列该指数第三,仅次于Claude Fable 5(60 分)和 GPT-5.6 Sol(59 分),领先 Claude Opus 4.8(56 分)。
同时我们看到,单任务平均成本约0.94美元,与GPT-5.6Sol(1.04 美元)相当,约为 Claude Opus 4.8(1.80 美元)的一半。
这意味着什么:这是即将开放权重的模型第一次进入该榜单前三。 此前,「开源与闭源差半代」是行业默认前提,而这个前提正在失效——对任何需要私有化部署、又不愿在能力上妥协的机构来说,他们如今有了更多选择。

https://artificialanalysis.ai/models/kimi-k3
前端开发
由UC伯克利研究人员创建的 Code Arena,采用匿名的双盲对战机制,汇集了全球数百万用户真实反馈,被称为大模型编程能力的黄金标准。Kimi K3 在前端开发的全部 7 个分类中的 6 个排名第一,仅在游戏领域排名第二,排在 Fable 5 之后;
总榜上,K3 以 76% 的胜率超过 Fable 5 的 63%、GPT-5.6 Sol 的 58% 登顶——也就是说,当它的输出与其他模型在同一任务上的输出进行一对一比较时,平均有 76% 的时间它被选为更好的那个。
这意味着什么: 与标准化考卷不同,Arena 的分数来自真人盲选投票,衡量的是「人类实际更喜欢谁的作品」。前端恰好是无法靠背题取胜的主观领域——界面好不好看、好不好用,只有人说了算。K3 在这项上排行第一,显示出它的优势不只停留在可以刷题的封闭任务上。


https://arena.ai/leaderboard/code/webdev
长程开发
DeepSWE是一场测试**「AI 能不能当软件工程师」**的实战编程考试:由 Datacurve 从零原创编写 113 个长周期工程任务,横跨 91 个真实开源仓库、5 种编程语言,要求 AI 智能体自己读懂陌生代码库、跨多个文件完成修改并通过行为验证。
因为题目全是新写的、不存在于训练数据里,所以背答案是没有用的。
K3首次亮相即排名第三,任务完成率69%,位列GPT-5.6 Sol(73%)和 Claude Fable 5(70%)之后。出题方Datacurve评价:这是第一个在该测试中提供前沿级性能的开放权重模型。
这意味着什么: 这项测试模拟的是一名工程师入职第一周的真实处境——面对陌生代码库独立干活。67 分上下意味着约三分之二的长周期工程任务可以被端到端完成。AI 编程是目前大模型商业化最确定的场景(仅Claude Code 年收入就超过 10 亿美元),现在这门生意第一次有了同一量级的开源竞争者。

https://x.com/datacurve/status/2078189882707730535
极限编程
KernelBench是一场测试**「AI 能不能写显卡底层代码」**的极限编程考试:它让 AI 智能体在真实 GPU 上为 PyTorch 任务手写并优化 CUDA 算子,评分只看两个标准——跑得对不对、比 PyTorch 官方优化快几倍。其中 Mega 套件更是要求把整块模型压缩进一个「巨型核函数」。
在最难的Mega套件上,K3(256k 版本)以18.09倍的最佳加速比排名第二,仅次于Fable 5的18.71 倍,大幅领先Opus 4.8(14.40 倍)和GPT-5.6 Sol(2.64 倍)。
这意味着什么: 手写 CUDA 算子是全球可能只有几千人真正精通的技能,也是 AI 基础设施成本的关键杠杆——算子快一倍,同样的卡就能多服务一倍的用户。模型开始胜任这类工作,意味着 AI 正在触及「优化 AI 自身运行效率」的自举环节。

律师工作
Harvey LAB-AA 是一个测试**「AI 能不能当律师」**的考试:它把真实律所的工作场景(翻邮件、查合同、写法律报告等 1,200 多个任务)交给 AI Agent 去完成,并且采用极其严格的判卷标准——每道题多达几十条专家评分点,必须全部满足才算通过。
K3以26.7%的全对通过率排名第一——这个数字看着不高,是因为一道题几十条评分点必须全部满足才计分;第二名 Fable 5 为 14.2%,K3 几乎是它的两倍。
这意味着什么: 「全部满足才算过」的判卷方式,度量的不是模型「看起来像不像律师」,而是产出能否直接交付。法律是单价最高的专业服务之一,这类成绩会决定 Harvey 这样的法律 AI 公司在选择底层模型时,开源选项是否真的在候选名单上。

https://artificialanalysis.ai/evaluations/harvey-lab-aa
电子表格
SpreadsheetBench 2 是一场测试**「AI 能不能替你干 Excel 任务」**的实操考试:它用真实的公司财报和商业数据出题,让 AI 智能体完成搭财务模型、给表格排错、做图表可视化等 321 个完整工作流任务——平均每个任务涉及 12 个工作表、近 600 处单元格修改,且要求结果与标准答案完全一致才算对。
K3以34.8%的通过率排名第一,以0.1个百分点的微弱优势领先Fable 5(34.7%),GPT-5.6 Sol为32.4%。
这意味着什么: 电子表格是全球数亿白领每天的工作界面,也是「AI 替普通人干活」最有普遍性的场景。这项测试度量的是可靠性而非聪明程度——600 处单元格修改零容错。

https://x.com/AfterQuery/status/2078236494326817017
创意写作
创意写作(Creative Writing)是一场测试**「AI 能不能写好小说」**的文学创作比赛:它用 32 个刻意刁钻的题目(考幽默、浪漫、空间感、独特视角等)让模型写故事,再由另一个大模型按22条标准打分并进行两两 PK 排出 Elo 名次,同时还统计「Slop陈词滥调指数」和「Repetition重复指数」,专门抓 AI 写作中最招人烦的套路腔。
K3以2377的Elo分排名第一,领先GPT-5.6 Sol(2143)和Fable 5(2091),同时陈词滥调指数1.3为头部模型中最低。
这意味着什么: 写作能力长期被认为与训练语料的文化底色强相关,是中文实验室模型在英文世界的传统短板。这项成绩说明 K3 的能力提升不只发生在代码和数理这些「硬」任务上——对内容、营销、教育类应用的开发者,这是选型时容易被跑分掩盖的一个维度。

https://eqbench.com/creative_writing.html
网站开发
Next.js Evals 是一场测试**「AI 能不能写好前端项目」**的垂直实操考试:由 Vercel 官方出题,让各家 AI 编程智能体完成 Next.js 框架的代码生成和版本迁移任务,按任务成功率与执行耗时排名。
**K3排名榜首:92% 的任务成功率与Claude Fable 5、Cursor Composer 2.5 并列最高,平均耗时199.89 秒,比 Fable 5(233.93 秒)少约 15%。**Vercel CEO Guillermo Rauch 表示,这是首次有开放模型在这项测试中领先所有专有模型。
这意味着什么: 与通用榜单不同,这是框架开发商为自家用户选型做的测试——出题人自己要用答案。版本迁移这类枯燥任务恰恰是开发者最想交给 AI 的部分,能在这里排名靠前,意味着离日常工程的真实需求很近。

https://x.com/rauchg/status/2077900518404321759
经济价值
Vals Index是一场测试**「AI 到底能为经济创造多少价值」**的综合能力考试:它不像普通榜单那样把各项能力一视同仁,而是按行业对 GDP 的实际贡献加权计分——金融考企业财报分析和多步金融推理,编程考修 bug、命令行操作和端到端做 App,最终合成一个「经济影响力」总分。
在38个受测模型中,K3以74.70% 排名第二,仅次于 Fable 5(75.14%),领先 GPT-5.6 Sol(73.12%);相比上一代 K2.6(第 18 名)前进了 16 位。
这意味着什么: 这个榜单代表了评测行业的一个转向:从「谁考试分高」转向「谁创造的经济产出大」。在这套以商业价值为权重的算法下依然名列前茅,说明 K3 的能力分布与真实经济需求是对齐的,而非偏科于学术型任务。

https://www.vals.ai/benchmarks/vals_index
第一梯队里的开源选手
把九项测试放在一起看,格局是清晰的:在前端开发、律师工作、电子表格、创意写作、网站开发五个单项上,K3 排名第一;在衡量整体实力的综合性榜单上,它位列智能指数第三、经济价值第二、长程开发第三——整体仍在 Claude Fable 5 之后,但已与 GPT-5.6 Sol 互有胜负。
社区的实际使用体验与跑分吻合:Hacker News 上多位开发者在真实编程任务中试用后表示,盲测中难以将它与 Fable 5 区分开。考虑到 Fable 5 和 GPT-5.6 Sol 分别只发布了两周和一周,这让我们相信:开放权重模型与闭源前沿的差距,已经从数月收窄到数周。
当然,这份成绩单也有需要如实记下的另一面:每百万 token 输入 3 美元、输出 15 美元的定价与 Claude Sonnet 同档,K3不再是过去那个低价选项,但依然极具性价比优势,只有Opus的40%,Fable的20%。
真正的节点还在一周之后。7月27日,K3 的完整权重将正式放出,届时全球的研究者和开发者都可以在它之上继续构建。显然,榜单的座次每个月都会变,但智能最前沿的能力,正在以更开放的姿态、更快的速度被开发出来,交到更多人手里。
成绩与评论截至 7 月 19 日,来自 Artificial Analysis、Datacurve、Vercel、EQ-Bench 等第三方评测方及 Hacker News 公开讨论;官方自报成绩以月之暗面发布博客为准。


