Kimi熹妃回宫
福气在后头
「福气在后头」 在OpenAI一时半会没憋出来GPT 6的情况下,大模型排行榜被中国团队卷成麻花了。
除了榜首两位固定是Fable 5和5.6 Sol,剩下从第三到第十,排名更新速度远远快过喜茶上新速度。
这两个月来的趋势是,一开始Opus 4.8被当怪刷,这两天GLM、DeepSeek更新版本后,Opus 5也被当怪刷。
然而,看具体的bench分数已经毫无意义了。反正这么多bench,多跑几轮,叠加上测试都用自家Harness,这么多变量之下,具体bench成绩完全取决于团队愿不愿意在宣传上放卫星。
我的意思是模型厂可以跑出任何自己想要的成绩。所以公开bench是不重要的,重要的只有模型在自己工作场景的真实表现,这也是我们要做懂模帝集合若干个性化评测集的原因❤️
回到残酷的大模型竞赛上。
现在的情况很明显,大模型开始新赛季了。
2026年上半年的赛季是,猛攻编程场景,在1T以内参数模型上,靠后训练猛猛提升编程能力,这个赛季的版本之王很显然是智谱,靠GLM 5.2彻底打穿用户心智,率先斩杀Opus 4.8,先入关中者为王。
下半年的赛季则是,参数量大跃进,先搞出来稳定能用的2T参数模型者为王,后训练固然永无止境,但预训练放卫星更加海阔天空。
赛季刚刚开始,率先放卫星的Kimi K3是版本之子,在跑分上逼近Fable 5,将国产模型从平替叙事切换到挑战第一,并且还靠极致优化一次性生成漂亮网页能力,打穿前端场景,开启了国产模型的摸高新赛季。
K3前端一把梭能力确实很行。我做冕神语录网站(libtv.md)第一反应就想到Kimi,时间紧任务重,临时赶制出来的网站获得了广大冕徒的一致好评。
话说回来。
新赛季已经入场的选手还有2.4T参数的Qwen 3.8 Max,很遗憾只比K3晚了两天发布,大模型汪峰无疑。
逼近入场的选手有GLM、DeepSeek、MiniMax,都在加紧训几T参数模型。
目前进度最明显是DeepSeek V4 Pro正式版虽然神一阵鬼一阵,但毕竟是1.6T参数,以小鲸鱼在Flash展现出来的用1/3参数量打平后训练老王GLM 5.2的能力,再发一个小版本,小鲸鱼未必不能成为后训练大王,再次震撼人心。
熟悉了本赛季基本情况,得出结论是一个很容易的事情。
Kimi依靠K3率先开启了新赛季,领先持续了一个月,还有Qwen 3.8紧接着进入新赛季。
而旧版本之王智谱,依靠后训练大法悍然续命,又更新了一个GLM 5.3。753B这个基座模型整整用了半年时间,能力从勉强可用一直优化到Fable平替,不可以不说很神奇很努力。
不提别的,GLM 5.3马卡龙后训练版本估计正在路上了,期待一手后训练的后训练的后训练。
我加跑了葬AI bench,GLM 5.3确实有提升,但提升得不够多,排在Grok 4.6和K3后面。只能算延续良好势头,没有上个版本的开创性。
而且不知道是不是因为刚涨价放开Token plan限售,GLM 5.3执行任务偏慢,平均每轮任务耗时12.7分钟,远高于DeepSeek V4 Pro(7.9 Min)和Grok 4.6(5.4 Min)。
顺便一提,DeepSeek V4 Pro 正式版,我跑下来比Flash是有提升,但提升不大。真正提升较大的是Grok 4.6,速度快得分高不说,跑完测试也就花了15.7元人民币,不到GLM 5.3 API费用(38.2元,参照5.2价格计算)的一半。
马圣也算是把制造业这块整明白了,大模型也是纯纯制造业这一块。
话说回来,没有任何说GLM 5.3不好的意思,但这模型一直放消息要发不发的、狂吹ARR(还有几天半年报见分晓),再结合上上周GLM 5.3 API泄漏的事件来看,我真有点好奇还能后训练出来一个GLM 5.4不?
新赛季的意思是,版本变了,旧版本再次第一也只是续命,决定新赛季排名的还是尽早端出2T参数模型。
时间点传闻有很多,至少我们可以肯定,MiniMax和GLM很难在月底前发布下一代模型,家人们忍一下,暂时再让杨圣爽一段时间。
暂时处于领先地位的Kimi,在国内最强竞争对手有两个。
一个是Qwen很快会更新小版本,Qwen 3.8 Max的弱点是多模态能力,叠加连续发布预览版和正式版带来的心智混乱,没能打穿用户心智。
有个例证是,Qwen 3.8 Max的开源版本不包含多模态能力,侧面印证了它可能是单独拼接了一个VL小模型。
另一个则是忽神忽鬼的DeepSeek。DeepSeek V4 Pro的实际表现和它的官方bench结果偏差过大。因为官方成绩是在DeepSeek Harness的极简模式里跑出来的。
而DeepSeek Harness又是一个说明白了是给开发者测试用的预览版,版本号都是0.1,思路和交互设计过于新奇。所以显然不会有多少用户真的用这玩意。那么,DeepSeek V4 Pro正式版和它的Harness一样,也只能算半成品。
蹭的速度是真的快
好的一方面是,Qwen 3.8 Max和DeepSeek V4 Pro的下一个小版本,都未必不能重现后训练奇迹。
当然,大模型训练是工程问题,没有奇迹,也没有秘密。
我的意思是,后训练之王的名头就像是模型版本号一样,有效期只有一个月。Kimi和Qwen未必不能成为后训练之王。
国内大模型成为纯粹制造业的同时,国外也有最强对手,就是美国制造业最后的圣人马斯克。
Fable 5和5.6 Sol传闻都是近10T参数,是所有模型高悬头顶的太阳月亮。
但离太阳太近的结果是,美国大模型团队没有百家争鸣,大模型被双子星吊起来打,相对小尺寸模型也被Qwen 3.8-27B斩杀——一个能在Mac Mini上跑的模型,跑分持平Opus 4.6你敢信?
Grok 4.6是一个2T参数模型,我用下来和这几个顶尖国模一个水平,并且很有性价比,Grok API价格比GLM、K3都便宜。而马斯克预告将在几周内发布的Grok 4.7,将是2.1T参数模型,正式和K3、Qwen 3.8 Max进入一个赛季。
不过说真的,亲爱的马圣有点太爱我们的版本之子 Kimi了,我刷小红书才发现Grok bot神似Kimi。
阶跃 logo能学习Claude,那我马圣也能学Kimi,中美互相学习这一块👍
马圣的前后遭遇也说明了,**大模型是没有奇迹的制造业。**马圣之前乱装逼,想复刻他在特斯拉、推特搞的那一套微操到人,事实证明不行,这是纯粹的无招行为。
马圣不装逼后,Grok反而行了。道理也非常简单,老老实实做数据,勤勤恳恳训模型,求真务实实事求是,不搞大炼钢铁不成天微操装逼。
这里不展开,明天我专文解释为什么大模型是纯粹的制造业。
一句话总结马圣的所作所为:蒸馏中国模型,不是蒸馏思维链,而是蒸馏组织方式。
话说回来了。马圣买Cursor不如买Kimi。我看 Kimi 搞得不错,功能极大丰富,模型鸿沟基本消灭,生产力和娱乐性也受到重视;如果再加上用不完的算力,Kimi 就是我们理想中的 Grok👍
还有蠢蠢欲动的真的字面意思上的邪恶资本家扎克伯格,此人的新模型从跑分来看,也有一战之力,试图重新老鼠上桌。
在上次专门写Kimi这家神奇的公司的文章里Kimi看天讨饭吃。那会K3还没有发布,和GLM 5.2同期的K2.7 code是一个贵且不领先的模型。
我错误地描述这家充满神性的公司:Kimi是模型层的版本之子,既不能开创版本也不会落后版本,当市场注意力移开模型层时,Kimi会跟着版本一起沉寂,当模型层重回热点时,Kimi会跟随版本一起伟大。
但K3真的开创了一个大版本。回首这疯狂的两个月,从GLM 5.2摸高Opus 4.8终结旧赛季,到K3逼出Opus 5,开创新赛季。
最大的赢家首先是开源模型。再细分一点,目前的版本之子是Kimi,底大一级压死人。而另外三小龙:智谱和MiniMax、阶跃一道,都需要憋大的在2T参数量级证明自己。
最后收束一下标题。
**甘露寺寓意着嬛嬛迎来自己的牛来时刻,**她经历了艰苦磨难,得到的奖赏是与果郡王真心相爱,而后真爱幻灭如梦幻泡影,她决心回到皇宫,对抗胖橘,重新降临权力的中心。
我的意思是,Kimi这波开创了新赛季,属于龙王归位牛来翻身甄嬛回宫,第二波宫斗即将开启,纯纯大女主复仇记。
(本文封面由ChatGPT 生成,纯人工写作。)
欢迎来本周末我们的Bench黑客松实测K3,API充足供应,扫描海报二维码报名❤️