大模型是残酷的制造业

快请俞浩训模型

「快请俞浩训模型」

「大模型的版本告一段落,AI应用的新版本已经到来。为了迎接即将勃勃生机万物竞发的AI应用下一阶段,葬AI重拾了下大棋保留环节。这是第一篇文章,专门论述大模型,明后天连载开源和应用这两个主题。」

经过了这两个月模型厂的狂轰滥炸疯狂更新之后,相信大伙都逐渐认清了一个事实:

这些模型厂之间没有本质区别,水平都差不多,无非是谁的新版本抢发几天,谁晚发几天的差异。

GLM 5.2很棒,靠后训练打穿编程场景。但一个月后K3震撼发布,领先前者一大截。

你以为智谱是后训练之王了,搞编程数据无敌了。没想到还有高手,DeepSeek V4 Flash甚至能用1/3的参数量,达到GLM 5.2相近水平。

你以为Kimi搞参数量大跃进无敌了,2.8T参数拉开友商一个数量级。马上你Qwen叔叔也开源一个2.4T的超大MoE模型,技术架构都是基本一样的。

我们从结果来看,大模型就是没有秘密。

人民群众对大模型存在一个严重的误区。大模型是制造业,不是只有小天才童男童女和尧舜禹才能攻克的炼金术。

制造业就要遵循制造业的规律。大模型没有壁垒,领先都是一时的,最多持续一个月,其他模型团队一定会追上,竞争此起彼伏。

大家干的都是一件事,找算力、建立数据管线,然后猛猛上规模,大力出奇迹。

任何创新都会在一两个月内被同行跟进。

智谱率先摸索出后训练编程能力的路径,率先建立了这块的数据管线,然后猛猛上量,最终在GLM 5.2引爆了市场。

所有模型现在都这样做**,除了二线模型Seed声称自己不蒸馏,其他谁不猛猛搞Claude数据。**

一个佐证的例子是,现在市面上都找不到稳定的Claude中转站。所有中转站都被模型厂蒸馏爆了,根本没有稳定的Fable 5 API提供。

参数量大跃进也不是什么秘密。GLM、MiniMax都在训练几T参数模型。Kimi的领先持续了一个月,几乎没有可能再持续一个月。

另一个佐证的例子是,数据公司成了AI行业现阶段最好的生意,市面上涌现出了上百家创业公司,其中一家已经拿到了大结果。这是创投市场继世界模型后的下一个大主题。

市场总是追逐热点,容易被某个模型版本突破临界点的更新眩晕。但事实是,只要上桌了的大模型团队,其实都是相近水平。

Qwen、Kimi、智谱固然一时领先,混元、Seed、MiniMax、阶跃追上来只是时间问题,LongCat、Mimo也有机会,小王雷总多给点资源。只有文心一言应该是真寄了。

因为大模型是一个工程问题。不存在剧烈的技术架构创新,Scaling law依然在稳定地发挥效力。

我很喜欢邪恶的A畜老板Dario写的一段话:

「每隔几个月,公众情绪要么确信 AI 撞上了墙,要么对某个会从根本上改变游戏规则的新突破感到兴奋。但事实是,在波动性和公众猜测的背后,AI 的认知能力一直在平稳、坚定地提升。」

梁圣也劝大伙,不要把他们当成一帮天才,而是一群平凡人在专注地做事情。梁圣说真话,大伙还是要听。

就像是DeepSeek V4 Flash涨价前性价比无敌,把大伙预期拔得太高,结果Pro正式版相较Flash提升并不大,价格翻三倍后自己斩杀自己。

当小鲸鱼没赶上预期的时候,你智谱唐叔叔马上端出来一个新版本,GLM 5.2底座还能继续后训练,续命后训练之王这一块属于是属于是。

然而区别不大,这一堆新模型都是Opus 4.8到Opus 5之间水平,同质化太严重,只有价格和速度的区别。

模型版本更新颗粒度太细也不是好事。模型厂在Opus 4.8到Opus 5之间切香肠,除了市值管理没有别的意义,纯消耗大伙注意力。

好饭不怕晚,谁敢喊全面超过Fable 5再叫家人们也来得及❤️

顺便提一句。可能有人会说V4 Pro正式版要在DeepSeek Harness里开启极简模式才能测出最佳性能。

但你看在正式版之前加这一堆定语是不是有点幽默。

这种说法和汽车厂商跑纽北圈速更换全车零部件,雇佣专业团队调教有什么区别?我认为在跑分前加一堆定语是一种车圈向大模型蔓延的陋习。

不过大模型和电动汽车还真是一样的,没有奇迹,只有按部就班的工程能力。

决定大模型的变量就三个:算力、数据和组织能力。

所有上桌的模型团队,都至少满足其中两个条件。如果算力和数据没问题,模型能力还不行,就一定是组织能力的问题。

组织问题的典型就是Gemini。

事实证明,科学家带不好现阶段的大模型团队,因为科学家不爱带人打标,不爱干工程任务。而现阶段干大模型,需要的就是包工头带大伙一起007,主要工作是做题解题。

后者还真就是中国模型团队擅长的事情。

所以你能看到,中国的模型团队都还行。头部团队此起彼伏地竞争世界第三,腾讯、美团、小米这些二三线模型团队,也能在半年内端出来一个不是不能用的模型。

判断一个行业是不是制造业有一个硬指标,那就是马斯克能不能玩明白。

马圣跨界进去玩不明白的,那铁不是制造业,比如马圣搞政治就是路边一条,被川子当狗溜。

反之,马圣搞火箭、特斯拉、Grok一开始都没搞明白,后来都搞明白了,中间的节点就是制造业转折点,这个行业基建成熟到可以当制造业整,干就完事了。

我不由得好奇,人类历史上出现过大模型这么糟糕的生意吗?

科技巨头投入上千亿美元资本开支,求你盼你免费送你用他们的最新产品。

肩负重任的模型团队本身也很消耗生命啊。赚得多是一码事,但看着不一定有机会花。我见过的干模型的家人都一脸憔悴、黑眼圈、长痘痘,女的头发油,男的都脱发。

大模型竞争激烈的原因就在同质化。

所有模型都在卷编程和Agent场景,追求的都是SWE等几个bench上提升一点分数,那人民群众的选择就只有两个,要么用最好的,要么用最便宜的。

但模型是可以做出差异化的。

我们亲爱的Kimi K3就是一个表率。你不仅要想明白前端场景的重要性,还要搭建数据管线,准确定义一次性生成漂亮网页小游戏的数据,然后猛猛上规模。

这就是产品定义能力,大伙要学习。

在现阶段,模型产品化的重要性被远远低估了。因为训练模型的研究员没有定义产品的能力,定义产品是一个创意工作,没法Scaling。

当然,类似的产品定义不是Kimi独有。我们行事风格神一阵鬼一阵的MiniMax也能整明白。

H3视频模型就猛猛优化了影视后期能力,同时还做厚了提示词工程,这让H3在生成好玩短视频上的能力甚至超越了Seedance 2.5。

具体体现就是,我们的meme bench经过400多位网吧家人的打标,最后H3得分超越了Seedance。

而在meme bench公开发布后,又涌入了上千位葬AI读者家人来打标,相信爱看葬AI的都是高学历高素质高文化的三高人士,而H3的得分领先还扩大了——这说明H3就是更擅长生成好的梗图短视频。

顺便提一句。meme bench(video-arena.com)刚刚上新了Wan 3模型,欢迎家人们来打标,看看Wan 3到底是啥水平。

当然,我们不能说Seedance 2.5的模型能力不行,而是2.5有意识地做薄了提示词工程。需要用户能按秒写明白详细提示词,其实是提升了一板一眼的指令遵循能力,更加符合专业创作场景。

这就是一个模型产品定义问题。

大模型真的是制造业,正在发生和光伏、小家电、新能源行业一模一样的事情。

比如说吹风机,你愣做硬做吹风机当然是无法和戴森竞争的,但追觅俞神研发出超高速马达,不也重新定义了产品吗?

蔚小理大伙也说不出来谁一定技术领先,但蔚来有换电、理想有始终坚持升级的冰箱彩电大沙发,这都是行业同质化下,产品定义能力带来的差异性。

所以啊,现在正是应用的好时候。

假如今天有一家数据公司出来说,K3的前端优秀是采购了我们的小游戏数据集。那当然这家公司会被饥渴的模型厂抢爆的。

当然这只是假设,没有伟大的予彤和神秘顾问,我相信Kimi也整不出来这些差异能力。

但是Cursor的例子就摆在眼前。今天的应用公司,其实比训模型的研究员具备更好的定义模型的能力。

所以说,模型产品不是一个职位,而是一类应用数据公司的生态位。

应用公司才有产品定义能力,还有真实的用户数据,才能让模型能力提升服务于真实用户,而不是刷榜务虚。

这也是葬AI和应用公司一块发Bench的原因。

上述这些道理,其实我心目中最伟大的企业家俞浩老师讲过很多次。

很遗憾俞神遭遇一点挫折后不搞日更短视频一百条了,我已经有三个月没听到他讲自己清华技术天才研发超高速马达重做吹风机的故事。但俞神的破局思路值得各位学习。

讲道理,俞神这种制造业的天降伟人正适合干大模型。

不过呢,Kimi现在混好了,而且神仙太多,估计不需要俞神。但还在憋大的证明自己的MiniMax需要啊。

我郑重建议MiniMax请俞神来训模型。 先请俞神来定义数据,追觅技术研发方法都往模型里训一训。等新模型发了,再请俞神拍短视频串着讲十万转高速马达和3T参数大模型。

Double Win,双赢!

(本文封面由ChatGPT 生成,纯人工写作)

最后广播一下:

欢迎来葬AI和Qwen联合举办的,第一届懂模帝Bench黑客松,线下真实各路模型。

Qwen 3.8 Max、K3、DeepSeek V4 Pro、Opus 5、5.6 Sol的API足量供应,用你的真实工作场景来拷打模型,你好用的才是第一!

扫描海报二维码报名。周三中午发报名通知邮件。