致视频模型:群众不喜闻乐见,你算老几
**「🤡meme bench发布**」** 为了更好地评测视频模型的能力,葬AI历时半个月整了个大活:meme bench。
「🤡meme bench发布」** 为了更好地评测视频模型的能力,葬AI历时半个月整了个大活:meme bench。
大部分人没有意识到的一个盲区是,大模型好坏是一个定义问题,Benchmark即权力。
字节的视频模型Seedance 2.0在过去半年是无敌状态。Seedance 2.5有所提升,但这意味着2.5一定比2.0好吗?
不是这样的。
Seedance 2.5定向提升了电影质感,价格大涨,结果在指令遵循、复杂动作等方面,反而有所倒退。
meme bench是一套短视频生成盲测。有50道题目,都是B站抖音的热门梗图。 我们让所有模型用相同图片和提示词生成视频,再让找到的400位大学生和网吧家人在网站上进行盲选,直接选择视频的好坏。
我们相信的基本道理是,视频模型的定义权应该交给更多数人,不能由十几个研究员定义模型好坏。
因为这是个一眼能看明白的事情,生成一段AI视频,谁好谁坏一目了然。
meme bench采用的是棋类比赛常用 Elo 机制:战胜强模型加分更多,输给弱模型扣分更多,再把所有两两对决连起来,算出模型之间的相对实力。这样就不会因为打标次数过多或过少影响单个模型的排名。
核心目标只有一个,SOTA模型要让人民选择!评测要为广大人民服务!
非常出乎我们意料的是,Minimax H3获得了第一,和Seedance 2.0得分接近,这两个模型也都略微领先于Seedance 2.5 。

我们一开始以为是样本量不足的问题,扩大测试人次后,H3和Seedance 2.0的领先反而扩大了,H3甚至最后对Seedance 2.5保持了55%的胜率。
这是我们的测试网站,你可以自己做完测试,得分也会进入排行榜。看看你自己选出来的是哪些模型。
https://video-arena.com (建议大家在浏览器里打开)
需要特别说明的是,meme bench没有接受任何赞助。我们事先也无法预料到几百位网吧家人会选出这样的结果。
让我来展开解释下meme bench是怎么构建的。
做这个bench的初衷是,我们想用一种更好玩的方式来衡量视频模型的能力。
所以,我们人工筛选了50张B站、抖音流行的梗图,并且为每张图片写了夸张的提示词,从而尽可能测试模型没有专门训练的场景。
比如请乌鸦哥像直升机一样旋转。
让模型评测更通俗易懂的好处是,我们可以发挥人民群众的力量。 沐秋去网吧比我勤,于是他发动了网吧哥们,在大学生兼职群等各种渠道,先后找了400人次打标 aka 做完一轮测试题目。
大学生兼职群遇到的最大难题是,可能常年号召这些家人做问卷只用发个红包,以至我们直接挨个发钱总被当成骗子踢出去。
在Seedance 2.5和H3发布前,meme bench排行榜的情况非常简单,Seedance 2.0大幅领先其他所有模型,生成的短视频完成度最高,指令遵循最好,强得一目了然。
比如在「男子的咪咪变成钛合金乳头,发射激光把整栋房子切得四分五裂」视频中,几乎只有Seedacne 2.0是字面意思遵循了指令。其他模型都过于羞怯,发射激光的位置不对。
特别在复杂场景下,Seedance 2.0的画面明显更流畅、丰富,还会自己剪辑运镜。 但问题在于,Seedance 2.0有时候动作不够连续,会省略中间步骤。 「男子的手机忽然放电,把男人和河里的鱼全电麻了」这个视频中,Seedance 2.0直接从手机放电画面跳到了一片死鱼,却没有传导路径。
这也是MiniMax H3能后来居上的原因:极强的指令遵循能力。
在我们的meme bench中,MiniMax H3甚至像一个升级版的Seedance 2.0。 H3在多个测试中,都做到了画面连贯流畅,显著好于会在复杂动作中省略过程的Seedance 2.0 。
比如,「一堆人扭曲地在地上爬行,连成蜈蚣形状」视频中,Seedance 2.0 就省略了一堆人连成蜈蚣的过程,画面极其诡异。
H3也体现出更好的生成复杂场景的能力。「绿幕钻出超多小鸟」这个视频中,H3生成的动作画面也比Seedance 2.0更自然。 特别是一大群小鸟出现的方式,H3有循序渐进的动作过程,Seedance 2.0让一大坨小鸟违反物理规律地喷涌而出。
和二线视频模型对比,H3的优势体现得更显著。特别是在激烈动作场景,二线视频模型普遍很不流畅。 至于屈居第三名的Seedance 2.5,它的优缺点都很突出。
Seedance 2.5是画面最真实、最接近电影质感的模型。
「冷链车门被打开了,鸡鸭鱼猪追着男人跑」视频中,其他模型都能看出来AI痕迹,Seedance 2.5看起来完全像电影原片。
但是,除了画面色彩、质感最接近电影以外,Seedance 2.5其他能力并没有显著升级,甚至复杂场景的动作连贯性有所倒退。 在考验模型创意的狂野场景,Seedance 2.5的表现过于糟糕,让人怀疑它专门抑制了模型的想象力。
在不涉及复杂动作的情况下,Seedance 2.5生成的画面才更有细节,更像真实场景。
类似的场景,MiniMax H3生成的就不够真实质感,像是B站鬼畜视频。 「男子被砖头砸了头但砖头碎成了粉末,他的头闪闪发光,身后浮现出100个菩萨」这条视频,显示出Seedance 2.5流畅连贯的镜头切换,菩萨、刀割这些画面细节更是它的强项。
我们测试后的结论是,Seedance 2.5是一个严重偏科的模型,最严重的问题是复杂动作不连续,比如: 「男子转身走到墙边,一手从墙上飞速取砖块递给另一只手,另一手像发射炮弹一样一块块扔出,打爆了远处的楼房」视频中,Seedance 2.5生成画面与提示词偏差严重,远近镜头之间生硬跳切。
这说明,Seedance 2.5善于生成电影质感的大场景和具体人物细节,但大场景和具体细节之间缺乏连贯动作。近似于一种高级PPT。
再考虑到Seedance 2.5的价格,只能说这不会是一个人民大众能随便用的模型,纯给片厂导演用的。
篇幅有限,没办法挨个解读所有模型,完整的分析报告在这个飞书链接里。
https://likczh6fsao.feishu.cn/docx/KorydhPbIoKR8TxU2t6chhDfnGd
H3不幸成为排行榜第一后,我们预料到会产生争议。但增加了更多人次打标后,试图看看Seedance能否重回第一。
结果H3的胜率仍然最高。胖猫是经受人民选择的视频模型!
唯一需要打补丁的是,本次模型生成的场景是图生视频,考验的是复杂场景激烈动作和指令遵循,也许恰好打在 H3的舒适区里了——这也是Seedance需要补课的地方。
如果你不满意这个结果,可以自己上网站打标,选出你最喜欢的模型。
meme bench的核心目的只有一个:不应该由一小撮研究员或者影视从业者来定义美。
倾尽全力模仿电影并不能成为一个更好的视频模型,也许可能会与大众审美背道而驰。
因为浓缩了整个互联网知识的大模型肯定要为所有人服务。几十个计算机背景的研究员就能定义模型审美,是一种非常原始野蛮的开发方式,反而大专生对模型审美的判断会比博士更具说服力。
meme bench在之后会继续更新,任何具有竞争力的新模型都会在网站上更新,家人们可以随时来打榜。
这是我们视频bench系列的第一步。未来,我们会将推出更多场景、更细分的bench(比如广告、影视、游戏和表情包),争取全方面评测出最值得大伙信赖的视频模型。
当然,我们也会推出一系列世界模型和一系列AI数字人PK的bench,我的意思是期待Vivix大展拳脚吧。
(本文封面由ChatGPT 生成,纯人工写作)
欢迎订阅我们的Substack funeralai.substack.com