如果你还不理解 Seedance 2.0 为什么火了,我们做了 8 条视频给你看
一张图,九份参考,小云雀剪出了一条完整短片。
一张图,九份参考,小云雀剪出了一条完整短片。
👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon
这两天,AI 视频领域被字节的新一代视频模型 Seedance 2.0 刷屏了,距离上一代模型只差 2 个月。
海内外的各个社交媒体、社区上,创作者们都在疯狂晒、转发自己的生成结果。随便刷一条都有大量的点赞和转发,评论区的反馈也都非常一致:「这次的 AI 视频模型效果是真的不一样了」。

如果把时间线拉长到 2026 年开年这个节点,你会发现这个「有点不一样了」很好解释:
AI 视频模型,开始理解「镜头与镜头之间的关系」,简单说就是会讲故事了。
Seedance 2.0 模型,某种意义上,它就是这个转折点发生的信号。
字节旗下 AI 视频创作 Agent「小云雀」刚刚也推出了这个模型,我们花了一整天时间做了一轮深度实测,网上最火的那些玩法,一个一个验证了一遍,看看它到底能做到什么程度。
接下来,我们将分享实测体验。
古风烤鸭讲解
各个平台里对于 Seedance 2.0 的讨论,有几个关键词出现频率特别高:
1)参考能力太强了
2)能够精准复刻主体
3)叙事能力提升很大
4)多主体下的一致性很高
我们围绕这 4 个点,做了一堆测试 case,分享给大家。
首先,这次更新后的小云雀配上 Seedance 2.0,很适合做「多个参考主体」的内容。
意思是:你能一次丢很多素材进去,比如好几张图、抖音短视频链接、或者视频文件。它会一起参考这些内容,然后你用很简单、直观的提示词,就能生成一条最长 15 秒的视频。
我举个例子。
之前我在抖音刷到一个短视频,最近这个赛道很火:走历史讲解路子,配一张背景图,语气和节奏偏怪,偏搞笑。

刚好我在网上刷到很多人在做那种「烤鸭卷饼爆炸图」,就是把一份卷饼一层一层拆开,把每个小配料都单独摆出来。
我就突然有个想法:角色可以直接用一张古风图,让小云雀去参考上面那个短视频的音乐和节奏。
整条内容就只讲这一张烤鸭卷饼图,用解说的方式,一步一步说清楚它是由哪些部分拼起来的。这样看起来清楚,也很有节奏感。


在小云雀里写提示词,其实不用整得很复杂,顺着你的想法往下写就行,重点说清楚要干嘛、参考什么、用谁来讲就可以了。
我想做一个【参考视频】里的讲解型视频,比较抽象有趣,讲解内容为【@图片2】,讲解烤鸭的组成方式。角色换成【@图片1】
生成速度也还可以,最后的结果有几个点很值得说一说。
首先就是镜头切换很顺,角色动作比较稳,整体节奏能跟上音乐,看起来不会有那种很重的 AI 味道。
如果你仔细看,视频中角色卷烤鸭饼的特写会发现,整个镜头是有非常真实的镜头聚焦变化的。比如一开始镜头聚焦于很有活人感的女主角面部,等到镜头推进后,就开始对焦在烤鸭卷饼上。
在这个对焦的过程中,画面中的元素一致性保持的都很好。


印度搞笑段子动漫化复刻
除了这种全程动漫风,它也能把真人搞笑短视频直接转成动漫版,而且动作能学得很像,可以精准复刻主体。
这也是网上很多同学都在疯狂试玩的内容。我这几天经常看到很多印度真人搞笑段子:

我就让小云雀做一个相似的版本:
换成其他角色,用我上传两张图片
参考图片用的更是非常「跨界」的古风人物:


这是它的结果。你能看到两个人的动作衔接没太多乱飘,对印度搞笑视频的复刻也挺像,整体角色的表也更「有情绪」。
「打工人」的极限运动集锦
试玩完上面那几个例子后,我感觉 Seedance 2.0 这次在参考和主体能力上的提升挺明显的。
除此之外,Seedance 2.0 的叙事能力也多次出现在很多创作者的内容里,这主要体现在 Seedance 2.0 能够理解「图像、视频」,让每个镜头间都能连接上。
大家应该很熟短视频平台的各种极限运动的合集视频。它们的特点就是画面切得很快,节奏抓得很紧。
我用小云雀的界面:上传 8 张图,再把抖音短视频链接贴进去当参考。等于它要参考 9 份内容。
提示词也很简单:
按照【参考视频】所展现的运镜、节奏,帮我做一个同样的短视频,只不过里面的极限运动换成我上传的8张图片,多镜头多角度,搞笑抽象

最后的整体效果很像「短视频」。
第一帧就很抓人,还用了鱼眼镜头感。镜头在不同画面间切换也更顺。配乐不会一比一照抄原视频,反而会按画面变化去配一段新的音乐,听着更协调。
这种自媒体短视频一般还会配「艺术字介绍」,而且每个画面配的字都不一样。人工做这个很费时间,但小云雀现在能直接在整条视频里加字,你也不用逐帧告诉它「这里写什么」,它能看画面自己补。
提示词如下:
为参考视频配上艺术字介绍,,每一个画面叙事的描述都要不一样的,不要太规整,要有爆炸性的感觉
你仔细看会发现:它基本沿着原视频的节奏走,在原视频基础上加字,整体更稳。
还有转场这块也更顺了。它不太会「硬切到下一张图」,会先给个特写,比如特写到某张图里手上捏的纸团,然后再接下一帧。

「多主体」参与的演唱会
从上面这些例子看,它对「保持角色不乱变」这件事做得更好了,而且它对视频的理解也更强。
为了进一步看看这种一致性的能力,我上传了一张 Koji 播客照片,然后我找了一个 Queen 乐队万人合唱的短视频链接,主要试一试它的「多主体一致性能力」到底做到了什么程度。
Ps. 不过前两天发现已经无法上传「真人素材+版权内容」,这可能是因为这回的 Seedance 2.0 的效果实在是太逼真。具体效果,可以直接看下面这个玩法。


我的想法是:让 Koji 的人物直接替换音乐会里的主角,同时加点嘻哈元素。要求大概三点:
1)人物用参考图片里的 Koji
2)整体镜头和感觉跟参考短视频走
3)音乐不停的情况下,加一些中式嘻哈味道
下面是小云雀的结果。你会发现就算镜头在切,背景和人群也在动,但主角的脸和气质能稳住,基本不会乱跑。
我还试了「再加主体」,比如一个「看起来非常有对比感的初号机」:

效果如下,虽然一个是真人,一个是「初号机机甲」的跨界搭配,但整体效果融合得相当协调:
鱼眼镜头下的运动相机
如果要仔细看现实场景下的一致性,用一个「真人转交运动相机,用鱼眼镜头效果录制视频」场景,看起来会更有「实际感」。
注意,下面视频里的运动相机是我真实地用 AI 生图做出来的,你可以仔细观察一致性:

Koji 手持运动相机,前半段几乎没配乐,突然开机切到鱼眼镜头,音乐瞬间就进来了。这个转换很自然,而且正好是现在短视频最爱玩的节奏套路。
你甚至能让 Seedance 2.0 做出运动相机自拍的鱼眼效果。这种镜头下,Koji 脸部细节几乎没变形,一致性相当高:

索尔维会议跳网红舞蹈
最近抖音上有很多「让视频里的人 AI 跳舞」的短视频,很火。比如这个:索尔维会议跳《青苹果乐园》的那种。

在短视频平台里,你直接传图用特效拍同款当然也行**。但你要在这张图上再加更多角色,或者做更复杂的版本,就不太好弄了,这个时候小云雀就比较好用。**
比如我这里有 4 个角色,我想把他们加进索尔维会议那张图里,让他们跟后面的人做同一套动作,同时把音乐换掉。

下面这个就是结果。你会看到整体很稳,动作能跟着音乐走,效果也挺上头。
还有个点我觉得挺关键:第一排第二位那个年轻女性后面,其实是居里夫人。一般做这种 AI 跳舞,最容易翻车的就是「前后叠着两个人」的地方,动作很容易乱掉。
但这条视频里,居里夫人就算在后面,动作也能跟着音乐对上,而且动作切换的时候也没乱。整体看着就比较稳。

下面总结一下,从我这几个实际案例跑下来,能很直观地感受到它现在主要有这几种实用能力。
先是多素材一起参考,不管是多张图片还是短视频链接,都能一起上传进去用,不用只盯一个参考源,即便是 8 张图片 + 1 个视频参考,也可以。而且,可以跨模态参考,视频 + 音乐 + 图片 + 文字这种组合是可能的。
然后是多镜头连续生成,一条视频里能自己拆成好几个镜头来讲内容,镜头之间基本能接上,不会每段都像独立小片段。
再一个是角色稳定,同一个人物在不同镜头里不太会乱变脸、乱换衣服,还有动作跟得上,像卷饼、咀嚼、跳舞这种连续动作,看起来是顺的。
它对节奏和运镜的模仿也比较到位,能按参考视频的切镜速度和运动方式来走。
自动加字和画面配文也能直接生成,不用逐帧去自己标,最后是多人同框和前后遮挡这种更复杂的画面,也能基本撑住,不容易整块画面崩掉。
可以说,Seedance 2.0 火的背后,是整个行业正在跨过的一道门槛,而这次的热度,它确实配得上。
🚥
现在 Seedance 2.0 已经「全量上线」,推荐大家来小云雀体验~~

