不吹不黑:昆仑万维这个新模型有点炸
商业世界从来不会对「好技术」客气。
商业世界从来不会对「好技术」客气。

👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon

如果我们愿意,随便数数都能列出一长串「响当当」的名字,每个人或者说每一种技术路线都想成为「头号玩家」。
商业世界从来不会对「好技术」客气。
从直播间里的虚拟主播到品牌代言的数字形象,市场正以前所未有的渴望等待着这些技术的突破。
从 2024 年开始,我们明显感觉到国内玩家开始「疯狂涌入」这个领域。像是腾讯开源的 HunyuanVideo-Avatar;还有从 SkyReels V1、SkyReels V2 一直快速迭代的昆仑万维,都在给出自己的答案。
就在昨天,昆仑万维的 SkyReels-A3 模型正式上线,Slogan 简洁而有力:「用音频驱动数字人视频」。
「用音频驱动数字人视频」
🚥
作为「十字路口」团队,我们不会错过这个尝鲜的机会。
我们跑了 10 个案例,从真人访谈到二进制代码人像,甚至让 Q 版蒙娜丽莎开口说话;又翻了相关的技术报告,在里面找到了 5 个能解释这些表现的关键亮点。
下面,是完整的测试记录与技术解读。
从「真人」到「二进制代码人像」的 10 个案例
简单来说,SkyReels-A3 是一个音频驱动视频生成的模型,只需要一张图片和一段音频,甚至不用做提示词工程,就能呈现出很好的数字人视频效果
在访谈、唱歌、短视频营销、播客等很多领域的表现都还不错。
Person is talking
由于这个模型确实还挺好玩的,「十字路口」团队一共测试了 10 个案例,想了很久,该以什么顺序介绍下。最后,我决定还是以上传图片的「抽象度」由低至高排序。
虽然有点反常识,但是对于真人形象的视频生成,其实对于 Skyreels 来说难度更低。
我们一一来看。
1)Sam Altman 的经典访谈
SkyReels-A3 真的就只需要一张图片 + 一段音频就可以生成非常自然流畅的视频,而且在这段长达 40s 的视频里,人物都是会以非常自然的动作配合语音输出。
比如,我上传了一张 Sam Altman 的经典访谈照片,想必很多人已经看到这张图片无数次了。
在这张图片里,Sam Altman 斜着头看向主持人,注意手的姿态:

然后我又随便在某个节目里截了一段音频。
组合上传后,SkyReels-A3 就生成了下面这段视频。如果你仔细看,就会发现视频开头的第一秒,Sam Altman 有个很明显的呼吸动作(胸膛在起伏)。
当重音(像是 Truely)发出来时,双手甚至也会跟随着向前伸出……
「Umm 」这类常见的短暂停息也很精准的展现在了 Sam Altman 的嘴部动作中,甚至是他无语笑的时候,双唇的形态都非常自然。
2)带货「大橘」的女主播
经过上面那段 Sam Altman 的测试,我觉得 SkyReels-A3 实在是太适合做直播、短视频营销了。所以我们来测试一下当面对「直播补光灯」时,女主播的表现。
考虑到版权问题,我们后续的素材基本都是从各种 AI 工具上生成的。
下面这是一张典型的抖音直播间场景图,画面中一位年轻漂亮的女主播身穿潮牌卫衣,面对镜头微笑讲解产品,手中展示的是一个大橘色抱枕:

先来看看视频生成的效果。
首先就是嘴部同步很自然,嘴部动作与语音匹配度很高,讲话时的口型变化流畅,基本没有明显延迟或错位,观感比较真实、顺畅。
其实,常人判断一个数字人视频是不是太假了有一个很有效的标准就是:是不是有手部动作,以及手部动作变化的 Pattern 多不多,自然不自然。
在这段 39s 的视频里,你可以数一下女主播做了多少个手部动作:
最后,有一点我觉得非常不错的细节是:女主播的左手很多时候是放在橘色抱枕后面的(绿色区域),当她伸出来的时候,画面几乎一点形变没有。

3)让 Koji 来介绍下个人经历
下面,我们邀请了 Koji 来讲述下他之前的个人经历。说实话,这个案例是我们觉得最真实的。
而且因为我们彼此都很熟悉了,在看到视频的第一刹那,就感觉更加真实了。
Koji 个人图片是我在他视频号的某个视频随手截的,音频也一样:

这次视频生成有个比较明显的小瑕疵,就是 Koji 衣服上的「十字路口」出现了形变。当然,这也是目前的 AI 模型在中文文字泛化上的普遍弱点。
但是要说起视频内容中 Koji 语言、面部表情的自然程度、手势的变化,熟悉他的朋友大概都知道这到底有多真实。
尤其是在一些重音的表现中,数字人版 Koji 的表现与 Sam Altman 有点不一样,这回主要是靠面部表情的加重来展现的:
看完了真人图片在 SkyReels-A3 的表现之后,再来看看「我们整的活」。在试玩的过程中,我发现 SkyReels-A3 尤其适合多种形象、多种主体的表现,它最大的特点就是:泛化能力强,稳定。
4)现代都市动漫男
下面是一张现代动漫风格的图片,面容可以说与真实人类的面部细节完全不一样,尤其是背后的光纹,可能让 AI 模型更加难以识别。

下面是视频生成的效果,我们还是能够看到嘴型与语音的同步很不错。
不知道你注意没注意到一个细节,视频中动漫男的牙齿与整张图片的风格是一致的,而且胸部也同样搭配着音频在做起伏。
图片中角色身上的光纹也有在变动,头发甚至都有「垂坠感」,眼睛也在不断的闭合:
5)Q 版蒙娜丽莎
接下来的形象可能会更加让 AI 「难以识别」。
比如下面这张 3D 萌化形象的蒙娜丽莎,风格大概是皮克斯 + 泡泡玛特的可爱混搭路线。面庞很圆润可爱、胖嘟嘟的,眼睛则是极具二次元特色的渐变星星眼。注意左侧,小蒙娜丽莎也是伸出来一只 Q 版小手。

下面,我们来让她介绍下「十字路口播客」。
SkyReels-A3 生成的效果依旧还不错,瞳孔放缩都有真实反应,背后的画框也没有形变。
在「欢迎收听我们的播客」这一句,甚至还伸出来小手。整体风格的一致性都比较好,也都延续泡泡玛特与皮克斯风格。
小蒙娜丽莎的眼睛眨动确实很可爱,没有说因为它是 Q 版形象就做成了「人类眨眼」的效果:
6)碳棒速写技法下的中年男人
下面这张图片,难度继续升级。
这是一幅以碳棒速写技法呈现的人物漫画作品,风格是国潮新式漫画与传统水墨意趣。整体颜色基本就只有黑白两种:

我们来让他试着唱下我个人很喜欢的牙叔的「波希米狂想曲」,看看效果如何。
开头第一句的展示效果,是不是就有点让人一愣:
在整个视频中,如果细看的话,人物的面部表情、脖子的张起甚至是喉结,都是在随着歌曲中文字的重音变化的。
而且,全程人物并没有因为是难以识别的「碳棒速写画」就停止自然摆动。
7)柯南圆形徽章
下面我们再来看看如果画面并不只有人物一个元素会如何。
比如下面这张整体只有黑白灰三色构成的柯南圆形徽章,数量很多,元素比较复杂:

最后生成的效果如下。
大部分时间里,画面中只有最中间的一个柯南徽章在说话,并且一边输出音频的同时,徽章也在转动。
视频的后半部分中,旁边的两个徽章也开始「眨眼」,整体感觉甚至有一些「恐怖谷效应」:
以上案例,至少还是有个能够辨识的「人物形象」的,但以下部分则「很难说能识别出来人的面部结构」。
8)让高达做个自我介绍
既然,SkyReels-A3 连柯南徽章都能够识别,我决定让它试一试「高达」,会产生怎样的效果。
下面是一张高达头部的正面特写图像,高达头部结构清晰。注意头部下方的那一小块金属装甲表面,也有一些光泽和反光变化:

下面就是视频效果了。
先说小瑕疵,在视频前 10s 里,SkyReels-A3 居然根据高达的形象自动生成了一双「机械眼睛」,我觉得效果很不错。但过了几秒,就自动消失了。
我们再仔细看看视频中的细节,我注意到头部下方的金属装甲上的反光变化很真实且自然,在讲话的同时,整体也在自然地摇动。
9)现代抽象艺术人脸
最后,则是 2 幅「抽象画」。
说实话,即便交由人类来进行识别,也比较难以想象「如果变成了数字人,会有什么效果」。
SkyReels-A3 给出了它自己的答案。
下面这一张充满未来感的现代抽象艺术海报,整体风格融合了时尚、科技与意识流美学。画面由无数彩色粒子与代码符号构成,有一张模糊人脸轮廓:

我们来让这幅「抽象画中的人像」来唱下 GAI 的嘻哈名曲,视频效果如下。
最明显的就是人像背后的粒子动态表现,画面层次丰富。再有就是,意识流的人脸在动态中根据音频的变换还是比较自然的,面部(尤其是嘴唇附近)那块区域的变化很真实。
10)二进制代码人像
我们再来看一张更加抽象的二进制代码组成的画幅,这回所展现的是一张抽象头像的侧脸轮廓,注意左下方,这个二进制代码人像也同样伸出了一只手:

我们来让它介绍下 DeepSeek 的短视频营销话术,最终的视频效果如下。
你能发现在左下角,二进制代码人像的手部也依然在跟随音频变化。说句实话,我也没想到这个二进制代码人像做成数字人视频后,嘴部的效果是这样的,但也确实还比较自然:
在体验过程中,你其实能很明显地感受到 SkyReels-A3 模型是以音频驱动的。
即使我没有写什么复杂的提示词,就是简单地告诉 AI 「这个人在说话」,整个模型就能自动让数字人的嘴巴、表情、甚至手势都跟着音频内容变化。
这种「音频驱动的流畅」,也让我对这个模型背后的技术产生了强烈的好奇心,所以,我又去 arXiv 上找了找 SkyReels-Audio 的技术论文,果然发现了一些背后团队所做的不太普通的技术创新。
接下来,我们一起深入解读下这些亮点。
我们找到了 SkyReels-Audio 的 5 个亮点
SkyReels-A3 本质上是一个基于DiT(视频扩散模型)的视频生成模型,这也是目前的主流模型框架,专门针对「听声音生成视频」这个场景设计。
它最大的特点在于:能根据音频生成时间上连贯、视觉上一致的长视频内容,而且还能精准控制每一帧的表现力度。
比如说,当音频中某句话需要强调时,数字人的表情会相应加重;语速快的地方,动作节奏也会跟上。这种控制能力,正是技术团队突破的结果。
为了达成这个技术目标,技术团队做到了一系列突破。
我们接下来主要说说这些技术突破是如何「变现」到模型的实际表现中去的。
1) 「能一直说下去」
当前很多 AI 模型,基本上都专注于生成 3-5 秒的短视频,如果要做的稍微长点,就很可能会在中途「翻车」。比如说:要么画面突然卡住,要么前后不连贯,拼接的痕迹很明显。
SkyReels-A3 一定程度上解决了这个「耐力」问题。
它使用了基于训练的视频延展方法。通过训练模型,使其同时接受「参考图像」和已经生成的「历史信息片段」,从而在保证画面质量和角色一致性的基础上,保证视频的连续。
听起来很专业,其实可以这样理解:缓解长视频拼接出容易出现的问题(撕裂与画质衰减),从而能实现近乎「无限长度」的连贯输出。
这回的 SkyReels-A3 就能把说话视频「接得很顺」,在较长时间范围内保持不崩坏。
从技术团队提供的例子可以看出,使用基于训练的条件融合方法生成的视频明显减少了重影现象,动作连贯性也更好。




2) 「全模态」
现在的 SkyReels-A3 建立了一个「全模态」的音频驱动框架,意思是:不只能听懂声音,还能同时理解文字描述、参考图片和视频内容。
所有这些信息都在同一个技术框架下处理,既能生成全新的说话视频,也能编辑现有视频的内容。
这主要得益于背后团队在同一套 Video Diffusion Transformer 上,统一接入了音频+文本+图像+视频做条件控制,面向「能说话人像」的生成与编辑两类任务。

3) 「嘴型更准」
对于数字人视频来说,嘴型同步是最关键的技术难点。人们的眼睛对「说话不对嘴」很敏感,哪怕差一点点都会觉得很奇怪。
人脸中,不是每个部位对「说话效果」的影响都一样重要。
SkyReels-A3 在这方面下了很大功夫。
重点关注嘴部区域
技术团队引入了「面部区域加权损失」机制。
简单说就是,在训练时让模型特别关注嘴唇区域的变化,而对额头、鼻子等变化不大的部位保持正常关注度。这样既能把嘴型细节做得很精准,又不会让整张脸看起来僵硬。
在视频编辑时,团队会采用两阶段策略:前面几步用整段视频来保持结构一致性,后续步骤则切换为首帧图像来强化口型细节。
更贴合更自然
集成了 Whisper 音频特征提取技术,通过特殊的融合方法让嘴型与声音更加贴合,说话更自然。 同时,在推理时加入 Audio-Guided CFG(音频引导的采样权重),动态平衡条件影响力,强化「音画同步」。
在技术报告中,SkyReels-A3 也给出了与其他音频驱动说话头像方法的主观效果对比,优势很明显:





4)「除了准之外,还要像」
SkyReels-A3 采用了一种「混合学习」的训练方式,这指的是:两种训练方式一起学,优势互补。
比如,模型在训练时同时用了两种素材:
【1】一种是:一张照片 + 一段语音 → 生成会说话的动画;
【2】另一种是:一段参考视频 + 新语音 → 编辑嘴型,让它说出新内容。
这两种方式各有优点,比如照片驱动的动画:强调「说得像」,嘴型细节更突出;再有就是视频驱动的编辑更强调「像本人」,让五官表情更连贯。
SkyReels-A3 在实际训练过程中,把它们联合起来训练。
这种双重训练让最终效果既准确又自然。
5) 「数据集很好、很严格」
前面这些基本都是技术架构上的改进,除此之外,SkyReels-A3 也需要优质的训练数据。
我看了下他们的数据流程图,感觉确实筛选很「扎实」。
SkyReels-A3 的训练数据经过了严格筛选,论文原文中是这么写到的:
从 10000 小时的原始视频中精选出 1000 小时的高质量训练集。这个过程包含多阶段质量检查和人工标注,确保每一份数据都符合标准。

SkyReels-A3 数据处理流
除此之外,技术团队还自建了一个覆盖「50 多种场景、多语言、多说话风格」的测试基准,确保发挥。
从技术团队提供的测试结果可以看到,SkyReels-A3 在音频与口型对齐方面确实表现不错。我们也找来了几张 SkyReels-A3 在音频与口型对齐方面,与其他基线方法的对比图:

有意思的是,就像我们之前所测试的那样,它还能处理各种不同风格的角色,甚至包括卡通形象。
技术团队也拿各种不同人物、尺寸和风格的参考图像,实际测试了一下生成效果,最后的视频结果都比较自然且一致。
比如小猪佩奇的说话视频,嘴型同步效果也非常自然,很符合原角色的特征。

10 个案例和一份技术报告解读完,我们深刻感受到了一个事实:
技术确实在以我们想象不到的速度狂奔。
回想起来,就在短短一年前,我们还在为 AI 能生成几秒钟不「穿帮」的视频而惊叹不已。那时候,一个「威尔史密斯吃面条」的视频,就能引起整个 AI 视频领域的集体围观和热议。
现在呢?现在,AI 已经能够让数字人讲述完整的故事,表达丰富的情感,并且口型与语音几乎完美同步。
「十字路口」团队也将持续关注 AI 视频数字人领域的进展,梳理这个「让静态变动态」的赛道。

