在一场 5 天的发布会里,Vidu 放出了一整套内容生产链
5 天,Vidu 交出了一套完整的生产工具。
**
5 天,Vidu 交出了一套完整的生产工具

👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon

这几天, Vidu 生数科技的团队肯定很忙。
从 1 月 27 日到 31 日,连续 5 天每天一场发布:Q2 参考生 Pro、Agent 1.0、主体社区、Q3、生态计划,一个接一个上线。
这种节奏在 AI 行业不太常见。大多数公司发布重要产品,会提前预热好几周,发布会开完再花时间迭代优化。
这一轮更新的目标很明显,是在把 AI 从能生成视频推进到「进入内容生产链条」。
这也和他们从一开始就强调的**「生产级 AI 视频能力」**是同一条路线。
想理解这次发布的话,可以从一个具体场景看。假设一个短剧团队想用 AI 做 16 秒剧情片段,他们需要什么?
角色表情、动作能控制。特效能复刻、能编辑。台词和口型对得上。镜头能切换、有叙事节奏。背景音乐、音效能配合,最好还能快速批量产出。
这些需求放在一起,其实已经是一条完整的制作链路。刚好,Vidu 这 5 天发布的内容,基本都这些环节上去补位。
🚥
如果把这 5 天的发布看成一张拼图,你会发现它刚好构成了一套完整的生产工具。接下来,从「生产流程」的视角,分享我们对这 5 天 5 款「产品」的解读。
为了完成一个「完整叙事生产流程」,Vidu 都做了什么?
从「真实的生产流程」的角度来看,过去两年的 AI 视频模型进化很快,每一次迭代都将整个流程往前推了一步。从动态图到长视频,从模糊到高清,时长从 5 秒延长到 10 秒,几乎每个月都在迭代。
但这些进步更像是锦上添花,很难让整个专业创作流程,一起往上再走一个台阶。Vidu 这次发布在试着解决 3 个问题:如何让生成结果可控、如何让内容能讲完整故事、如何针对具体场景优化工作流。
于是,Vidu 在这 5 天内发布了 2 个模型,1 个 Agent,1 个主体社区,1 个生态计划。
整体来看,主要的目标基本在 3 个范式:
【1】AI 视频生成的可控性将会提高,将会试着摆脱「随机生成」,这对应的是 Q2 参考生 Pro;
【2】在真实的生产场景中,模型应该能交付「故事」,这对应的是 Q3 模型;
【3】垂直场景下,将会有一个解决方案,这个方案是 Vidu Agent 1.0。
而在这背后,则有 2 个思考:
【1】创意即资产,AI 视频正在成为新的内容生态;
【2】创作者的位置应该是「生态中的一环」,不再孤立。
我们一层一层来看。
首先,Vidu 这回发了 2 个模型:Q2 参考生 Pro 和 Q3。虽然模型名称的数字一直在涨,但这俩模型不是单纯的「Q3 大于 Q2 参考生 Pro」关系。Q2 参考生 Pro 更偏向「参考」,Q3 是 Vidu 新一代声画同出模型。
先说 Q2 参考生 Pro。
1)Q2 参考生 Pro 把「可控」做到什么程度
AI 视频要真正用到生产里,必须解决一个问题:**如何让生成结果从「随机惊喜」变成「可控预期」。**这次发布的 Q2 参考生 Pro 把这个能力往前推了一步。
1 月 27 日发布的 Q2 参考生 Pro,被称为全球首个「万物可参考」的视频模型。这不只是参考范围的扩展。
过去的 AI 视频模型大多只能参考图片中的静态元素:人物外形、场景构图。但真实创作场景中,创作者需要参考的往往是动态的、抽象的要素。一个特效的实现逻辑、一种情绪的表达、一种材质的质感、一个动作的节奏。
但是,你想让 AI 参考的话,那基本是有点难的。
问题出在哪里?参考范围太窄了。
模型只认识「这个人」「这个场景」,但看不懂「这个人的变身特效怎么实现的」、「这个表情背后的情绪是什么」、「这个材质的纹理细节在哪里」。
什么叫万物可参考?
简单说就是,视频里能看到的东西基本都能拿来做参考。特效、情绪、材质、动作等等。Q2 参考生Pro 支持多视频多图参考,用户可以让不同参考素材组合在一起,创造出新效果。
比如让图 1 的角色拥有视频 1 的特效,同时参考视频 2 的动作,再加上图 2 的场景氛围。这种复合参考能力让创作自由度大幅提高。
利用 Q2 参考生 Pro 这种直观的提示词设计就能做出多主体参考视频。
比如,我让 Q2 参考生 Pro 直接参考下面这张图片的主题和视频的效果:

就能做出下面这种「参考生视频」:
参考只是第一步,可控的另一个维度是可编辑性。
Q2 参考生 Pro 新增的视频编辑功能,让创作者可以对生成内容进行精细化的增、删、改操作。更重要的是,即使经过多次编辑,画面主体的一致性仍然能够保持。这在实际生产中很关键,因为没有任何模型能做到「一次生成即完美」。
即使多次编辑,画面元素的「一致性」也能尽可能地保持住。这在实际创作中很关键,因为往往创作者需要反复调整,直到满意。
说白了,AI 视频模型还没有好到「无需修改」的地步,创作者需要一个「铲子」。
如果每次编辑都会破坏「一致性」,这个工具就没法用。Q2 参考生 Pro 的一致性保持能力让你一步步修改,每次只改一个地方,直到整个画面达到想要的效果。
特效门槛被大幅降低了。
2)Q3 要将「叙事问题」再往前推进一步
Q2 参考生 Pro 解决的是「如何控制画面」,1 月 30 日发布的 Vidu Q3 要回答的是:如何让 AI 生成的是具备完整叙事能力的故事单元。

一个完整剧情片段,只有画面是不够的。对话、音效、背景音乐、镜头切换都得配合起来才能讲好一个故事。
Vidu Q3 是全球首个支持 16 秒音视频直出的模型,这里的关键词是「直出」和「16 秒」。
直出的意思是声音和画面一起生成,从模型层面就是同步的。
16 秒的突破不只是时长数字。传统 AI 视频工作流是「先生成画面,再后期配音」,声音与画面在两个独立环节中产生,协调性依赖人工调整。而 Q3 的「声画同出」能力,让声音和画面在模型层面就实现原生同步。
像这个作品,就是 Q3 直接生成的故事短片,一共用 4 个镜头切换,把 比较完整的情节讲清楚了:
除了声画同出,Q3 还支持多镜头自动切换、旁白、双人对话、音效、音乐等等。
看评分的话,Q3 在国际 AI 基准测试机构 Artificial Analysis 最新公布的榜单中排名中国第一、全球第二,超越了 Runway Gen-4.5、Google Veo 3.1 和 OpenAI Sora。

这种「声画同出+多镜头切换」的能力组合,让 Q3 能够试着承载一个完整镜头片段的起承转合,实现节奏、情绪与叙事的流畅,融合成一个整体。
因此,Vidu 把 Q3 定位为「为剧而生」的下一代视频模型,就是这个意思。它把 AI 视频从「素材生成器」升级为「故事片段生产器」,直接嵌入编剧、分镜的创作前端。
除了这 2 个最受关注的 AI 视频模型,贯穿在以上功能里的是一个叫「主体社区」的模块。
3)主体社区让专业经验也能流通
当模型能力有了技术性的突破,下一个瓶颈在哪?在于创作经验的复用与流通。
再好的模型,如果每次创作都要从 0 开始摸索一遍,像是参数、调试提示词这种过程,生产效率还是受限于个人经验的积累。
想象一下,如果有一个资源库,里面有直接做好的运镜方式、特效、构图和氛围,你只需要 @ 一下就能直接调用,会怎样?
这就是 Vidu 在 1 月 29 日发布的主体社区在做的事。
它是全球首个 AI 视频创作主体社区,包含 8 个类型:运镜、构图、叙事、风格、场景、表演、招式、氛围。目前已经有 200 多个主体,官方说还在持续更新。
什么是主体?可以理解为一种可复用的创作资源。一个镜头语言、一种特效风格、一个情绪氛围、一套表演逻辑,这些原本需要长期实践才能掌握的专业能力,现在被封装为可直接调用的「资产」。
比如「紧张压抑的氛围」这种抽象概念就是一个主体。调用它,你的视频就会带上那种紧张感,画面色调、光线、节奏都会配合。

主体之间是可以自由组合的。
你可以同时调用 @镜头 + @氛围 + @表演,让多个主体叠在一起做出更复杂的效果。加入「主体」功能模块后的工作流是:选择「参考对象」的时候,直接去「主体社区」里找。

创作者之前设计好的「主体」,或者别的创作者做好的「主体」都可以上传这个社区。

主体社区的另一个突破在于可分享、可交易、可互动的生态机制。
专业创作者可以把自己打磨的镜头语言、独特特效上传为主体,让其他人付费使用。普通创作者也可以直接基于他人的主体进行二次创作,在协作中迭代下去。
对普通创作者来说,主体社区降低了专业门槛。
你不需要学习复杂技巧,只需要知道自己想要什么效果,然后 @ 调用对应主体就行。创意不再受限于个人经验的积累,可以在流通中不断增值下去,成为一种「复利」的资产。
4)Vidu Agent 1.0 想要改造「营销视频制作的链路」
技术真正有用,需要看能不能用在真实业务里。对广告品牌来说,他们要的也不是花里胡哨的特效展示,是能把产品卖点讲清楚,让用户记住,并且愿意下单的视频内容。
1 月 28 日发布的 Vidu Agent 1.0,主要就是在解决这件事。它的核心能力是一键成片。你只需要输入需求,它就能自动生成完整视频,类似于通用 Agent 的效果。
Vidu Agent 的底层,其实是一套已经打磨得比较成熟的多 Agent 协作系统。你可以把它理解为:好几个 AI Agent 分工一起做事。
现在 Vidu Agent 里一共放了 7 个专门的 AI 角色。有人负责想脚本,有人负责拆分镜头,有人整理素材,有人生成画面,有人做配音和音乐,还有人管剪辑节奏,以及最后把关整体效果。
每个 AI 只做自己那一段,然后一起把一个广告视频做完。
对用户来说,用起来很简单。你只要写一句需求,再给一张产品图,就可以直接启动整套流程。后面从脚本到画面,再到声音和剪辑,都会自动往下走。中间你也可以自己改分镜、调结构,让结果更贴合你的目标。
这里要解决的问题是:就算 AI 能做出好效果,如果每次都要写复杂提示词、调参数,对大多数创作者来说门槛依然很高。
尤其是传统的 AI 视频营销制作流程其实很长。
先要搞清楚产品卖点,再写脚本,然后做分镜,接着一轮轮改提示词、跑素材,最后还要进后期剪辑。
每一步基本都离不开专业的人来盯着做,所以整体很花时间,也很花人力成本。
Vidu 这回发布的 Agent 整体体验是为「营销场景」而做的:

上传图片,给定产品卖点和具体的应用场景,Agent 就会自己做出分镜脚本:

这个 Agent 发挥作用的场景更多,其中最常用的场景是「商品广告」。Agent 的做法是:你只需要给目标和素材,它帮你把中间那条长链路压缩掉一大半。
这件事很有意义。
因为,很多创作者在最一开始没办法,或者说不知道怎么像在 Q2 参考生 Pro 和 Q3 模型的操作流那样「拖动」主体,写一个结构化的提示词。
对营销团队、自媒体们来说,Agent 解决的是批量产出效率问题。除了效率,更关键是成本降低和试错空间,它是一个更懂产品的 Agent,它能够结合产品特点生成卖点有吸引力和爆款视频结构,生成高转化的广告营销视频。
5)Yes, Vidu 全球生态计划:让工具用起来,做下去
主体社区里那些专业主体是谁做的?Agent 批量生成的内容谁来用?Q3 生成的短剧片段最后要推给谁看?
工具再好,如果没人用、没人一起参与,很难一直发展下去。
这些问题的答案都指向同一件事:**创作者和使用者才是让工具真正用起来的人。**说白了就是:让更多人用起来,也让用的人能赚到回报。
1 月 31 日他们发布了 Yes, Vidu 全球生态计划,直接拿出「1 亿积分 + 千万奖金」,把资源给到创作者和合作伙伴,让大家更愿意长期投入。这套机制,其实是有诚意的,没有搞很多弯弯绕绕,权益明确。
比如说下面这个「艺术家计划 2.0」,创作者可以通过生成优质内容、分享主体、制作教程等方式获得积分。积分就可以用来生成更多视频,或者换会员。

认证讲师体系也是类似逻辑。如果擅长用 Vidu 做某类视频,愿意分享方法,就能成为讲师,拿资源支持。企业端还有合作伙伴体系,积分池和商机池。
当创作者能拿到回报,讲师能靠经验变现,合作伙伴能持续接到机会,生态才会自己跑起来。
工具要活下来,一定要让用的人先受益。
如果把这 5 天的发布连在一起看,会发现 Vidu 想讲的而是一很更实际的事:2026 年的 AI 视频创作需要做到「能完成整段叙事」,或者说试着去做好一个视频创作的全流程。
可以拆成 3 层来看。
在技术层里:
【1】Q2 参考生 Pro 解决参考与一致性问题,让创作者能控画面;
【2】Q3 把声画一起拉进模型层,让片段能讲故事;
在应用层里:
主体社区把镜头语言和创作经验变成可复用资产;Agent 把复杂流程压缩成一句需求;
在生态层里:
创作者和合作伙伴一起参与,一起分收益。
三层合在一起,就把整条制作流程串起来了:从想点子 → 做内容 → 调整 → 复用素材 → 发布 → 变现,基本都有对应工具。
单看每个产品,只像一次功能升级。但按制作流程一起用,就变成一整套能直接干活的生产工具。
技术能力已经差不多到位了,后面真正重要的,是一些更实际的问题,有 3 个方向很值得继续看:
【1】新一类创作者会不会出现?会不会出现一批从一开始就用这套工具做内容的人?
【2】会不会长出新的内容形式?16 秒完整剧情,加上声画一起生成,会不会带来不同于现在短视频的新内容样式?
【3】产能会不会被放大? 短剧、漫剧这类 AI 视频内容,产量和制作速度,能不能直接上一个台阶?
这些变化,会直接决定 AI 视频是停在展示阶段,还是走进大规模商用阶段。
🚥
回到开头那个短剧团队。
现在他们想做 16 秒 AI 短剧,Vidu 在这 5 天里给出的答案是可以这么干:
Q2 参考生 Pro 控制特效、情绪、材质。Q3 生成 16 秒音视频同步片段。主体社区里 @ 调用运镜、氛围、表演。Agent 批量产出、快速迭代。加入生态计划拿流量和商业合作。
一套流程下来,该有的基本都有了,每一步都有对应工具,而且能直接接上下一步。从这次整套发布来看,Vidu 已经把工具、流程和创作者体系都搭好了。
接下来,就看创作者们如何用这套内容工具链完成属于大家自己的、新的叙事了。

