谁在批量生产你刷到的 AI 短剧?|十字路口实测

模型定上限,Agent 定下限。

模型定上限,Agent 定下限。

👦🏻 作者: GaKi

🥷 编辑: Koji

🧑‍🎨 排版: NCon

在刚刚过去的 2026 WAIC 上,智象未来(HiDream.ai)正式发布了内容创作智能体——vivago R1,这款产品已经在昨天全球上线,国内版本**「够搭」** 全新升级发布,其核心定位是 3 到 5 分钟完整视频的稳定生成。

该产品的推出,刚好对应了目前 AI 视频技术的快速进步。

从最新的 Artificial Analysis 盲测榜单来看,基础模型的竞争非常激烈,海内外头部科技大厂与 AI 独角兽纷纷入局,在画面质感、运动幅度与生成效率上各展所长。

Foundation Model 的效果越来越好,但模型的画面与最终成片之间的工作流仍有断裂,而这就是 Agent 产品发挥价值的位置,也是这次** vivago R1 的核心定位**。

🚥

十字路口团队第一时间进行了深度实测,接下来分享实际体验。

实测:直出 5 分钟爆火「天宫巨阙」长片 × 6 条 TikTok 带货短视频

首先,vivago R1 的体验链接是:

https://goudaai.com/home 进入网站之后,直接输入提示词或者调用对应的 Skill,再用 @ 添加素材,就可以开始创作。

最近常刷各个社媒平台和短视频平台的同学,肯定会注意到,像下面这种天宫巨阙、中国古风的短视频特别多,甚至快成为 AI 短剧的一个主流分支了。这类 AI 短剧的核心要素是宽景构图和巨物美学。

现在 vivago R1 可以一次性直出 5 分钟左右的天宫巨阙 AI 短剧,最后再配上有网感的音乐,味道就很对了。

首先,可以直接用自然语言提示词和 vivago R1 对话,不需要搭建节点,先让它生成 3 张 21:9 电影画幅的东方神话史诗场景图。

之后只需要和 vivago R1 的 Agent 简短对话,让它参考这些图片的风格设计一个分镜脚本,它就能全自动完成视觉设计与资产生成,比如解析全部分镜脚本,建立一整套视觉风格。

整体架构完全确定之后,它会自动进入下一步,分批串行生成图片资产。剧情分镜里需要的场景、人物角色和物品,全部会被生成为图片资产。

有意思的是,生成人物角色或物品时,它会默认同时生成角色的正面、背面、侧面图,或者物品的多角度视图,用来在后续生成视频时锚定整体风格。

之后它会为所有分镜参考图和最终要生成的每一段 AI 视频片段自主写好提示词,再自主列出一个 ToDo List,逐 clip 确认,一共可能有十几个验证阶段。

这一步验证得比较细致,因为一旦缺少验证,最后生成出来的视频很可能整部片子都没法用。

比如 vivago R1 会验证所有片段的分镜长度,片段并不固定为 30 秒,也会降到 15 秒、19 秒,与整个分镜计划保持一致。

接着检查全部参考图与资产参考是否对应、所有资产是否全部覆盖,还会检查提示词长度是否会被异常截断。

提示词写得太长时,AI 可能会自动截断,但产品的前端不会显示出来,用户明明写了很长的提示词,却不知道为什么出来的效果特别差。

所以这种细致的内部检查,是非常有必要的。

现在全篇有 17 个分镜,已经映射为 17 个场次,合并成多个片段。所有图片资产都已经做完,7 个视频片段的主题也已经写好。到这一步,它才会让用户确认是否生成视频。

从最开始用自然语言输入提示词到这一步之间,我几乎没有和 vivago R1 的 Agent 有过任何交互,全部由 Agent 自主执行。

接下来 Agent 会根据它设定的整体计划、图片资产和提示词,逐一生成视频片段。

每个视频片段都会被列入画布,然后自动把所有片段剪辑成一个完整的成片。

展示完整五分钟成片之前,先给大家看一个配好短视频音乐的成品片段,音乐一响起来,整个味道就非常对了(ps. 音乐 BGM 是在剪映中手动添加的,版权来自《壁上观》,原唱张晓涵;其他所有音效和 BGM 都是 vivago R1 生成的)。

第一版生成出来的时候,效果已经很完整,能直接出一个 5 分钟的成片。我又想往里面再加一些剧情,所以又生成了一次。

两个视频我稍微剪辑了一下,最后合成了一个 6 分钟左右的小型 AI 短剧《天宫巨阙 归灯》。

一个提着没点亮的灯笼的白衣旅人,用一天时间登上天宫,把灯送到月亮跟前,剧情就这么简单。整部剧使用了多种摄影手法,用来展现天宫巨阙的建筑和风格。

整体来看,剧情衔接比较缜密,角色一致性和风格搭建也比较完整,毕竟全流程的风格参考只有最开始那几张图片,其余图片资产都是后来由 Agent 生成的。

成片还是非常写意的。

在实际测试第一个天宫巨阙 AI 短剧的时候,我发现** vivago R1 里有一个非常完整的 Skill Hub,里面有 TVC 广告、文字剧本生视频、图片编辑等各类 Skill。**

其中一些**做 TVC 广告的 Skill,尤其适合 TikTok 和 Reels。**比如有一个叫 Story AD Director 的 Skill,我用它让 Agent 直接一下做了 6 个 TikTok 风格的剧情产品广告。

这个 Skill 有一个比较固定的结构,比如前 3 秒会出现戏剧冲突,在关键的剧情转折点会自然地放入实体产品,整体架构是比较完善的。

使用时直接点击「立即试用」,输入提示词,它就会自动套用这个视频 Skill 的结构,去优化我们的提示词。

我设想的场景是制作一整套男士护肤面霜的 TikTok 和 Reels 转化真人广告。男主是一个黑人,他会在婚礼、机场、红眼航班等多个场景中使用这款面霜。

使用这个 Skill 之后,vivago R1 的 Agent 会直接给主角做定妆造型,比如在一张图里同时生成男主的多种面部表情、搭配各个场景的服装,以及面霜产品的展示效果,还会画出整个场景的分镜。

下面这个场景是它做好的一个 30 秒短片,vivago R1 可以直出这种 TVC 广告短视频。

这条 30 秒短片采用了经典护肤品广告的叙事结构:前期展示男主乘坐红眼航班后的疲惫与粗糙肤况,中期通过洗脸与涂抹面霜呈现即时修复过程。片尾运用影调冷暖转换强化状态蜕变,并顺畅收束在男士面霜的图文推广与品牌口号上。

这个 Skill 做这类 TVC 广告短视频确实非常方便。因为 TVC 广告短视频投放到 TikTok 这类平台,30 秒已经算比较长的了,而它一次可以直出很多条,所有视频的风格一致性,包括人物角色和产品的一致性,都比较高。

我们正好用 GPT 6 Astra 手搓了一个短视频拼接器,方便给大家展示最终效果。

最终的完整视频效果如下:

仔细看会明显发现,这 6 个 30 秒的 TikTok TVC 广告视频虽然场景完全不同,整体结构却很一致。比如在 3 秒左右,男主都皱着眉头,表现出一种消极状态,面对某个生活上的问题。

之后,6 个 TVC 广告视频几乎在同一时间点让产品出场。比如到第 17 秒,男主会真实地涂抹这款男士面霜。

总的来看,虽然我只用了非常简单的自然语言提示词,但搭配这个 Skill 之后,vivago R1 Agent 会根据视频 Skill 和我的提示词列出不同场景,并且在不同场景中保持同一种叙事结构。

这一点在批量制作 TVC 广告时比较重要,因为既要保持一致性,又要避免提示词过于发散导致视频画面崩掉。

所以场景尽量保持一致,叙事结构也保持一致,先有钩子,再解决问题,最后产品积极出场,这样很符合 TVC 广告的调性。

vivago R1 的产品逻辑

实际用下来,vivago R1 的产品思路主要分两层。

【1】交互:纯对话模式

创作全程不需要创建节点,也不需要手动设置画面模型、视频时长等参数。vivago R1 更推荐用户用自然语言与 Agent 对话来创作。

整体用下来,它很重视 Agent 交互,几乎全程由 Agent 拆解脚本、规划镜头、分配角色、组织节奏,最终交付成片。

官方用了一个很有意思的比喻,「AI 视频创作的入门级单反」,大致意思是足够简单,让非专业用户也能上手,又足够稳定,让专业创作者能够交付作品。

【2】长任务调度

5 分钟以上的视频通常属于长任务。目前还没有模型能一次生成几分钟的连贯视频,因此需要 Agent 来组织整个创作过程。

R1 将调度工作交给 Agent,由它根据提示词规划故事脉络,保持多个镜头中的角色、产品和场景风格一致。用户也可以通过对话,单独修改某一个镜头。

要让 Agent 负责整个创作流程、尽量减少用户的手动操作,Agent 产品就需要理顺整套链路。

R1 能把这条链路衔接起来,也与背后的研发团队智象未来(HiDream.ai)从多模态底层模型研发起步有关。 能否贯通这条长链路,很大程度上取决于团队对模型能力的理解深度。

他们此前研发的 HiDream-O1-Image 曾进入 Artificial Analysis 图像榜前列,交互式世界模型 HiDream-O1-World 则在 WBench 获得了 80.9 分。

所以现在看来,只有厂商自己经历过模型研发中的难题,才会清楚 Agent 产品要如何降低用户的操作门槛。要减少用户反复用 Prompt 生成视频片段、再整理成片的负担,厂商就要知道哪些环节需要工程逻辑来兜底。

🚥

「模型定上限,Agent 定下限」。

这句话很适合形容 2026 年 AI 视频模型及其商业化 Agent 产品的图景。

如果 Agent 的编排和理解能力持续进化,AI 视频创作的边界大概率会进一步拓展。随着商业化潜力得到发掘,AI 视频创作也会成为一门非常「赚钱」的生意,商业回报又会促进 AI 模型能力的提升。

所以,我们很期待看到,AI 视频模型今年究竟能在商业化上产生多大影响,Agent 产品又能进步到什么程度。