LibTV 也发布了自己的视频 Agent,我们第一时间实测
AI 视频进入 Agent 时代,好镜头只是起点。
AI 视频进入 Agent 时代,好镜头只是起点

👦🏻 作者: GaKi
🥷 编辑: Koji
🧑🎨 排版: NCon

**很多人第一次使用 AI 视频工具时,会被一个瞬间震撼,真正开始做作品后,又会遇到另一种无力感 —— **
工作流难以构成,又无从下手。
一条 Prompt 已经可以在 Seedance 2.0 这类的视频模型中,生成一个惊艳的镜头。但真正的视频创作,很少从一个镜头开始,也不会在一个镜头结束。
这也让围绕 AI 视频生产的「卖铲子」玩家看到了机会,开始跑步入场,比如:
** LibTV 最近上线了 LibTV Agent。** 它将视频创作流程中的创意策划、剧本、分镜、画面生成和后期调整整合到一个 AI 工作流中。用户可以通过自然语言启动创作,也可以调用 LibTV 提供的 Skill Hub,让 AI 根据不同风格和场景完成视频制作。 同时,专业创作者仍然可以通过 Storyboard 和 Node 视图,对镜头、节点和生成流程进行进一步调整。
🚥
「十字路口」团队第一时间进行了实际体验,测试了广告、短剧、MV 等不同类型的视频创作场景。
下面分享我们的实际体验。
Codex Micro 高奢 TVC
LibTV Agent 的入口还是在 LibTV 官网:
先交代一下背景,前段时间 OpenAI 发布了 Codex Micro,一个用来操作 AI Agent 的实体小键盘。官方宣传片里其实没怎么展示这个键盘的具体样式,倒是有位博主在 X 上发了一张图,是他在 OpenAI 展位上拍到的一个产品,外观很接近 Codex Micro。

我的想法是,直接给这个产品做一支苹果风格的高奢感宣传片。这正好可以用上 LibTV Agent 这次的一个主要更新点 —— LibTV Agent 这次集成了一个 Agent Skill Hub。
里面的 Skill 数量不少,覆盖了专业影视、广告、漫剧、游戏、动漫、MV 这些方向,都可以一键调用。比如高奢感 TVC Skill,做的就是奢侈品牌一类的视觉表达,视听语言和整体的 TVC 风格会比较有「高级感」。

使用方式很直接:选中这个 Skill,把产品图贴进对话框,再输入提示词就可以了。

LibTV Agent 现在完全采用 Agent 对话流的方式工作。它会自动生成产品三视图、细节图和多张分镜图片,再基于这些分镜节点做整体规划,接着生成视频、BGM 这些内容。

LibTV 的无限画布里有两套展示逻辑:一个是工作流,比如上面这张图;另一个是故事板。两者的用途有些区别,我一般在工作流视图里概览整个画布的进展情况,再到故事板里针对文本、图片、视频做细节打磨。

制作过程中我发现,白色版本的 Codex Micro 出来的效果不太理想,按键和键盘主体很容易糊在一起,缺少区分度。
于是我让它多做了一个版本,换成黑色的 Codex Micro。

最后的完整效果如下:
整体思路不复杂:开场用纯黑背景衬托 Codex Micro 的产品质感,中间做多个视角的镜头切换,结尾安排一个人类角色出场,和产品产生互动,这基本是 TVC 的固定做法,成片的完成度是够的。
视频里有几个细节能体现 LibTV Agent 的能力:它可以做多轮思考,也允许你在各个节点上自由修改。比如下面这个镜头,手指按下按键的瞬间,配了一个心跳声。

还有一个镜头是,Codex Micro 在光线流转中旋转展示之后,一个模特伸手把它拿起,最终是一段双语 Slogan。这段镜头的衔接和穿梭感处理得比较到位:

【2】推销 Codex Micro 无厘头喜剧
做第一支高奢感 TVC 的过程中,我摸索出了一个提示词模板。
整体结构是:提示词的开头先写一段全局风格前缀,把短片的整体风格和视觉要素定下来;中间再写具体的分镜;最后附一段负面提示词。按这个结构来,成品率会更高一些。
LibTV Agent 的 Skill Hub 里有一个叫「无厘头喜剧」的 Skill,实测下来完成度不错。
我就拿这个 Skill 做了一支推销 Codex Micro 的无厘头喜剧短片。
提示词结构如下:
`全局风格前缀:
中国城市夜市实拍风格的无厘头喜剧短片。手持跟拍镜头,微微晃动,纪录片质感。 环境:热闹的夜市街道,暖黄色灯泡串、蒸腾的烟火气、油锅滋滋声、嘈杂人声。 主角是一个一本正经的年轻推销员,穿着与夜市格格不入的笔挺西装,双手像捧珠宝一样捧着一个巴掌大的方形黑色小键盘。
具体的分镜:XXXXX 。
负面提示词:没有模糊变形的人脸,没有多余的手指,没有畸形肢体,没有文字水印,没有卡通画风, 没有影棚布光,没有过度美颜,键盘不变形不多键。 `
在 Skill 加提示词模板的组合下,LibTV Agent 做视频会更有章法。它跑出了一条完整的工作流,里面包含 5~10 个分镜。

实际使用中也遇到了问题。这类 AI 视频 Agent 的工作流每一步衔接得很紧,前面的输出会一路传导到后面。
这次分镜生成得很顺畅,场景和故事流程都没问题,但成片里的产品和我一开始给的参考对不上。我让它自己去排查问题出在哪,最后定位到最开始的西装推销员角色锚点图上:他手里拿的产品是错的。

修改前置节点这件事,在 LibTV Agent 里做起来比较容易。点击那张出错的图片,它就会直接进入 Agent 的上下文。我告诉它,西装推销员手里的产品和参考产品不一致,它就会按照我原先给的产品重新生成图片,生成后让我点确认。
确认之后,后续的分镜会基于修正后的角色和原先没出错的场景重新跑一遍。
而且不是全部重跑,一开始的 57 个分镜里,可能只有 34 个有问题,它会给我一个表格,让我勾选哪些分镜需要重做。选完之后,它再把这套自动化流程重新走一遍。

最后的完整效果如下,整体我是满意的。提示词里没写到的剧情内容,它会自动补上;中途出现的错误、BGM 的调整,也基本都是自动跑完的。
前置节点修正之后,不需要我再手动去对每一个分镜,它会把后置的所有节点重新跑一遍,再合成一个完整的视频。
【3】「孤独美式健身短视频」+ 自建 Skill 前面两个视频,用的都是 Skill Hub 里现成的 Skill。制作过程中我也发现了一些可以改进的点,比如它默认不会用九宫格图片作为参考,而在我过去的使用经验里,九宫格图片作为视频和剧情的参考,对模型的帮助比较明显。
这类实际使用中发现的问题,可以整合起来做成一个自建 Skill。
我就照这个思路做了一个「孤独美式健身短视频」 Skill。
这种类型的视频大家应该都刷到过:一个穿着帽衫的美式健身者,独自在森林、公路等场景里训练,配合穿梭、航拍等电影感十足的镜头,整个画面都充满一种孤独却坚定的氛围,传递的就是一种无论何时、无论身处何地,都要坚持训练、不断向前的精神。
做好的 Skill 可以直接上传到 LibTV 的 Skill Hub,Skill 页面里有一个创建按钮,点进去:

就能创建自己的 Skill,填好名称和介绍,Skill 内容直接从 Claude Code 的输出里复制进来就行。

我给它配了一张孤独美式健身风格的封面图:

有了这套九宫格作为视觉参考,再把镜头语言限制在 12 种预设之内,最终生成的视频风格会稳定得多,整体完成度也明显更高。

最后的完整效果如下:
镜头感确实非常的足。
在实际体验中,比较有价值的一点是,AI 开始理解视频制作中的上下文关系。前期的角色设定、风格选择、分镜规划,会持续影响后续的视频生成。当某个节点出现问题时,也可以围绕具体环节进行修改,而不需要重新推倒整条制作流程。
这让 AI 视频从一次性的生成体验,逐渐变成一个具有连续性的创作过程。而 Agent 工作流带来的变化,是把这些原本分散的创作步骤连接起来。
与此同时,Skill 体系也带来了另一种变化,过去很多导演、美术、广告创作者积累的经验,往往存在于个人方法论之中,很难被复用。Skill 则尝试将这些创作经验、视觉风格和工作流程沉淀成可调用的能力,让创作方法本身成为一种新的生产资源。
🚥
当然,AI 视频 Agent 目前依然处于快速发展阶段。在复杂叙事、审美判断和最终创意决策上,人类创作者仍然承担着核心角色,这点不用担心被替代。
但从 LibTV Agent 这样的产品可以看到,AI 视频竞争的重点正在逐渐变化。未来的重要能力,可能来自模型生成能力、创作流程组织能力,以及专业经验沉淀能力的结合。
当 AI 能够参与越来越多创作环节,视频生产的门槛、效率和组织方式,都可能迎来新的变化。
LibTV Agent 的推出,正是在探索这种新的可能。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1[2]》、《实测 LibTV[3]》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪

参考资料
[1] https://www.liblib.tv/:https://www.liblib.tv/
[2] 实测 PixVerse C1:https://mp.weixin.qq.com/s/cgAzZy2PptdYaWbqywVg7A
[3] 实测 LibTV:https://mp.weixin.qq.com/s/aycqnq8wlaaOei1QZmhFHQ