2026,AI视频「大年」将至|对谈OiiOii创始人闹闹:亲历微信与字节后,如何抓住下一波机会?
“大模型是超市,Agent 是餐馆”
大模型是超市,Agent是餐馆

👦🏻 播客采访:Koji
🥷 整理编辑:十字路口
🧑🎨 排版: NCon

🚥 我认为 2026 会是 AI + 视频的「大年」,很多新的独角兽都将诞生在这里。
所以,「十字路口」播客在 2026 年邀请的第一位 AI 创业者嘉宾,就是「OiiOii」的创始人闹闹。她所在的领域是 AI 视频,并且她的产品一经内测就获得了大量的关注和好评。
闹闹的履历非常独特且「性感」——**她是中国少数同时在微信和字节跳动核心业务线战斗过的产品人。**她做过QQ邮箱、负责过剪映和抖音特效、也曾是B站动画业务的负责人。她既有来自微信的、对人性与产品价值观的深刻洞察,又有来自字节的、用数据驱动增长的体系化方法论。更重要的是,她是一位心怀动画梦想十几年的创作者。
2024 年,她终于开始做一件从大学起就想做的事——用 AI 让普通人也能做动画。
这期节目里,我们聊了很多:
关于产品:OiiOii 两个月内重构了四次架构,从「首尾帧」到全面拥抱 Sora 2,这中间经历了什么?为什么她认为 Agent 不会被大模型吞噬,反而会共同繁荣? 关于方法论:她用「超市与餐馆」的比喻解释了 Agent 公司和模型公司的关系;用「左脑与右脑」总结了在微信和字节做产品的核心差异;也分享了做好产品经理的三个关键能力。 关于创业:为什么她说动画是商业世界里「少数会奖励纯粹与热爱」的行业?为什么她认为「冲突是做事的力量」? 关于产品经理:成为一名优秀的产品经理,有哪几件最重要的事?
如果你是 AI 创业者、产品经理,或者对视频生成领域感兴趣的投资人,这期节目会给你带来不少启发。
微信收听播客:
小宇宙收听播客:

🎬 视频播客已同步上线于 @Koji杨远骋 的视频号、小红书、哔哩哔哩、Youtube 等平台
由于访谈全文较长(21,432字),可先参考目录:
🟢 快问快答
年龄、毕业院校、MBTI 和星座、一句话介绍现在的公司和产品、融资情况、收入和利润、团队规模、创业前经历
🟢 AI 视频的 Agent 时刻:为什么是现在?
当 Sora 2.0 展现出惊人的分镜能力,创业公司是被"端到端"吃掉,还是迎来了最好的时代?
- 为什么做动画的最佳形态是 Agent 而不是传统的 GUI 工具?
- 视频生成的两大流派:追求极致稳定性的"首尾帧"流派,与追求镜头语言的"参考图+文生"流派。
- 只有 Agent 架构才能把不同的模型像乐高一样拼起来。
- 我们最初也没想到,甚至会有家长每天用 OiiOii 给孩子做一个圣诞歌曲 MV,或者给自己的宠物做动画。
🟢 为什么我们不怕 Sora?
大模型是超市,Agent 是川菜馆
- 当模型厂商越来越强,应用层的护城河到底在哪里?
- 即使 Sora 到了 4.0/5.0,Agent 产品也不会消亡,反而会更加繁荣。
- 超市与餐馆理论:大模型就像大型超市(提供原材料),而 Agent 是川菜馆、粤菜馆(提供特定风味的成品)。你可以去超市买菜自己做,但餐馆永远有存在的价值。
- 我们的工作有 60%-70% 像是在后厨"调味":如何让那些生硬的模型素材,变成符合特定人群口味(如 MV、科普、漫剧)的佳肴。
🟢 不只做"视频版的 Cursor":增量市场在哪里?
- 漫剧、UGC 社区、自媒体……我们在内测中发现,谁才是这波技术红利真正的买单者?
- 关于剪映的思考:AI 视频 Agent 不会取代剪映,而是带来增量。它会吃掉复杂的"特效制作"环节,但轻量的"剪辑/截断/排序"依然需要传统轨道工具。
- 为什么不直接做 UGC 社区?
- 一个反直觉的发现:最需要 AI 动画工具的,可能不是为了给大众看,而是为了维系社交关系(给孩子、给老师、给伴侣)。
🟢 微信的右脑,字节的左脑:产品经理的两种修行
闹闹是少有的在微信和抖音两个中国最顶级的产品体系里都工作过的核心 PM,她看到了什么异同?
- 腾讯微信(右脑):它是感性的、直觉的。张小龙教我们要每天看 1000 条用户反馈,去训练那种"一眼识别真伪需求"的产品直觉。
- 字节跳动(左脑):它是理性的、数据的。在这里我学会了什么是"策略产品"——数据不只是冰冷的数字,它是用户行为的概率,能告诉你如何造风。
- 相同点:它们都把自己基因里的优势发挥到了极致。微信把"人性"做到了极致,字节把"推荐引擎"做到了极致。
- 做一个好的产品经理最重要的三点是什么?
🟢 冲突是做事的力量
- 为什么要在团队里"允许冲突,甚至制造冲突"?
- 良性的冲突是筛选"做事的人"最好的方式。大家都"以事为先"时,冲突过后反而会变成背靠背的战友。
- 曾经开掉过自己最好的朋友,被骂得狗血淋头,但一年后对方发微信说:"我终于理解你了"。
- 曾经是一个搞摇滚的叛逆少女,现在变得非常 Peaceful:因为发现向外呐喊不是自由,真正的自由是内心的广阔。
🟢 预言 2026
- 对未来的反共识判断:技术的"更强互动性/更高编辑自由度",可能会让产品变小众,因为大众习惯了"被动消费"。
- 视频模型短期内无法"大一统":因为每家模型的数据标注标准不同,这就给 Agent 留出了巨大的"组合式创新"空间。
- 我不想表达什么,我希望 OiiOii 跟我一样,是一个容器。让那些被"动画之神"选中的人,通过这个容器把他们的故事讲出来。
🟢 用 10 个「我是 xxx」来造句
- 我是一个……

👦🏻 Koji
Hello 大家好,我是 Koji。本周十字路口的嘉宾是闹闹。
👩🏻 闹闹
Hello,我是闹闹。
👦🏻 Koji
闹闹是视频 Agent OiiOii 的创始人和 CEO。最近我在即刻上看到有网友说,最近半年都没有发现什么让他感觉非常 surprise 的新产品了,直到遇到了 OiiOii。我自己也试着用 OiiOii 给我的女儿做了圣诞歌曲的 MV,她们很喜欢,一直在循环播放。

👩🏻 闹闹
现在确实会有一些家长每天都会给孩子做一个小视频,还有老师用动画给孩子们做科普小视频。这跟我们最初设想中的创作者还挺不一样的。
🟢 快问快答
👦🏻 Koji
我们节目的传统,先从快问快答开始。请问你的毕业院校?
👩🏻 闹闹
中山大学。
👦🏻 Koji
你的 MBTI 和星座呢?
👩🏻 闹闹
MBTI 是 INTJ,星座是狮子座。
👦🏻 Koji
用一句话介绍现在在做的事情。
👩🏻 闹闹
用 AI 来做动画。
👦🏻 Koji
目前公司的融资情况?
👩🏻 闹闹
在做 Pre-A 轮的融资,马上要结束了。
👦🏻 Koji
方便介绍目前的收入和利润吗?
👩🏻 闹闹
我们刚成立大概 4 个月,没有收入和利润。
👦🏻 Koji
产品也刚发布一个月对吧?
👩🏻 闹闹
对,内测版本发布一个月。现在还需要邀请码。
👦🏻 Koji
目前的团队规模呢?
👩🏻 闹闹
全职 18-19 个人。
👦🏻 Koji
创业之前做过些什么?
👩🏻 闹闹
一直在做产品经理、创业以及和视频创作相关的事情,始终在视频内容创作这个领域。包括自己做工作室,也做创作工具。
👦🏻 Koji
你之前在哪些地方做过产品经理?
👩🏻 闹闹
最开始在腾讯,当时是微信事业群,我在做 QQ 邮箱的移动端。14 年开始创业,做一个极限运动的内容社区,我们自己去拍全国各地的极限运动达人,积累了很多内容制作经验,做了大概 6 年。
后来因为在内容制作和产品方面都有经验,就去了字节做剪映的产品负责人,还负责过抖音 TikTok 的特效业务。又因为非常喜欢动画,在 B 站也做过动画相关业务。
👦🏻 Koji
非常丰富的经历。如果不创业,你认为此刻自己在做什么?
👩🏻 闹闹
我估计会在一个没什么人的地方隐居吧,养一些小动物,单纯地生活着。
👦🏻 Koji
你是闲得住的人吗?
👩🏻 闹闹
我现在是很闲得住的人了。
👦🏻 Koji
以前不是?
👩🏻 闹闹
对。闲住的状态是给自己非常充电的状态,是享受此时此刻。以前的闲不住,是你总觉得闲着应该做点什么事,那是一种非常外拓的状态。
👦🏻 Koji
什么状态叫外拓?
👩🏻 闹闹
就像安静不下来,其实是心在想着"我一定要做点什么,好像才值得"。
👦🏻 Koji
对,必须要构建一些意义。
👩🏻 闹闹
是的,但实际上是没有享受过安静的意义。如果知道了安静的意义,会因为安静而释放出安静的力量,我觉得可能会更圆满。
👦🏻 Koji
我知道你做产品经理的中间,有一个自己的 gap 的半年,那半年是去学动画了?
👩🏻 闹闹
对,从腾讯出来后,我很喜欢做内容,尤其喜欢动画,就想去学学动画,看看自己能不能从事这个行业。
👦🏻 Koji
那个时候去哪里学的?
👩🏻 闹闹
报培训班。先报了插画班学角色设计,学了大概几个月。后来又学了像 Maya 这种做 3D 动画的软件。当时我觉得非常困难,因为它太难用了。
因为做过产品经理,对难用的产品天然有抵触。我就觉得可能自己不太适合这一行。
再加上整个动画行业,薪资或者说很多时候真的是在为爱发电。我当时没有勇气,就觉得还是进不了动画这个行业。
👦🏻 Koji
所以那之后没搞动画,开始了上一段和极限运动有关的创业?
👩🏻 闹闹
是的。那段时间我也碰到过很多动画行业里让我非常钦佩的人。
我记得当时去了一家做建模的特效公司。去参观时,整个公司非常昏暗,也没有空调。我们和一个建模总监聊天,他工作了五年,工资是 1 万。但在他眼睛里,我看到了他还是非常有光地在介绍自己的工作,我非常佩服。
🟢 AI 视频的 Agent 时刻:为什么是现在?
👦🏻 Koji
今天我们还是想把更多时间精力放在聊 OiiOii 上。你大概是在什么时候有了做这款产品的想法?
👩🏻 闹闹
做动画这件事,我从大学起就想做,但一直没机会。做 OiiOii 的想法,我印象中是在字节工作的时候。当时是 22 年,图像生成模型 DALL-E 2 刚发布。我觉得这个技术非常好,第一时间就联想到了这个可以做动画。
从那时起种子就埋下了,但不知道从何切入。后来我去 B 站了解动画行业,包括之前做 "狸谱",都是在试探切口。
第一是了解行业,第二是试探切入点。最后自己创业时,才找到了这个切入口。
👦🏻 Koji
你是在什么时间点看到了一个确切的切入口?
👩🏻 闹闹
应该是今年上半年。
可以说是一半被动一半主动。被动是因为在当时的时间点,前一个环境下很难再继续推进"狸谱"了,必须出来自己干。主动则是因为我们发现多模态模型开始 "卷" 起来了,那股势头跟以前语言模型爆发时非常像。这是一个好时机。
👦🏻 Koji
做 OiiOii 的过程中,有受到过哪些 AI 产品的启发吗?
👩🏻 闹闹
有。今年上半年开始 Agent 火了。当我们在想以什么方式切入做动画时,发现 Agent 是一个非常完美的形态。
首先,它可以调用各种模型。
第二,动画的制作本身就是流式(flow-based)的,它的流水线调用各种职业角色配合完成一件成品,非常适合用 Agent 来做。
第三,Agent 的交互方式和传统 GUI 不太一样,它给了创作者非常高的自由度。传统的创作工具会无限叠加功能,但 Agent 不会。
综合来看,Agent 是最匹配的形态,我们就用了它来做 OiiOii。
👦🏻 Koji
有没有什么模型能力的解锁,对 OiiOii 的帮助比较大?
👩🏻 闹闹
我们从 7 月份规划,8 月份开始做。第一个版本跟现在很多 Agent 的路线一样。
对 AI 视频赛道感兴趣的话,会知道它有两种生成模式,或者说两个"帮派":
一个叫"多参宗",就是用多种图片做参考图;
第二种叫"首尾帧"。国内很多视频模型都特别擅长首尾帧。
我们之前也采用了首尾帧的方式,因为在单个镜头里的稳定性会更好。
👦🏻 Koji
比如我一共 8 个镜头,就要做 9 张图首尾衔接,再通过首尾帧的方式生成 8 段小视频,最后拼起来?
👩🏻 闹闹
对。当时我们有个创新点:因为每个分镜要表达的内容不同,适用的模型也应不同。
比如表现武打镜头,应该用 A 模型;表现人物情绪,可能 B 模型更好。
我们设计了一个 Task Agent,它知道每个模型的优缺点,能自动帮用户匹配最适合该镜头的模型。
这个版本做了一个月,效果已经比较好了。当时我们正在加 TTS、背景音乐和音效,Sora 2 出来了,我看到 TikTok 上有人用 Sora 2 做的动画,我很吃惊,完全看不出 AI 痕迹,就是一个完整的动画。
我说这个太好了,我们当时就决定先接上 Sora 看看效果。
结果接完之后效果特别好。我们研发做的第一个视频,是一个小螃蟹和一个小猩猩在打篮球,非常完整。
我当时的第一印象是:哇,不会这事真的让我们做成了吧?!非常兴奋。
👦🏻 Koji
那个螃蟹和猩猩打篮球的视频,是一句 prompt 直出的吗?
👩🏻 闹闹
一句直出。
👦🏻 Koji
所以中间没有像原来那样调首尾帧的这些过程了?
👩🏻 闹闹
其实我们之前的首尾帧也是一句直出的,只是生成方式完全不一样。Sora 的表现力,非常好的一点在于切镜,镜头之间的切换非常自然,有很多蒙太奇的手法。
但它的缺点在于,它是参考图加文生视频,文本的比重非常大,导致一致性等各方面可能没那么稳定。
👦🏻 Koji
它有分镜切镜的优势,但因为是多图参考加文生视频,所以非常依赖文本,一致性也不那么理想?
👩🏻 闹闹
对,因为它只是"参考"用户提供的图,不是拿那一张图原封不动地继续生成,因此它的稳定性是通过模型的理解来做的。而首尾帧的方式出来的结果稳定性更好,是因为它就是从首帧那一帧开始推演。
👦🏻 Koji
那 Sora 2 出来后,你们的产品做了哪些改变?
👩🏻 闹闹
我们本来有两条链路要同时跑,后来做了一个决策:老链路先不做了,全部切到 Sora。
因为它虽然有些问题,但效果非常棒。它应该训练了很多电影,你生成或做二创时,会发现电影的痕迹非常重,甚至能看出来是哪一部电影的痕迹,我觉得很厉害。
🟢 为什么我们不怕 Sora?
👦🏻 Koji
如果未来到了 Sora 4、Sora 5,像 OiiOii 这样的产品会不会被端到端的 Sora 吃掉?
👩🏻 闹闹
不会,我反而觉得这对 Agent 类的产品非常友好。
我自己做 Agent 有一个感觉:**视频模型不大可能大一统,它们各有各的特色。**因为数据标注标准、数据质量不一样,吐出来的东西就是会各有特点。
各个模型就犹如大型超市或菜场,它们是你的"料"。而做 Agent,就像用这些料开一家餐馆。
比如我们现在做的是一家川菜馆,定位的人群就是喜欢川菜、喜欢吃辣的,那我就要到各个菜场去挑最适合这个人群的食材。
👦🏻 Koji
Sora 2 菜场。
👩🏻 闹闹
但这里头,最主要的工作是你自己的厨师是不是足够牛。比如调味道、掌握火候,我们大概 60%-70% 的工作都在调这些很细微、你在产品上看不到的东西。
大模型和 Agent 之间,就像大型超市和餐馆。 用户可以去超市买菜自己做,也可以直接下馆子吃现成的。这也导致市面上可以有很多视频 Agent。视频内容非常丰富多彩,每种内容的制作方法都不同。所以可以有川菜馆、粤菜馆、湘菜馆,也可以有火锅店。
这会是一个大家一起把 "小吃街" 做起来的繁荣状态,有竞争,但更是一起繁荣。
👦🏻 Koji
这个比喻很形象,大模型是大型超市, OiiOii 是餐馆,我可以自己去超市买菜做饭,也可以下馆子。但我好奇的是:既然 Sora 2 已经能 End-to-End 一句话直出带分镜的动漫, OiiOii 做的菜有什么不一样呢?
👩🏻 闹闹
拿 MV 来举例。你用相同的 prompt 和图喂给 Sora 2,也达不到我们的水平。因为我们会把你输入的一句话,比如"让他们几个跳一个 K-pop 来做一个 MV",进行扩写。
我们找了市面上很多做得好的二次元 MV,用自己的方法让模型学习,建成知识库。当用户输入 prompt 时,我们调用知识库模型,用它的方式吐出润色后的 prompt,再搭配镜头语言和音效,一键出片。这里面的大量工作,就是如何建立这个知识库。
再举个例子,关于剧情。我们现在的分镜之间其实会有一些断点感,很多人说连贯性不好,但这其实是我们的选择。因为如果你把每个分镜做得特别连贯,整个剧情会非常平,没有突然的转折,起伏感就会很弱。你需要在中间不停调试,找到一个合适的状态。
👦🏻 Koji
这是你们作为"厨师"的用料之道?
👩🏻 闹闹
对,就是用料的选择。
👦🏻 Koji
还有类似的例子吗?
👩🏻 闹闹
有,我们最近就有一个"用料过度"的例子。
之前有用户反馈场景一致性不太好,因为 Sora 2 是一个文本权重很重的模型,我们给它喂数据时没有喂场景图,只在 prompt 里有场景描述,这导致分镜间的场景可能不一样。
为了让场景一致,我们开始给它喂场景图。结果发现有点过了,太一致了,导致整个画面非常死板。现在的文生视频模型需要更好的想象力,如果你喂了固定的图,它的想象力就会受限。
这会导致什么结果呢?场景不应该抢夺人物的风头,人要在场景里,而不是贴在场景上。但给了场景图后,虽然场景一致了,人物和背景的融合感却很差,就像贴片一样,总感觉哪里不对劲。
这就好比,用户说"你这川菜馆怎么不辣呀?",我们听了就使劲放辣椒,结果用户又说"太辣了"。就是这种感觉。
👦🏻 Koji
但如果未来 Sora 2 变得更强,解决了它的一致性问题,同时它也开始学习垂直领域的视频知识,比如它也有了做 MV 的知识库!到那时你会担心吗?
👩🏻 闹闹
不担心。还是拿超市举例,就像现在的盒马、物美,它们除了卖菜,自己也开始做一些熟食。
但熟食和餐馆还是不一样的,餐馆有自己专注的人群,在特定方向上有非常专业的东西。这个我觉得是无法穷尽的。
🟢 不只做"视频版的 Cursor":增量市场在哪里?
👦🏻 Koji
那 OiiOii 这家"川菜馆",目前的目标用户是谁?
👩🏻 闹闹
我们自己定义的目标用户和实际用户,既有重合,也有意外。
这次创业前我们做过 UGC 产品 "狸谱",也考虑过切入 "漫剧" 赛道,但很快发现时机未到。
第一,漫剧很考验剧本,这不是我们团队的优势。
第二,漫剧是非常依赖投流的生意。
第三,漫剧是在成熟工作流里的效率优化,非常依赖人力,而我们不想做太依赖人力的事。
这三点决定了它不适合我们现在的团队。
那为什么不做类似"狸谱"的 UGC 产品呢?我觉得 UGC 还没到火候。UGC 内容的消费属性太短、信息量不足,在今天这个信息爆炸的时代,它不足以支撑一个大型 APP 的运转。而且做 UGC 需要巨大的用户体量,投入成本和推理成本都很高。
所以我们暂时不做 UGC,也不做漫剧。
我们在中间地带找到了我们的目标人群:自媒体人。一个人或一个小工作室,做的内容适合用动画来呈现。
这里面又分三类:
第一类是本身就在做动画的人,很多人是围绕一个 IP 不停地创作。我们的功能可以支持他们做一个 IP 角色,然后反复、高效地制作内容。我们调研发现,一个两三人的小工作室,目前大概一周更新一集。用我们的工具,理论上一天可以更新 10 集,即使精挑细选,一天更新一两集也完全没问题,效率是极大的提升。
第二类是 ACG 内容里做 MV 类型的创作者。
第三类是非动画领域的自媒体人,很多讲历史、科普的创作者,他们的内容非常适合用动画来呈现,只是以前成本太高。这群人有做动画的动力,愿意尝试新工具,而且他们本身在其他的自媒体平台上有流量红利,不是少数派。
这是我们想切的人群,在为期一个月的内测中,也确实触达了他们。

👦🏻 Koji
除了这些预想中的用户,还有哪些意料之外的用户?
👩🏻 闹闹
对,还出现了一些我们没想到的用户,也分三类:
第一类是做漫剧的团队,我们以为产品满足不了他们的要求,因为我们没有剧本上传这类为漫剧开发的功能。但他们的反馈是,他们不需要那么强的最终成片能力,只要分镜能对得上,把所有分镜下载下来自己剪辑就够了。他们觉得分镜生成效率非常高。这部分用户在我们未来的规划里,但现在似乎也能满足一部分需求。
第二类是完全没做过视频,不爱出镜,但想用动画来展现自己的想法和状态的人。因为动画是很容易表达精神世界的载体。
第三类是为社交关系进行创作的用户,他们创作不是为了给大众看,比如家长给孩子做、学生给老师做、情侣之间互相做,还有给自己宠物做的,以及成年人给父母做的。
👦🏻 Koji
那再往前做,面对这么多不同类型的用户,你会做减法吗?还是想服务所有人?
👩🏻 闹闹
往后做我们会有点类似抖音做垂类的思维。比如想做科普,我们就去找科普类的 UP 主,研究所有用动画呈现的科普视频,分析它们的结构,然后把这些知识变成我们的知识库,再更好地服务他们。
现在我们只是让他们能"用起来",但还没到"服务好"的阶段。我们看好这些苗头,然后排优先级,一个一个去攻克。
👦🏻 Koji
所以终极目标还是希望把这些人都服务好?
👩🏻 闹闹
对。
👦🏻 Koji
你提到 Maya 太复杂,今天也有很多用户觉得剪映很复杂。你会担心 OiiOii 有一天也变得臃肿吗?
👩🏻 闹闹
这就是我觉得 Agent 是一个绝佳载体的原因。过去所有的创作工具,从 PS 到 Figma,从 PR 到剪映,都经历了从简单到臃肿,再被一个更简单的工具替代的过程。它们的核心没变,都是在堆功能。
但 Agent 不一样。它可能会叠加功能,但不会太臃肿,因为它的很多能力是藏在背后的,而不是通过 GUI 展示出来。
Agent 的魅力在于,它是用户和产品共建的过程。用户有探索能力的话,能用出我们都意想不到的功能。
👦🏻 Koji
用户能用出你们都不知道的用法?
👩🏻 闹闹
对。我们现在的很多不足,是用户在想办法解决。这就是 Agent 产品的魅力所在,它不是一个死的东西,用户可以不断探索它的边界,让它变得更丰富。
👦🏻 Koji
但 Agent 的灵活也带来了不可控的问题。传统剪辑软件的工作流是可控的,但用户往往既要可控又要灵活高效。你们如何平衡这种看似矛盾的需求呢?
👩🏻 闹闹
这是个好问题。
主流的 Agent 分两类:一类是像语言模型那样自由度极高的,另一类像 n8n 那样以 workflow 稳定性为主。
我们既要流水线的稳定性,又要让用户能在流水线的每个环节上和 Agent 自由对话。这对架构设计要求非常高。
我们在短短两个月里,就迭代了四次架构。
👦🏻 Koji
两个月重构四次?!
👩🏻 闹闹
对。第一版,用 System Prompt 来定义各种 Agent,让模型自己判断 workflow,但非常不可控,模型不听话,自由度太高。第二版,是严格的 workflow,但完全失去了修改的自由度。
第三版,我们在 workflow 的基础上加入了"信号"机制。Agent 能知道什么时候该从 workflow 中"跳出来"接受修改,修改完再通过信号"跳回去"。第四版,则是在第三版的基础上,强化它在过程中跳到其他环节的自由度。我们现在还在第三版和第四版之间不断调试。
这是一个很容易出问题的架构,我们还在持续提升稳定性。用户现在遇到的很多问题,比如流程卡住不动了,很可能就是 Agent 跳出来后忘了回去,或者根本没跳出来,一直在自己往下走。
👦🏻 Koji
你过去负责剪映,现在做 OiiOii,你认为视频 Agent 会取代或蚕食剪映的市场,还是会带来一个增量市场?
👩🏻 闹闹
我认为是增量市场。剪映可以分成工具和生态两部分。作为工具,它的轨道剪辑功能有可替代性;但作为生态,它嫁接了整个抖音,为特定内容形态服务,这是它独有的。
OiiOii 也类似。比如它做 MV、做科普,就像是在构建一个个垂类的知识库,交付的是特定类型的内容。你用其他工具很难一键生成。所以它有独特性,不是一个纯粹的剪辑过程。当然,这些生成的内容可以再导入剪映里二次加工,没问题。
👦🏻 Koji
所以,用户在 OiiOii 生成内容后,还会回到剪映做后期编辑?
👩🏻 闹闹
基本上都是这样。我们现在更重视前半段的生成,因为剪辑工具已经很成熟了,想做好很难,把大量精力花在这上面有点得不偿失。
👦🏻 Koji
今天很多人创业想做" Cursor for 剪映"或者" Cursor for 视频编辑",你怎么看?
👩🏻 闹闹
Sora 出来之前,视频生成主要在单镜头内效果好,切镜是弱项,所以剪辑的作用很大,比如转场、特效。我当时觉得这些剪辑能力很难被 AI 替代。但 Sora 2 出来后,我们尝试了一下,一方面,发现这些复杂的剪辑能力完全可以被模型替代。
但另一方面反过来看,一些轻量的剪辑能力反而不可取代。比如视频掐头去尾,或者在最后统一配上 TTS(文本转语音)等等等等。
👦🏻 Koji 细想起来挺 make sense 的。
👩🏻 闹闹 是的。因为模型在学习视频的时候,有大量的剪辑手段已经含在里头了,所以它很可能把剪辑的很多重度工作解决了。
👦🏻 Koji 反而比如要微操删掉 0.1 秒的镜头,完全没必要用自然语言去操作 AI。
👩🏻 闹闹 对,完全没有必要,你拖一下时间轴不就完了吗?
👦🏻 Koji 还有一些什么样的例子?
👩🏻 闹闹 就是一些很简单的剪辑功能,没有必要用其他更复杂的方式替代,因为它足够简单了。
反而是一些重、复杂的剪辑能力,比如要加转场、搞特效,容易被模型替代掉。
👦🏻 Koji 所以有可能大家还是会同时用剪映,只是之前剪一个片子要用 3 个小时,现在变成用 30 分钟。
👩🏻 闹闹 对,是这个意思。效率上是两者叠加为最优解。
👦🏻 Koji
OiiOii 还有一个很有意思的设计,就是你们刚才提到多个 Agents,每一个都有自己的名字。在工作过程中,我也有注意到,会比如剧本 Agent 去召唤出角色设计 Agent,就像邀请大家加入群聊一样。这个设计可以稍微展开讲讲吗?
👩🏻 闹闹
我最初就想营造一个"团队服务于导演"的感觉,因为产品经理和导演的角色很接近。所以要赋予每个 Agent 角色感。"加入群聊"其实只是 workflow 过程的一个有趣的可视化。
但这里头会遇到多 Agent 之间交互的上下文记忆力问题,它又是一个双层关系。我们看到的只是这 7 个 Agent,但实际上它底下可能会有其他看不见的 Agent 助理在干活。所以也是在架构上相对来说比较难一点的。
👦🏻 Koji
OiiOii 的视频效果很好,除了你提到的这些,还有什么"秘方"吗?
👩🏻 闹闹
比如,我们想让普通用户也能做出"有感觉"的片子。什么是"感觉"?悲伤、欢乐、治愈……这些都是情绪词。普通人不懂镜头语言,那我们怎么帮他把一个叫"孤独"的情绪表现出来?
我们会把大量影视学的专业知识打包。比如"孤独",我们会联想到长长的走廊,灰白色的色调,然后把这些元素做成各种排列组合,融入到生成过程中。所以用户虽然只输入了一个情绪词,但出来的片子背后有大量的专业知识在支撑,这样才有那个"味道"。
👦🏻 Koji 就想起朱自清的《背影》,他表达父亲的落寞以及对他的关心,就是那一个在铁轨旁边拎着橘子的父亲的形象。
👩🏻 闹闹 对,它其实是有一些理性的要素去表达感性的东西,这个是我们需要去做好的部分。
👦🏻 Koji 那有时候也有一些艺术家的神来之笔,像朱自清描述的那个场景就和别人不一样,但他又那么细腻、有冲击力。
👩🏻 闹闹
这个就靠创作者了。我们可以学习很多大导演的风格,你输入导演名,就能出来那个味道的东西。但我们现在的自由度还不够,还是有一些高级创作者非常厉害,他们用我们的工具做出来的东西,我看了都无法相信。
🟢 微信的右脑,字节的左脑:产品经理的两种修行
👦🏻 Koji
你是少有的既在微信体系,又在字节体系都做过产品的人。在这两个中国最顶级的产品工厂,做产品经理的感受有什么不同?
👩🏻 闹闹
在微信,我其实是在非常早期做 QQ 邮箱,还处于产品经理的初级阶段。那段经历对我最大的影响,是培养了非常深刻的产品价值观。
我看到了像"龙神"(张小龙)那样厉害的人,如何把对人性的深入思考嫁接到产品上,这是非常厉害的功力。
👦🏻 Koji 举个例子?他对人性的思考如何嫁接到 QQ 邮箱这样感觉如此中性、没有性格和人性色彩的产品上?
👩🏻 闹闹
QQ 邮箱有点难举例。我记得做微信时,每个版本更新都有一个"预演"。有一次小龙用了"我所说的都是错的"这句话,然后搭配了一个 Michael Jackson 的图。这看起来很简单,但你知道背后隐藏了他极深的思考,最终呈现出的那句 Slogan 是非常有力量的。
一个产品的力量感,往往就凸显在这些细微的地方,很让我感动。
👦🏻 Koji
那真的是他的神来之笔。记得微信有个版本发布时,打开就是"跳一跳"小游戏,完全想不到微信会做一个跳箱子的游戏,结果还如此的魔性,全民都乐此不疲在玩。
👩🏻 闹闹
对,当时有很多这种故事。
👦🏻 Koji
刚刚对比微信和抖音的产品体系。你提到在微信体系里能强烈感觉到"产品价值观"?
👩🏻 闹闹
当时我们每天都要过用户反馈,一天几百上千条,而且每一条都要回复。这件事对我影响非常大。我们要从反馈里识别哪些是真需求,哪些是假需求,声音最大、喊得最凶的未必是真实的。
👦🏻 Koji
张小龙在他经典的 8 小时产品公开课里讲过,如何识别真假需求?办法就是"泡"在用户的反馈里,看看用户到底在说什么,而不是坐在会议室里大家 Battle。
👩🏻 闹闹
对。当我们把自己看太重时,就会很盲目。所以要把产品"搭"在用户的真实场景里:
第一看他反馈什么,第二看他的真实行为。
第三点非常重要:**用户体验是一种"被训练出来的直觉"。**这就像大模型一样,通过长期与用户的反馈交互,不断强化,最终形成了一种直觉。
👦🏻 Koji
那在字节呢?
👩🏻 闹闹
字节非常注重数据,我一开始很不适应。**因为数据好,不代表体验好。**比如把一个按钮放大,数据肯定会变好,但这不代表这是最佳的用户体验。
我早期对这种纯粹以数据为导向的体系有些抵触。
👦🏻 Koji
你是刚加入字节的时候就在做剪映的产品 1 号位吗?
👩🏻 闹闹
没有,是在做特效,后来是剪映,然后在抖音也做过一阵子。在剪映的时候反而很好,因为它是一个产品体验感更强的组织。
其实是在做特效时,我慢慢体会到数据的力量,懂了什么叫"策略产品"。
👦🏻 Koji
什么叫策略产品?
👩🏻 闹闹
比如说,我们要通过各种用户的行为来判断他使用这个功能的最高概率。
因为特效是跟风模仿的,你要造风,就要先找到最可能跟风的这批人。那什么人最可能跟风呢?比如他经常打开特效,或者经常看特效类的视频,或者哪怕有一次点过下面那个转盘,或者点过收藏,就是用他的各种行为来测算一个概率,看他使用特效的可能性会不会更高。
当你懂了这背后的原理,就会发现,产品 sense 和数据是可以完美结合的。
它不是冰冷的数字,而是一个逻辑推演的过程,背后是真实的用户行为。你要会解读数据,也要会利用数据。
👦🏻 Koji
还挺有意思。
👩🏻 闹闹
对。一个非常右脑,一个非常左脑。这对我现在做 AI 产品很有帮助。因为 AI 产品没有那么大的数据量给你做判断,你需要有微信体系培养的那种产品 sense;但同时,处理模型之间的搭配和策略,又需要有字节体系训练的那种理性思维。这就像动画,是艺术和技术的完美融合。
👦🏻 Koji
确实很有趣的比喻,就是做产品好像在字节和在微信是一个右脑,一个左脑,但最后都做出了这个中国最厉害的产品,那他们又有哪些相同呢?
👩🏻 闹闹
他们的共同点是把自己的优势发挥到了极致。
字节注重数据科学,它的推荐引擎和增长体系,把"效率"和"数据"的优势发挥到了极致。
微信那时对用户和人性的理解非常深刻。它洞察的不是表面需求,而是深层的人性浮上来后,应该通过什么样的体验去承载。它把"体验"和"感性"发挥到了极致。
👦🏻 Koji就像当年谁也没想到微信的 Slogan 会是"微信是一个生活方式"。
👩🏻 闹闹
在微信,大家感觉是张小龙在做决策。但他不是封闭和固执,而是开放地听取建议,只是他往往想得比别人更深。最终的决策是在听取所有人意见基础上的收敛。
在字节,大家更相信"科学决策",相信组织,或者说相信这套算法引擎给出的答案。
👦🏻 Koji虽然做法不同,但核心很有意思:大家都是意识到了自己的优势在哪里,然后把这个优势放大到极致。
👩🏻 闹闹对。这就像创业一样,没有某一种必定成功的模式,每个创始人都有自己的性格。
关键在于知道自己的长处,然后把这个方向发挥到极致,这样也许就能做成一件有节奏感、能长期存在的事情。
👦🏻 Koji
那你认为 OiiOii 的优势是什么?
👩🏻 闹闹
首先,从第三者角度看,**创始人和团队的基因非常重要。**必须对动画和技术非常了解且笃信。
商业世界里,**纯粹的热爱不一定能带来商业成功。但在动画领域是个例外(如迪士尼、皮克斯、追光的王微、饺子),这是一个少数会奖励"纯粹"和"热爱"的行业。**这非常适合我。
👦🏻 Koji总结一下,你作为创业者的优势在哪里?
👩🏻 闹闹
首先,做动画这件事,对我来说已经是很久很久的执念了,不是 AI 来了我才一拍脑袋要做的。它是我一直在想的事,AI 给了我一个能把它做得更好的机会。
其次,是能力和团队的匹配。我经历过大公司,也自己创过业,某种程度上,我和我的团队都为这件事做好了准备。既有信念,又有能力,那就去干吧。
👦🏻 Koji
你觉得做一个好的产品经理,最重要的事情是什么?
👩🏻 闹闹
第一是移情能力。你要能迅速切换角色,即使你在这个行业经验丰富,也要能瞬间变回一个小白。这需要你常常抽身出来,像一个观察者一样观察自己和用户。
第二是 50% 的自信和 50% 的自省。 只有自信没有自省,容易变成自负。自省不是为了自卑,而是为了更冷静地看到不足,从而加强自信。这会让你的自我感没那么强,也就减少了产品经理致命的盲区。
第三是对技术敏感。你可以不会写代码,但必须对技术有很好的理解,知道什么样的技术能实现什么样的东西。这是基本功。
👦🏻 Koji
你怎么保持对技术的敏感度?
👩🏻 闹闹
我好像没有刻意去保持,它就像直觉一样,是一个感兴趣后慢慢叠加的过程。
比如说我小时候就是对视觉、听觉比较敏感,这是感性上的。其次我很喜欢物理,那对于规则是非常敏感的。这些东西都会导致我对于多模态的技术,刚好是一个视听语言的技术,它是有规律的,就是我最擅长的那一部分,所以就会敏感。
👦🏻 Koji
感觉你现在很幸运,小时候感兴趣、年轻时想做的事,现在终于可以做了。
👩🏻 闹闹
是的,这次创业我有一个非常强烈的感觉,就是幸运。过去看似走了一些弯路,但实际上每一步都在为这次创业做准备。
👦🏻 Koji
就好像乔布斯的金句:把过去的所有的点都连成了一条线。
👩🏻 闹闹对。其实之前也没有刻意去这样安排,但是你会发现这一次,天时来了,我自己的能力、爱好、敏感度都匹配上了。要做这件事情,一切都刚刚好。真好,就很幸运。
👦🏻 Koji
OiiOii 这个名字是怎么来的?这个名字也很特别。
👩🏻 闹闹
"oii" 像二次元里打招呼,很亲切可爱,是我们一个技术同学提议的。叫 OiiOii 是因为两声更可爱,而且你看它写出来很像两只小蜗牛,我们希望自己能像蜗牛一样,踏实地慢慢爬,但同时又很可爱。
👦🏻 Koji很有意思。我一开始理解 "oii" 这个名字,觉得朗朗上口,有点像二次元打招呼,很有热情。
但我没想到它背后不仅有声音,还有一层象形文字的含义。
👩🏻 闹闹 对。这就是为什么它的拼写是 "一个 o,两个 i" ——这样看起来更像一只蜗牛。
🟢 冲突是做事的力量
👦🏻 Koji
你曾在朋友圈分享:"将隐形的愿力显化到产品上,是秘籍,掌握者寥寥无几,要更精纯还远远不够。" 当时你写这句话的时候是被什么故事、被什么产品或者被什么人触动到了吗?
👩🏻 闹闹
当时正准备离开"狸谱"做新东西。放弃"狸谱"对我来说很难,它是我做动画的起点。但在做它的过程中,有很多我不可控的东西,夹杂了太多"杂质"。我就觉得这一次创业,虽然我当时也没有找到很好的切入口,但我一定要做动画这件事是很确定的,那可以在新的产品里去尝试,用只有我来主导的力量,去做更精纯的这件事情。
👦🏻 Koji
希望这个愿力更多是来自纯粹的自己。
👩🏻 闹闹
或者是来自于我选择的这个团队本身。
👦🏻 Koji
在同一篇分享里,你还写道:"要允许冲突,甚至要去制造冲突,因为冲突是做事的力量,是筛选做事的人的方式。"可以分享一个冲突最终成为力量的故事吗?
👩🏻 闹闹
我非常喜欢竞技体育,比如打篮球,你会发现对手往往能激发出你的潜力。
良性的竞争是互相欣赏、互相激发的过程。
那在工作的里其实很少遇到这样的状态,因为往往你在起冲突的时候就是攻击的状态,但我们是遇到过一些不打不相识的队友的。
比如在字节跳动时候, 当时多个团队争夺"特效"业务,后来是我们拿下来了,导致和其他团队产生冲突。但后来发现,既然大家都是"以事为先",打过仗后反而互相佩服,从对手变成了队友。
在第一次创业的时候,我第一个开掉的员工是我的好朋友,因为他的状态跟不上团队了。我跟他说的时候,被他骂得狗血淋头。他出去后还挖我们的人,去做同样的事。但一年后,他加回我的微信说:"我终于理解你了。"因为当他自己处在那个角色上,就体验到了我当时的处境。
这些经历让我得到一个正向反馈:当时的冲突可能会造成误解,但只要你的出发点不是害人,时间终归会证明一切。有时,冲突反而更能激发彼此做事的态度。
👦🏻 Koji
大家叫你"闹爷"是因为什么?你今天给我的感觉非常 peaceful,和 "闹" 这个字反差很大。是因为过去很闹,最近才 peaceful 下来的吗?
👩🏻 闹闹
过去是很闹,是一个非常 "E" 的小孩。可能是十多年前上一次创业,经历了一些起伏,家里也发生了一些事,这让我更 peace。在这个过程中,我尝到了 peace 的甜头,发现它其实是一种更大的力量。
👦🏻 Koji
比如什么样的甜头?
👩🏻 闹闹
我初中组过乐队,搞摇滚,后来玩极限运动。那时候内心非常叛逆,有一根反骨。你会发现那种力量是外放的,是在呐喊、反抗,试图在外界寻求一种高度的自由。
但无论你在外界如何寻找,那种状态始终是不满足的。你以为那是自由,其实那是给自己造的一个巨大的牢笼,它在不断消耗你。
当你有机会审视内心,你会发现真正的自由在这里。这种能量不是用力的、爆发式的,而是细水长流的,它反而更广阔。大家觉得 "闹" 和 "静" 反差很大,但在我看来它们是一体两面,都是在寻找自由——最开始我用呐喊的方式寻找,最后发现真正的自由在心里。
👦🏻 Koji
我很希望能有更多时间聊聊这种从 "闹" 到 "静" 的变化。以及如何得到更多的 peaceful 从而产生出力量。
但说回 OiiOii,你说过你最喜欢的企业家是 Pixar(皮克斯)的创始人。他早期做技术工具,后来转型做动画片取得了巨大成就。你为什么没有像你的偶像一样,直接去做动画片?
👩🏻 闹闹
我喜欢他,不是因为他做了动画片,而是因为他找到了自己的擅长点,并把它在动画里发挥到极致。
我们下意识觉得做动画得会画画、会讲故事,但他两样都不行。
他喜欢的是电脑和物理,这和我一样。他是在这条路上慢慢摸索出来的。比如他利用图形学和数学分形技术,制作了世界上第一只用电脑模拟的手。他没有用传统的方式,而是用技术的方式切入了他热爱的领域。
👦🏻 Koji
对,那支关于手的一分钟短片当时一经发布就引起了轰动。
👩🏻 闹闹
对,由此打开了用电脑制作虚拟图像的大门。
他在工业光魔做特效时意识到,即便不会画画,利用擅长的电脑和物理知识,依然可以参与动画制作,最终诞生了世界上第一部 3D 动画电影。
我会画画,但画得不够好;我想写故事,但也写不出惊世骇俗的故事;我也不是技术出身。
但我有我的擅长点——我对技术敏感,并且知道如何把它转化为产品。我的满足感来源于,大家用了这个产品后激发出了创意。
所以在做 OiiOii 的时候,它是用了我最擅长的方式来从事动画这个行业。所以它对我的启发是在这里。
👦🏻 Koji
你希望 OiiOii 未来成为一个什么样的产品?一直做一个工具,还是成为某种内容平台,甚至成为下一个皮克斯?
👩🏻 闹闹
我希望它在工具之上能有更多可能性,但我不想把未来说得那么死。我希望它至少能做到让每一个想做动画的人,都能用它做出来一部属于自己的动画。这个先达到了,我们再探索其他的可能性。
那些可能性在我脑海里有模糊的概念,但我不想说死,一旦说死,它就坍缩了。
🟢 预言 2026
👦🏻 Koji
你认为到 2026 年,AI 视频领域有哪些大概率会发生的变化?
👩🏻 闹闹
过去一两年的趋势很明显,比如质量会越来越好,可编辑性会越来越好。接下来,实时性可能会增强,从而带来一些互动性的东西。但我并不觉得那是一个巨大的革新,因为最终要看受众是否买单。
比如,编辑自由度越高,受众就越专业,用户群体反而在缩小。
互动性是一种主动行为,但我们现在已经被短视频规训成了被动接收信息。你只要让用户多一步操作,人群就会变得非常窄。
所以我的另一个判断是:我不设限。
你看 Sora 2,它只是做到了更自然的切镜,听起来不是什么巨大改动,但带来的效果就非常好。哪怕没有那么大的革新,它不是互动性的,也不是可编辑性的,它就是消费属性稍微自然一点,也能很好。所以也许很多判断中的巨大改革,并不会对真正的消费人群带来很大的改动,反而一些现有媒介基础上的小改动,会带来可能更大的受众。
👦🏻 Koji
你提到 OiiOii 会为不同镜头匹配不同模型,比如 Vidu、可灵,它们各自擅长什么?
👩🏻 闹闹
比如,动画里有打斗镜头,我们会调用"海螺",它在这方面比较好。
如果需要细腻的人物表情和情感,可能 Seede 的表现会更好。
如果想要那种 CG 特效大片的感觉,"可灵"会比较合适。
我们会根据镜头描述自动分配。
👦🏻 Koji
你认为这些视频模型的团队是在刻意追求自己的差异化吗?
👩🏻 闹闹
我觉得有先天和后天之分。
先天的,比如初始数据和标注标准不同,出来的东西就完全不一样。因为中间的工序会比较多,而人又对视觉的敏感度最高,所以它出来的东西不一样,你会马上感觉到。
后天的,可能和各家公司的战略有关。比如想做影视级大片,就会多训练这类素材,那自然在这方面就强。
但视频模型很难大一统。哪怕模型完全一样,调用的手法不同、喂进去的内容不同,出来的结果也完全不同。
举个我们之前调教 Sora 的例子:我们使用的是完全一样的 Sora 模型,但起初生成的场景一致性并不强。原因在于,我们在输入时只给了一个单独的小元素,没有给场景图。虽然对于模型来说底座没变,但输入端这仅仅一点点的改变导致输出的结果截然不同。更别说各个模型在最前端训练数据的维度上本身就不一样,这必然会导致不同模型之间的差异非常巨大。
👦🏻 Koji
用户在 OiiOii 里可以自己选模型吗?
👩🏻 闹闹
暂时没有,我们后面可能会做。
👦🏻 Koji你自己怎么判断 2026 年甚至更往后,这些视频模型厂商之间的竞争格局?
👩🏻 闹闹我觉得大家都会往两个方向走:一是加强自己非常擅长的部分,二是补足不太擅长的短板。
模型厂商肯定还是会追求更加通用。另外就是刚才提到的两个大方向:实时性和可编辑性,这两点可能会显著增强。
👦🏻 Koji好,最后一个问题。如果给你 300 万美金做天使投资,分成三份投给三个人——无论他还没开始创业、正在工作,还是已经创业了想追投——你会投给谁?
👩🏻 闹闹我第一反应想了很多人,但第二反应是:我还是想投给我自己。
这不是因为我觉得自己怎么样,而是站在第三者的角度,我最熟悉这个人。天使投资首先要投一个你对他非常 buy in 的人,而我对自己是最熟悉的那个。
🟢 用 10 个「我是 xxx」来造句
👦🏻 Koji
那我们最后来一个彩蛋环节。请闹闹用 10 个"我是什么什么"来造句,向大家介绍自己。
👩🏻 闹闹
好难。对我来说,这个问题特别难,因为我正在努力减少对"我是xxx"这件事的积累。我学习了一些佛法,知道"我是xxx"的叠加或加强会带来很多问题。比如,你给自己贴上"我是教授"的标签,就得去维护这个形象,会很用力。所以,在我现在的状态下,这很难。
👦🏻 Koji
非常深刻。所以你的第一个回答是"我是一个正在尽量减少'我是什么什么'的人"。
👩🏻 闹闹
对。
👦🏻 Koji那今天就可以豁免你,你不用说很多,觉得最重要的说完就好。
👩🏻 闹闹
我的第一印象是这个。然后第二印象,如果一定要说一个,我觉得我是一个"容器"。这和 OiiOii 有关。我感觉有一个"动画之神",它只是通过我这个容器来表达一些东西。它在这个时代想有更好的表现方式,不是"我"在表达,而是有某个东西想表达,而我这个容器恰好适合。
👦🏻 Koji
OiiOii 本身不做表达,而是帮助想表达的人更好地表达,它是一个容器?
👩🏻 闹闹
对,它是一个容器,我自己也是。这个灵感来自李安的一次采访,他说过,比他有才华的人多的是,他们之所以没能取得那样的成就,不是因为没才华,而是刚好"电影之神"选中了他,他成了一个容器,让电影通过他来表达。
某种情况下,我也有这种感受。我不是在表达什么,而是希望自己能变成一个通道,让大家去表达。
👦🏻 Koji
谢谢闹闹。希望过段时间我们能再聊一次,看看那时 OiiOii 这个容器里,又生长出了哪些新的故事。
👩🏻 闹闹
希望。谢谢。
