在花花世界和孤注一掷之间,纳米AI的选择是……
弃“万能”取“专精”
弃“万能”取“专精”
👦🏻 作者: 镜山、小居
🥷 编辑: Koji
🧑🎨 排版: NCon

通用 AI Agent 可以做所有的事,但这也带来了问题:用户常常记不住什么时候该用它们。
头部产品们都在各自想办法:
Manus 推出 Playbook,将常用场景做成模板,撬动社区力量不断输出新模板。

Genspark 将 Slides、Sheets、Docs、Pods…,当成一个一个的独立产品推出,强化各个场景的独立心智。

纳米 AI 也做出了一次清晰的选择:专注一个具体场景,把“用 AI 做视频”这件事,做到极致。
8 月 6 日,周鸿祎在北京发布了纳米 AI 的重大升级版本:「纳米 AI 多智能体蜂群」。全场只强调一件事:用一句话生成完整视频。
纳米 AI 把所有资源押在这个单点上,不再强调纳米的 Agent "什么都能做",而是专注于一件事——让不会剪辑、不会写剧本的普通用户,也能一键做出高质量视频。
这是一场明确的战略收敛:
- 弃"万能"取"专精"
- 用实际产品重塑用户心智:"做 AI 视频,就用纳米"
Koji(左一) 受邀参与了这场持续了 150 分钟的发布会
🚥
发布会全场,老周多次提及:「一句话输入、一句话生成、一句话能用」。
开场,纳米就播放了由其 AI 一气呵成自动生成的 10 分钟长视频,展示了其 Agent 的能力:
紧接着,发布会的前半小时,都一直在播放各种纳米 AI 生成的视频,尝试用视频的效果来直接展示能力。
这一次,纳米 AI 多智能体蜂群提出了一个新概念、选择了一个更加底层的路线 —— 串通 Agent Infra,也做了不少创新性的工作。
接下来,我们将分享对这款产品的深度测评。
如何让 Agent 生成「教父 4」?
传统 AI Agent 的答案是:人力整合各种工具。
现在的答案是:1 句话。
每一个 AI 工具新上线时,都会选择一个具体场景来演示它们自己的能力。这回纳米 AI 的「主战场」是「一句话生成完整视频」。在蜂群框架下,纳米 AI 用的是 A2A 协议、蜂群式调度中心、蜂群式协作机制等等,最后的结果是:多智能体蜂群达到了很不错的成功率。
当我一开始试用这个工具时,我一直想知道它说的「完整」到底有多完整?毕竟 Veo3、Runway Gen-3 这些视频生成模型在画面效果上都已经很不错了。
我简单总结了下纳米 AI 所呈现的差异化点,它把这些功能全部整合在一起:收集资料、写剧本、选风格、调比例、配音色、写文案、配声音、画图片、配背景音乐、对嘴形、拍摄角度、生成视频等等。
话不多说,先看我们制作的这部 4 分 13 秒的黑白版《教父 4》的效果。
我输入的指令很简单:
做一个黑白电影视频,主角的马龙白兰度所扮演的教父,写一个「教父4」电影
纳米 AI 链接:https://bot.n.cn/share/mcp?id=og6lsz&from=pc&src=360_llq
整个电影级别 AI 视频的各个画面以及连续场景的一致性都非常高,尤其是其中的分镜搭配上BMG、旁白以及设计好的故事场景。
说句实话,有没有一那么瞬间,你没意识到这是 AI 视频?
我从视频中截取了几个片段,你可以直观看到这个「完整性」到底怎么样。在教父葬礼场景中,纳米AI选择了镜头拉远的拍摄方式;关于教父生命中最后抉择的段落,则搭配了一段有细节的思考场景。

对着镜头的自述部分处理得很自然:

还有维托远方亲戚寄来信件的情节,仔细看这个转场效果,以及画面移到信封时的镜头拉近动作。
从人物特写到信封的镜头拉近,这个转场自然流畅,很符合电影语言:

当这段完整视频生成后,我发现纳米AI已经连续进行了上百个步骤的思考、执行、整合工作。
我大概数了下,一段4分钟的视频背后需要约200个步骤,消耗了11,332,835个tokens。这一千多万个token的信息整合量确实挺惊人。

接下来我们深度拆解下纳米 AI 背后的工作原理。
传统 AI 视频生成模型往往只能做到「单个镜头、单一风格」,离「完整」这个词还差得远。想做出有起承转合、有节奏、有剧情发展的「完整视频」,往往还需要用户自己拼接镜头、构思剧本、合成配音,再加上音乐和剪辑调色。整个流程复杂,门槛不低。
所以,首先就是,纳米 AI 提供了很多 L3 级别 Agent ,这些 Agent 有的是网上现成的,但真正能用好用的基本都是纳米 AI 这个框架本身自训练的。
这回的纳米 AI 多智能体蜂群(我的理解是,它能够调用大量 Agent 同时作业),指的是 L4 级别 Agent,比如说「一句话生成大片」:

一般来说,纳米AI执行任务的起点是DeepResearch(深度研究),这也是我们之前测试纳米AI时的基础功能。因为它会大量补充信息来源,所以我完全不需要「好的提示词」,只给它短短一句就可以。

纳米 AI 接收到提示词之后,会开始启动第一个 Agent —— 「全能编剧大师」,然后依据这个 Agent 的搜索能力进行深度搜索,并依靠这些信息迅速的模拟出一段视频文案、BGM:

在经过几十步的思考、细化之后,由大量其他分属各个垂直任务领域的 Agent 开始工作。
像是:
【1】分镜 Agent 做视频分镜脚本(47 个分镜);
【2】配音 Agent 用 MiniMax MCP 做几十个分镜的配音;
【3】纳米 AI 生图 Agent 依据提示词为每个场景都生成图片;
【4】摄像 Agent 根据图片生成几十个视频;
【5】调集剪辑 Agent 为视频配音。
其中,脚本是核心。
不得不说,这个视频分镜脚本:《教父4:命运的回响》写得确实好。
比如,纳米 AI 选择直接从「教父葬礼后揭开的秘密」切入,来引发观众的好奇心。**而且,结构很紧凑,信息递进。**每一页都在推进情节,不存在无效画面。

我个人觉得最惊艳也是最值得关注的就是:整个过程中的许多步骤,纳米 AI 是同步进行的,并没有死板地一步步来;智能助手蜂群中的每个 Agent 执行任务期间,都间隔着几十个「大模型思考步骤」。
光用语言形容确实有些苍白,我录制了一个 GIF,会更直观一点:

整个流程里,上百个步骤不间断执行,但最后的成功率仍然很高,并且没有出现大规模的「AI 幻觉叠加」的情况,这确实很令人惊喜。
这回的这个「Agent 蜂群」给我的感觉非常像是在雇佣一个具有专业性、懂得高效协作的团队,它们之间配合的很丝滑。
由于纳米 AI 做「完整视频任务」的能力,确实有趣,「十字路口」团队的其他成员也都各自高频率地试玩了下。
为哆啦A梦续写一集
我们还是选择「一句话生成大片」这个智能体蜂群,输入下面这句提示词,就这几个即可:
为哆啦A梦续写一集
这里的脚本构成就比较特殊,纳米 AI 将其分为了视频台词和生图提示词两部分,前者跟「超级配音演员 Agent」合作便于后续配音,后者则将指令输入「智能绘图专家 Agent」,保证图片生成的一致性。
每一句视频台词所对应的生图都已经确认好了:

下面这段分镜,大家可以自行感受一下。整体效果确实不错,人物角色的前后一致性很强,故事情节也很贴合原著的人设。

整段视频 41 秒,用了 1530 万个 token。
纳米 AI 链接:https://bot.n.cn/share/mcp?id=x1dpfr&src=nm_share_agent_chat
特朗普爱上在白宫做保洁的我
我们再来看看最近网传利润极高,爆火全球的短剧「特朗普爱上在白宫做保洁的我」。
给它一段很详尽的提示词:
特朗普爱上保洁的我 在金碧辉煌的白宫大厅里,一个普通的年轻女性保洁员正在认真擦拭大理石地板。突然,特朗普迈着夸张而自信的步伐走进来,正准备发表一场豪言壮语,却在看到保洁员的那一刻愣住了。他缓缓走上前,笨拙却绅士地递出一条丝绸手帕。两人的目光在灯光下交汇,时间像被按下了慢放键。随后,特朗普带着保洁员参观白宫的长廊和花园,夕阳下的玫瑰与金发交织成一幕奇妙的浪漫。夜晚,他们一同在烟花下仰望天空,特朗普试探性地伸出手,而保洁员羞涩一笑,轻轻牵住了他。最终,在夜色与烟花交织的背景下,两人的背影逐渐消失在白宫花园的小径上。 画面风格 美国漫画风格: 背景:白宫大厅金碧辉煌,长廊庄严宏伟,花园夕阳温暖梦幻,夜空烟花璀璨。 角色形象:特朗普金发、穿西装、表情夸张;保洁员年轻朴素、制服整洁,带一点羞涩笑容。 镜头表现:远景、近景、特写、仰拍、俯拍、主观镜头穿插,灯光柔和、构图富有戏剧感。 配音建议 旁白:由一位幽默又温情的成年男声讲述,语气中带点调侃和意外的浪漫感。 特朗普声音:自信、略夸张的美式男声,偶尔带一点滑稽的停顿。 保洁员声音:自然、真诚、略带惊讶的年轻女人语气。 背景音乐 轻快的弦乐与钢琴交织,随着剧情从轻松幽默转为温暖浪漫,结尾叠加轻柔的竖琴声,营造童话般的收尾氛围。
这段视频真的很 Drama:
纳米 AI 链接:https://www.n.cn/share/mcp?id=hxv86i&from=pc&src=360_llq
尤其是下面这两个分镜,至此艺术大成:


AI 不仅掌握了这种短剧的叙事节奏,还在细节上做出了比较有创意的处理。几个关键分镜头的设计,都有点意思。
Agent 蜂群工厂
除了以上这些已经被「封装」好的 Agent 蜂群之外,纳米 AI 为了应对复杂任务,还擅长拉群组队协作。在下面这个「创建智能体」界面里,我们可以通过拖拽节点搭建 Agent 蜂群工作流。 整个流程大家肯定都相当熟悉了。

入口在右上角「创建智能体」

选择「创建多智能体蜂群」
不过,也有一些不同点。
传统 AI 工作流平台,部分节点仍然需要低代码,尤其是关键节点,但是纳米 AI 里的所有节点都被设计成了 Agent(也就是大模型节点)。
比如,我们设计了一个「十字路口 AI 数字人讲解员」的 Agent 蜂群。
里面的所有节点都是可以在纳米 AI 内部提供的选项里找到的 L3 级别 Agent,每一个 L3 Agent 基本都已经提前设置好提示词了,所以我基本上只做了个「工作流构思」和「拉线」的简单操作。
像是「抖音热榜追踪员」就是一个纳米 AI 设定为 L3 级别的 Agent,它的系统提示词已经非常完整了,也无须再改动,MCP 工具的设置也已经完成:

这个工作流的逻辑大概是这样:
【1】用户输入想要研究 AI 领域的提示词和图片,Agent 提取关键词;
【2】六大 Agent 对应去各类平台查信息;
【3】所有信息进行整合、编剧、配音、数字人创作;
【4】生成视频。
其中最关键的一个中间节点是:自媒体内容质量分析师,它的作用是整合所有信息。
就像下图演示的这样,如果把各个节点的「工作流线条」拉上,它会自动感知输入,而不会像传统工作流平台那样,再去手动选。所有节点中没有一个需要输入代码的,只需要给 AI 输入提示词就行:

整个工作流的全览图就像下面这样,属于比较简单的类型,我们在尝试过后,发现它所包含的可能性很多,大家可以多去试试:

工作流设置好后,我随便截了一张 Koji 的图片,以及一句简短的提示词,告诉它帮我研究「AI 硬件」:

然后,这个 Agent 蜂群就开始利用各种信息查询 Agent 去各个平台搜集内容:

通过一系列纳米 AI 的视频类 Agent 整合过后,一个很有商业感的数字人推销视频就出来了,它研究的 AI 硬件是:AI 加速卡。
视频效果如下:
纳米 AI 链接:https://bot.n.cn/share/mcp?id=3j116n&from=pc&src=360_llq
很明显,整体的文案、数字人(面部表情、肢体动作、嘴形)的效果完成度都比较高。
可以说,纳米 AI 多智能体蜂群很适合这样的「短视频自媒体工作流」。
实测下来,我们发现纳米 AI 在经过上百步的运行之后,成功率依然很高。这背后其实是一个简单的数学概率题,如果单个 Agent 的成功率如果能够在 90%,单任务需要超过 100 步,Agent 在执行五步后,成功率就会就只剩下 59%,100 步后就剩百万分之二。
在多步骤工作流里,错误率是在以指数方式复合叠加的。
所以,如果想要达到 95% 的任务成功率,每一步至少要做到 99% 的完成度,这也是纳米 AI 给出多智能体蜂群的自信所在。
现在,我们稍微总结下纳米 AI 的技术能力:
在蜂群框架下,纳米 AI 通过 A2A 沟通协议、蜂群式调度中心、蜂群式协作机制等, L4 多智能体蜂群达到了非常亮眼的性能指标:
【1】连续执行 1000 步任务
【2】Token 消耗:500 万-3000 万
【3】任务成功率:95.4%
在现场的发布会中,我们频繁听到老周提到一个关键词:用户的想象力。
从"教父4"到"哆啦A梦",从短剧再到 AI 讲解员,每一个案例都不是技术炫技,而是一次次试图去回答一个问题:
如果有一群 Agents 懂得协作,能不能帮一个普通人,把脑中的灵感直接变成现实?
我们相信:AI 的价值不是在于取代人,而是在表达的门槛不断被降低之后,每个人都能拥有自己的"创作权":
"我有一个故事"——AI 能帮我讲出来。
这一次,纳米 AI 押注视频,押注创作场景,押注用户真实的表达欲。也许并不是所有技术都要做得最全,但总要有人在某个方向上,做得最深、最稳、最通透。

