所以,发布「 7 x 24 」小时后,还有人在讨论李飞飞吗?
李飞飞的 World Labs,也许被误解了。
**
李飞飞的 World Labs,也许被误解了。
👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon
2025年,「世界模型」 已经成为 AI 领域中最「炙手可热」的词汇,而在这一领域,很少有名字能像 李飞飞这样具有「穿透力」。
作为斯坦福大学的教授,计算机视觉领域的开创者,李飞飞主导的 ImageNet 项目曾一举开创了深度学习的新时代,也因此赢得了「AI 教母」的称号。
她不仅在学术界取得了巨大的成就,随后又选择再次出发,创办了自己的 AI 公司 World Labs。
过去的一年里,整个行业都在等待 World Labs 的答案。
2025 年 11 月 13 日,Marble —— World Labs的首款产品正式发布。

本该是一次单纯的技术发布,但在随后的**「7 ✖️ 24 小时」里**却充满了预想不到的波澜。从产品刚发布时的刷屏轰动,到紧随其后的质疑与反思,再到 OpenAI、谷歌、腾讯等大厂的产品路线被拿来与 World Labs 做对比。
整个事件迅速演变成了一场关于 AGI 未来发展方向的辩论。
这一切,都始于 **「7 ✖️ 24 小时」**前。
「7 ✖️ 24 小时」前的轰动
World Labs 的首款商业产品 Marble 发布后,迅速成为虚拟创作领域的焦点,吸引了全行业的关注。
简单来说,Marble 是一款创新工具,允许用户通过文本、图片、视频和 3D 布局等方式,创造出可下载、可编辑、可交互的3D虚拟世界。

无论是游戏、虚拟现实(VR)、电影特效(VFX)还是其他创意产业,Marble 都为创作者提供了全新的可能性。使用这款工具,用户不仅可以构建虚拟环境,还能够与这些环境进行互动,提升了创作自由度。
这款产品的核心理念是「空间智能」。这不仅仅是 AI 在语言或图像上的应用,它引入了一个更具突破性的概念:「感知—生成—交互」的三维空间。
简单来说,Marble 使得 AI 不仅可以理解和生成平面信息,还能在三维空间中感知并创造出互动体验,像一个虚拟世界建造者,给用户带来全新的沉浸感。
比如,我上传了一张 AI Hacker House 的平面二维概念图:

Marble 所做出的世界确实能够利用上传图片中「尽可能多的元素和风格」,复刻「世界」。
不过,也同样能看出来,Marble 这款产品仍然处于较为初级的阶段,混乱和模糊的场景几乎很难避免:

与传统的生成工具不同,Marble 提供了多层次的编辑功能。
用户可以通过自然语言指令进行微调,例如移除场景中的某个物体,或者进行全局修改,直接将场景从现代风格转换为复古风格,甚至改变墙体结构。
这样一来,创作者可以对生成结果进行更精确的控制。
为了帮助用户构建更大规模的虚拟世界,Marble 提供了 扩展(Expand) 和 组合(Combine) 功能。前者让 AI 自动扩展现有场景的边界,后者则允许用户将多个独立生成的 3D 世界拼接成一个宏大的复杂场景。
创作完成后,用户可以将内容导出为多种格式,以适应现有的工作流,包括高保真视觉展示的高斯泼溅(Gaussian Splats) 格式,以及可以直接导入 Unity、Unreal Engine 和 Blender 等主流软件的 三角网格(Mesh) 格式。

Marble 提供了商业化的定价方案,从免费版本(生成少量 3D 世界)到月费计划(20 美元、35 美元、95 美元),希望在各个层级上满足不同用户的需求。

该产品的发布在短短时间内获得了近 3000 次点赞和 180 万次浏览,受到了海量关注。

TechCrunch、Fast Company 和 The Verge 等知名媒体对 Marble 的发布进行了报道,让它瞬间成为 「世界模型」 领域的焦点,成为这一新技术的「顶流」产品。
风头过后,人们在说什么?
然而,**「7 ✖️ 24 小时」**过去,当我们在各大技术社区和社交平台浏览时,可以明显发现风向变了:大家似乎对于这款世界模型产品「并不买账了」。
最初的兴奋褪去后,质疑声开始浮现了。
例如:
「所以世界模型到底有什么用?」
「我昨晚就丢进去 10 张小区图,睡前都没生成好。」

也有人从技术角度提出看法:
「试了,感觉就是一个分层的高斯溅射。」
「觉得只是 Diffusion + SfM + Gaussian Splatting。」

甚至还出现了这样的评论:
吴恩达、李飞飞、Yann LeCun 几乎只停留在学术界,在工业界基本没有什么建树。
一开始,World Labs 的发布确实掀起了不小的波澜,吸引了大量的开发者和技术爱好者关注。但随着时间的推移,讨论的声音似乎逐渐消退,取而代之的是对该模型的冷静反思与质疑。
这种落差是客观存在的。
在 X 和 Reddit 等社区,关于 World Labs 的讨论热度迅速冷却。对于一款备受瞩目的产品,这种「高开低走」的舆论曲线,迫使我们去思考:
李飞飞到底想做一个什么产品?
世界模型的焦虑
Marble 的诞生,其实在讲述一个更大的故事,那就是李飞飞团队一直强调的:「空间智能」
在产品发布前三天,李飞飞在 11 月 10 日发布的新文章《从文字到世界:空间智能是 AI 的下一个前沿[1]》中,详细阐述了团队开发这款产品背后的动机,也再次表达了她对目前主流大语言模型(LLM)的「焦虑」。

李飞飞认为,尽管目前的大语言模型(LLM)在处理文本、编写代码和生成图片方面表现出色,但它们存在一个明显的短板:
缺乏对物理世界的真实理解。
现有的 AI 模型虽然拥有海量的知识,但它们在处理空间关系时经常出错。例如,在估算距离、判断方向、或者想象一个物体旋转后的样子时,这些顶尖模型的表现往往并不比随机猜测好多少。
在生成视频时,AI 也经常无法维持画面的连贯性,因为它们并不理解画面背后应该存在一个持续的、符合物理规律的三维世界。
简单来说,现在的 AI 擅长处理抽象符号,但无法理解物理现实。这限制了 AI 在机器人等大量领域的应用。
针对这种「焦虑」,李飞飞提出了**「空间智能」**的概念。
为了让 AI 具备这种能力,于是 World Labs 开始构建「世界模型」,构建空间智能,这也直接解释了 Marble 为什么要设计成现在的样子。
World Labs 并不孤单
不过,**「世界模型」也不是一条孤独的赛道,「世界模型焦虑」**也并非 World Labs 独有。
World Labs 虽然发布了 Marble,但它正处于一个竞争激烈的赛道之中,OpenAI、Meta、NVIDIA、谷歌和腾讯等科技巨头都在向同一个方向冲刺。
我们做了一番整理。
2025 年 8 月,谷歌 DeepMind 发布了 Genie 3,并将其明确定位为「通用目的世界模型」。与以往的模型不同,Genie 3 强调 「实时交互」。
过去的模型通常只生成静态视频,但 Genie 3 允许用户进入场景并与之互动。它支持生成 720p 分辨率、24fps 帧率的实时画面,用户可以自由导航,比如以第一人称视角驾驶或探索复杂的地形。

DeepMind 甚至为此组建了专门的「世界建模」团队,致力于让模型能够感知物理环境,模拟水流、光照等变化。
用户不仅能在场景中走动,还能通过文字指令实时改变环境,比如改变天气或加入新角色。Genie 3 这种基于物理规律的虚拟环境构建,也被 DeepMind 视为未来训练机器人和游戏智能体的重要基础。
同样,腾讯 在 2025 年 9 月发布了 HunyuanWorld-Voyager,这是 Hunyuan World 1.0 的升级版,并迅速将其开源。

Voyager 最大的特点是,它能够从单张静态图像出发,结合用户自定义的摄像机路径,生成具有深度信息的 3D 点云序列。这不仅仅是简单的平面视频,而是具备空间几何结构的场景。
腾讯还强调了 **「长程世界探索」**的能力,即在长时间或长距离的摄像机移动过程中,场景的几何结构仍能保持稳定,避免变形。


此外,有意思的是,OpenAI 前段时间发布的爆火网络的视频模型 Sora 2,反而在真实场景中「表现更加惊艳」。
尽管在技术定义上,Marble 和 Genie 3 这种能让用户在其中「走动」的 3D 模型似乎更符合「世界模型」的直观定义,但在大众认知和网络声量上,OpenAI 的 Sora 2 却明显在物理真实效果的呈现上,「更获好评」。
OpenAI 官方也不再只将 Sora 视为视频生成工具,而是强调其具备更强的「世界模拟能力」。
比如,Sora 2 可以模拟篮球击中篮板后的真实反弹轨迹,试图还原物理世界中出现的偏差,而不仅仅是生成完美的成功画面。

Sora 2 作为通用音视频生成系统,它能以高度逼真度创作复杂的背景音景、人声及音效。
而且,它支持多模态同步生成,画面、对话和音效对齐。
此外,像是 Meta、NVIDIA 等科技巨头,都已经推出了各自的「世界模型」。
这就让 World Labs 面临着一个尴尬的局面:它在做「可能正确的事」(构建 3D 世界),但其他大厂们在用另一种方式,似乎更快地赢得了用户的相信和点赞。
「7 ✖️ 24 小时」后,李飞飞依然「热」
现在,让我们回到最初的那个问题:
发布「7 ✖️ 24 小时」后,还有人在讨论李飞飞吗?
答案是:有。
但大家讨论的重点,可能已经不是 Marble 这款产品本身的热度了。
我们必须承认一个事实:一个新产品的短期热度,在今天这个信息快速流动的时代,可能真的只能维持很短的时间。技术迭代太快了,总是有更新的技术、更酷的产品会冒出来,取代上一个。
那些关于「生成太慢」、「这就是高斯溅射」的吐槽和评论,其实都只是针对 Marble 这款 1.0 版本产品的。
技术总会被更新的技术所取代。
Marble 只是 WorldLabs 拿出的第一个产品,它可能不完美,甚至在技术上被认为是「缝合怪」的质疑。但它做了一件很重要的事:它把「世界模型」这个过去还主要停留在学术层面的概念,带到了所有开发者和用户面前。
「世界模型」这个概念本身,仍然在牢牢地吸引着整个行业的注意力。
所以,我们讨论的重点,不应该是 Marble 今天有多少人下载,或者它是不是在效果上只停留于高斯溅射 Level。
真正值得我们持续讨论的,是它所代表的那个「世界模型」的终极目标。
为什么这个词这么重要?
因为它触及了 AI 领域最核心、最根本的路线之争:通往 AGI(通用人工智能)的路,到底该怎么走?
这场争论的核心就一个问题:我们是该让 AI 用语言「读懂」世界,还是让 AI 真正「看懂」世界?
第一条路:靠海量数据(Scaling)。
这是目前最火的路线,以 OpenAI 等大语言模型 AI 厂商为代表。他们相信,只要我们用足够多的数据(全人类的文本、图片、视频)去训练一个足够大的模型,智能就会「涌现」出来。
Sora 2 的出现,似乎就证明了这条路,它好像自己「领悟」了一些物理规则。
第二条路:靠世界模型(World Models)。
这是以 Yann LeCun、李飞飞、Yoshua Bengio 为代表的「学院派」路线。他们相信,真正的智能不可能「凭空」从数据里读出来,必须通过与世界互动来学习。

深度学习的另一位「元老」、图灵奖得主 Yoshua Bengio 也曾在访谈中提及他对「世界模型」的看法:
构建世界模型,是扩展 LLM 的一个方向,需要用「世界模型 + 推理 + 因果」来补上现在大模型只擅长统计关联的那部分短板。
NVIDIA CEO 黄仁勋,这位工业界代表,也曾在 CES 行业大会上提到:下一代 AI 将走向「Physical AI」,即机器不仅做语言与文本,而是「感知、理解、操作真实世界」的能力。
NVIDIA 也已推出名为 「Cosmos」 的「世界级基础模型」平台,训练于海量视频以支持机器人/工业场景。

他们认为,AI 必须在「心智」里建立一个关于世界如何运转的「模拟器」。它得懂物理(比如苹果会掉下来)、懂因果(比如推了杯子,杯子会倒)。
Runway 联合创始人 & CEO Cristóbal Valenzuela,也已经在公开谈论「下一步就是 World Models」。
他的表述更直接:
世界模型就是「下一代 AI 的前沿」。它们不会像传统 LLM 一样停在「预测下一个 token」,而是要去理解物理世界,用在影视、游戏中更真实的动态场景模拟。
如果 AI 没有「身体」或没有「感知」,它永远无法真正理解我们的世界。
只不过,这条路走起来,远比想象难。不断抨击 LLM 的 Yann LeCun 正在离开 Meta,而建立了 ImageNet 的李飞飞也因为 World Labs 的进展速度引发了一些争议。
不过,李飞飞的 Marble,仍然可以看过是「第二条路」的一次重要实践。
它试图通过让 AI 「生成」一个可交互的3D世界,来倒逼 AI 去理解这个世界。
这也解释了为什么 WorldLabs 还要做那些看起来更超前的事:
【1】他们发布的「生成更大、更好世界」的技术更新,是为了为了解决「世界模型」的规模问题。
【2】他们透露的 RTFM(实时帧模型),又是为了解决「世界模型」的交互和实时性问题。

这几个东西组合起来,才是李飞飞团队对「世界模型」的完整构想,他们坚定地站在了「AI 必须通过互动理解世界」的这边。
所以,「7 ✖️ 24 小时」后,我们不必再只纠结于 Marble 这款产品的得失。
李飞飞和 WorldLabs 用一个产品,把所有人都拉到了这个最根本的岔路口上,把大家的目光都聚焦到了这个方向上。
通往 AGI 的未来,到底是靠 Scaling Law,还是靠与世界的真实互动?
Marble 的热度可能会过去,但这场关于 **「世界模型」**的辩论,才刚刚开始。无论是赞同者还是质疑者,都无法回避它的重要性。
Marble 可能只是 World Labs 的起点,但它所代表的理念,已经紧紧抓住了整个 AI 领域的注意力。
所以,接下来的 「7 ✖️ 24 小时」,才是 AI 领域的主题,才是我们真正要关注的时刻。


参考资料
[1] 从文字到世界:空间智能是 AI 的下一个前沿: https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence