WAIC 观察:风浪凶猛的空间智能,所有人都在找同一样东西

有一种 AI,能保存爱。

有一种 AI,能保存爱。

👦🏻 作者: 镜山

🥷 编辑: Koji

🧑‍🎨 排版: NCon

🚦

「科技的温度,藏在每一个被改变的平凡故事里。」

我一直乐观地相信科技和 AI 能帮助人们过上更好的生活。

因此,我持续在关注并收集科技如何帮人们提高了效率、解决了麻烦、创造了希望和爱、带去了新生的故事。最近,我们决定在「十字路口」分享这些故事。

这些故事蕴含着力量和乐观情绪,它们不仅展现了技术突破和创业机遇更不断提醒我们:即使身处充满不确定性的时代,希望与光明依然存在。

在今年 WAIC,我们发现了一个温暖的故事:「一家 60 多年的老照相馆,和一位 70 多岁的老摄影师」。

「老爷爷的照相馆,又开张了」

传统意义上,空间只是我们生活的物理场所。但现在,空间被重新定义了——它变成了承载记忆的数字容器,装着个人的情感,也装着集体的记忆

杭州三墩镇陈家桥南街有一家老照相馆,门口总有年轻人在拍照打卡。店里的墙上贴满了发黄的老照片,就像一本翻不完的相册。每天下午,七十多岁的周泉虎爷爷会慢慢踱步到店里那张陪伴了他几十年的老椅子上,阳光透过玻璃洒在他身上,他一边喝着茶一边整理那些珍贵的老底片。

他说话总是慢悠悠的:

这些照片啊,记录着三代人的笑容,从爷爷奶奶年轻时的青涩,到爸爸妈妈的甜蜜,再到现在小朋友们的天真。

但最近几个月,周爷爷的作息变了,他患上了肺病,不太能常去照相馆。周爷爷常说,照相馆是许多人寻找美好回忆的地方,他不肯轻易将它关掉。于是,他决定给自己办一场**「生前告别会」**,就在这个装满回忆的小店里。

相机能记录下那一个瞬间的时空,却似乎没人能记录下这个照相馆。 这是周爷爷唯一遗憾的事情,从 25 岁做学徒开始,这座照相馆在时光里已经缓缓运行几十年了。

就在这时候,一个叫阿航的工程师听说了周爷爷的故事。

阿航在一家做空间智能的公司群核科技上班,远在杭州另一头的他匆匆跑来,他体会到了这家照相馆的光与影,知道这里的每一张照片都是一份温暖时光里的记忆片段。

他用公司正在研究的「3D高斯技术」(一种能把真实空间完整复制到电脑里的 AI 技术),为这家老照相馆做了一个「数字版备份」。

周爷爷的数字照相馆:https://www.kujiale.com/pub/koolab/koorender/gifts

3D高斯技术生成 简单说,就是让这个店在赛博世界也被复刻一份,人们以后还能在电脑里「走进」这家店,看到那些老照片,感受当年的温暖。这不只是保存一家小店这么简单,更像是在为一个社区的温暖记忆建造一座永恒的家。

这里也饱含着网友们的殷殷期待:「当然存在啊,而且我相信它会一直传承下去」

周爷爷的「数字版照相馆」

当周爷爷平静地说「要么你把别人忘了,要么你被别人遗忘」时,AI 工程师用科技写下了第三种可能:

让美的东西永远不会真正消失。

我想,技术最美好的意义就是为爱服务。

除了作怀旧用途,3D 高斯还代表着一种「把现实世界 1:1 复制到数字世界里」的技术愿景

当你「走进」这个数字版的照相馆时,会发现一切都和真实的一模一样:你能看到墙上每张照片的细节,感受到阳光透过玻璃洒进来的温暖

这就像在物理世界和数字世界之间架起了一座桥梁。

这座桥有一个名字:

🚦

空间智能

它让机器不仅能「看见」世界,更能「理解」空间,懂得每个角落里藏着的故事和情感

什么是空间智能?

简单来说,「空间智能」就是让 AI 和机器人像人一样理解和操作我们生活的 3D 世界

我用一个现实中的小例子打个比方。

许多朋友家里都有扫地机器人,它们不像人一样闭着眼睛都知道自己的床在哪里,知道绕过桌子角不会撞到腿。这些对人类来说再自然不过的能力,对这些机器人来说挑战性却非常大。

它们往往在厕所碰到了宠物 🐈‍⬛ 的臭臭后,毫无察觉,并拖带着它们遛遍整个屋子……

机器人看得见障碍物,却理解不了这些物体的含义和相互关系。它不知道什么能碰,什么不能碰,什么是危险的,什么是珍贵的。

而空间智能则是让它们真正学会在 3D 世界里「生活」,就像教会一个孩子认识世界一样,让 AI 不仅能看到桌子、椅子、墙壁,更要理解它们的用途、相互位置关系,以及如何安全、优雅地与它们互动。

「风大、浪大、鱼大」的空间智能行业

有些公司在追求空间智能的前沿突破,也有些公司在默默搭建这个领域的基础设施。

在「AI 从数字世界走向物理世界 」这个历史节点上,每家公司都在写下独属于自己的注脚,也都坚信着一个朴素的商业道理:「风浪越大,鱼越贵」。

越是充满挑战的新兴市场,越有可能诞生千亿的价值。

1)谁都有可能在浪尖收获「大鱼」

空间智能

著名 AI 专家、斯坦福教授、AI 教母 —— 拥有如此多 Title 的李飞飞,在去年多加了一个 Title —— WorldLabs 创始人。从超过 8 万次引用的 ImageNet 研究开始,她一直执着于让机器系统「看到」和「理解」现实世界。

李飞飞创立的 WorldLabs 一出现就成了最受关注的 AI 空间智能项目,她有句话说得很直接:「空间智能将是 AI 的下一个前沿。」

这家初创企业的目标是:打造能感知、生成并交互三维世界的 Large World Models(LWMs)

他们已经于去年底放出了一个从单张图片生成 3D 世界的 AI 系统早期成果

短短几个月内,WorldLabs 已完成约 2.3 亿美元融资,估值逾 10 亿美元,领投方包括 Radical Ventures、a16z、NEA、NVIDIA 风投,甚至 Google 的 AI 宗师级人物 Jeff Dean 和新晋 2024 年诺贝尔物理学奖、 2018 年图灵奖得主 Geoffrey Hinton 也表达了支持。

那么,为什么空间智能如此引人关注?无论是学界还是业界?

原因很简单:谁先掌握了空间智能,谁就可能占领下一代 AI 应用的制高点,空间智能能撬动的场景实在太多了。

李飞飞也曾谈到空间智能的应用前景:

正如文字语言改变了人类交流方式,空间语言将改变 AI 与物理世界的交互方式。从内容设计、建筑、工业、艺术、游戏到元宇宙,一切都可能被改革。我相信,硬件和软件的融合即将到来,那是非常有潜力的应用场景。

但这还只是冰山一角。

在具身智能领域,空间智能更是核心中的核心。有了它,机器人才能真正「看懂」世界,知道如何在现实环境中创造生产力。

具身智能

空间智能是具身智能的基础,没有空间理解,就无法在物理世界中操作。人形机器人则是具身智能的实现载体。

可以这么理解它们的关系:空间智能让机器人知道桌子有多高,知道怎么绕过障碍物,知道从不同角度看同一个物体会是什么样子。

有了这些「常识」,机器人才能像人一样在真实世界里自如行动。

相比于空间智能这个相对集中的赛道,具身智能领域的初创企业可以说是「百花齐放」,显得更有「活力」

国内外涌现出许多耳熟能详的玩家,每家都有自己的独特路线和应用场景。

「十字路口」前不久盘点过国内具身智能的头部玩家:《 被朱啸虎"当头一棒"之后,我们盘点了 10 家头部人形机器人公司的生存实况 》。

当然,除了这些我们已经盘点到的企业之外,还有更多「生机勃勃」的企业等待着我们去发掘。

这几天,说起具身智能最出圈、最有热度的事件,自然是 Elon Musk 的 Tesla 首家餐厅开业, Optimus 机器人「出摊卖爆米花」。

它那双灵活的手能卖爆米花、能精准操作,背后正是空间智能技术的体现。

世界模型

在具身智能的实际应用中,我们可以打个「不那么恰当」的比方:空间智能和世界模型就像左右手一样配合。

空间智能负责回答「我在哪里,周围有什么障碍」,世界模型则预测「如果我这样做,会带来什么后果」。

当你准备从椅子上站起来时,你的大脑会自动预演这个动作:脚要怎么摆放,身体重心如何移动,手要不要扶桌子。这种「预演」能力就是世界模型的作用。

两者结合,AI 就能像人一样在 3D 世界中自主行动了。

这也是为什么顶尖研究者如李飞飞、深度学习三巨头之一的 Yann LeCun 都认为:仅仅依靠语言文字无法构建真正的智能,一种同时超越平面与语言的模型,真正地捕捉三维结构,理解空间智能的模型 —— 世界模型才是下一代 AI 的核心发展方向。

「理解 3D 世界、生成 3D 世界、学会在 3D 世界中推理和行动,是 AI 的根本命题。」—— 李飞飞

就在上个月,世界模型的「最后一个支持者」Yann Lecun 发布了世界模型的新进展 —— PEVA 模型,让具身智能学会了人类一样的「预判能力」,虽然仅仅实现了 16 秒连贯场景预测

2)「风浪」很大,很凶猛

空间智能行业谁都有可能在浪尖收获大鱼,但是,「风浪」有多大,是否能顶住则考验每个人、每个初创企业的定力。

这是一场万人马拉松,大家甚至连开始的哨声都没等到就开始跑了,却也迎面撞上了一些障碍。

空间智能所需的数据在哪呢?

即便是李飞飞这样的顶级科学家创办的 WorldLabs,而且其在商业上已经获得了初步成功,身边还有一帮「可能是这个世界最好的学者」,但拿出来的成果依然会被一些关注者「挑刺」:

说白了,我们现在能看到的,也就是一个看起来像「3D 游戏」的东西

简单点说,当大家经历了过去几年大语言模型的「横冲直撞」后,对 3 维 AI 研究成果的缓慢有点儿「不满」了。

这其实也是空间智能背后最大的问题:3 维空间数据难以获取。

李飞飞曾在各种访谈中反复谈及同一个问题:

空间智能这个领域最大的难题之一是:网络上有大量的语言数据——但空间智能所需的数据在哪里呢?

机器人的「笨拙」让人意外

从理论回到现实,看一看缺少 3 维数据后,具身智能机器人身上正面临着什么难题。

与理论上的宏大描述相反,现在的机器人存在一些**让人颇感「意外」与「尴尬」**的问题:不会叠被子。

这是一个很有意思的例子 ——「叠被子困境」,是群核科技联合创始人黄晓煌在去年的极客公园大会上提出的。

具体是这样的:当你对机器人说「帮我叠个被子」,它确实能通过摄像头分辨出哪床被子是叠好的、哪床是乱的,但它就是不知道怎么动手。

而且,就算它学会了叠一床被子,换个不同形状的被子,它可能又懵了。

这说明什么?具身智能需要大量的「练习」,而这种训练的难度实在是非常高。

无论什么训练方式都需要海量数据

目前训练具身智能最高效的方式之一就是 Sim2Real (从仿真到现实,也是 Simulation to Reality 的缩写)。

简单点说,就是让具身智能在虚拟环境中「龙场悟道」,百倍千倍的加速训练「现实场景在虚拟场景中的映射」。

像是 NVIDIA 就特意开发了 Isaac Sim 仿真平台,提供机器人仿真环境。

虽然 Sim2Real 方法在仿真中训练效率极高,但现实物理场景数据仍必不可少。

所有人都在找同一样东西

可以说,机器人的大脑在数字世界里,但身体却在物理世界中。

解决这类问题,最关键的是在物理世界和数字世界里面建立一个**「数据桥梁」**。

回头看看前面提到的那些顶尖科学家、创业公司,还有那些有大把资金支持的大厂,他们都遇到了同一个问题:

这座数据桥梁从哪找?

这就是目前整个 AI 机器人行业面临的核心困境——有再好的算法,没有足够的数据来「喂养」,机器人依然很难真正理解我们生活的这个三维世界。

数字世界与物理世界之间的「桥梁」

大语言模型训练时,往往需要更多、更好、更「无毒」、更干净的数据,这个最原初的需求造就了**「一批 Scale AI」。**

而在空间智能时代,我们也期待着有这样一批企业「开遍花田」。

当前具身智能领域面临的最主要挑战就是缺乏真实物理世界的数据,特别是力学和空间关系等物理属性。当搭载 AI 的机器人进入物理世界,以往的一维、二维数据都会有较大的限制。

AI 机器人需要了解三维世界的复杂性,就需要先学习三维世界的知识,也就是常说的「三维可交互数据」。

我们注意到 WAIC 现场就有一位国内具身智能的玩家,在这方面就很有优势 —— 群核科技,也是老爷爷照相馆 3D 高斯技术背后的团队。更有趣的是,他们还是我们在做空间智能、具身智能行业研究时常常「遇到」的团队。

说「遇到」是因为,当你研究这个领域的技术发展时,总能看到他们的身影。

今年 3 月,群核科技团队的空间模型 SpatialLM 发布后,立刻登上了开源社区 Huggingface 趋势榜前三。

其数据集也在谷歌 DeepMind 与斯坦福的联合论文中,被点名致谢。

空间智能无法凭空创造

其实早在 2018 年,群核就面向科技圈开放过 3D 场景数据集 InteriorNet,这也是当时甚至现在全球最大的室内空间深度学习数据集之一。

据我们了解,这个数据集之所以叫 InteriorNet ,是因为其「作为 3D 版的 ImageNet」,致敬空间智能之母李飞飞。

可见,他们早早投入具身智能这样一个「风大、浪大、鱼大」的领域。

在此之后,群核空间智能平台 SpatialVerse 就一直在探索让合成数据具备更真实丰富的物理信息。比如本次 WAIC 期间,群核最新发布的 3D 高斯语义数据集就是一次探索,该数据集包含 1000 个 3D 高斯语义场景,每个场景都带有空间关系、位置,以及物品尺寸等结构化信息。

在 WAIC 期间,「十字路口」有幸与首席科学家唐睿进行了一次现场访谈。

👦🏻 Koji

作为群核科技的首席科学家,您怎么看 AI 将走入现实世界,它会带来哪些变化?

👦🏻 唐睿

我认为未来 AI 一定会走进物理世界。我们内部对 AI 的划分其实包括「屏幕空间」,也就是「数字世界」,除此之外还有「物理世界」。

目前像 DeepSeek 、快手、腾讯这些大公司的布局主要还集中在数据世界——比如一句话指令就能完成某个服务。但我们认为更重要的是要推动 AI 从数据世界走入真实的物理空间。举个例子,从工厂工人、办公室助理,到家庭服务这些领域,AI 都有着巨大潜力。

👦🏻 Koji

群核科技在合成数据方面有很多实践,您怎么评价它在 AI 模型训练中的价值和局限性的?

👦🏻 唐睿

合成数据的优势很明显。

真实数据采集成本很高,需要大量硬件的投入和人力的协调。而在虚拟环境中,我们可以构建成千上万个一致的场景,像是通过程序,自动控制物体的位置、光照的变化、材质等等。通过这种方法,就可以实现高度的随机化和规模化效应。

当然,它肯定也有局限,比如不能完全 1:1 还原真实世界的分布特性。我们也正在努力突破这个问题,构建连接数字与物理世界的桥梁,用空间计算能力将 AI 落地到真实的环境中。

👦🏻 Koji

群核在 AI 走向物理世界里可以做什么?会发挥什么独特的价值?

👦🏻 唐睿

群核其实早在 2011 年就开始了空间计算的探索,那时我们的创始人刚从英伟达回国,回国之前他一直在做并行计算方面的研究。

这个时候,我们面临一个关键选择:用并行计算模拟数字世界,还是物理世界?

那时 AI 技术还不够成熟,我们选择用并行计算去模拟物理世界,这也是后来我们做空间设计相关技术的出发点。有了「酷家乐」这款工具后,我们吸引到了大量用户,并在 2016 年进一步关注到了这些空间数据的潜力。

于是我们开发了 InteriortNet ,有 1600 万组像素级的标签数据,还包含 1.5 万组视频数据,共计大概 1 亿 3 千万图像数据,并发布了这个数据集,向李飞飞团队的 ImageNet 致敬。

大家一直称在 AI 领域有着「算力、算法、数据」这三驾马车。

其中,我们认为「数据」是最核心的资源,就像石油、电力一样,能驱动算法的优化和进化。我们的策略就是用工具先生成空间数据,再用这些数据驱动空间智能算法的研发,最后再用算法反哺工具。这就形成了一个闭环。可以说,这也是群核在空间智能这个赛道中的独特生态位。

👦🏻 Koji

群核在生态链中的位置既独特又重要,正在让 AI 真正「看懂三维世界」。谢谢唐老师。

👦🏻 唐睿

谢谢。

群核科技用3D高斯技术还原的数字照相馆

在与群核科技首席科学家唐睿的这场对谈中,我们得知他们让多年的积累形成了独一无二的业务飞轮:

【1】空间设计工具(酷家乐)生成海量场景数据,积累了室内空间数据集;

【2】→ 大量数据基础,得以训练空间模型;

【3】→ 模型反哺工具优化,进一步在空间智能里探索;

【4】→形成闭环。

这个闭环就像滚雪球一样,越滚越大,最终让群核科技在空间智能领域积累了一些难以复制的优势。

这让我们想起了其他相似的案例:

就像快手积累了海量短视频素材,最终成就了可灵这样的视频生成 AI ;米哈游多年的游戏制作经验,催生了星铁 CG 。

可以这么说,群核拥有的这恰恰是 AI 行业最稀缺的能力:对现有业务的深度挖掘,而不是凭空的创造,解决「 AI 与物理世界落地难」的问题。

那些永远不会消失的东西

当我们重新打开那个数字照相馆的链接时,会发现一件有趣的事:那间小店还在那里等着每一个访客。

墙上的照片还是那些照片,阳光依然透过玻璃窗洒进来,甚至连空气中似乎都还飘着那股老相机的味道。只是现在,这个空间不再受时间限制——它可以被无数人同时「拜访」,可以在任何时候为任何人敞开大门。

当我们能以毫米级的精度还原世界时,真实与虚拟的边界开始瓦解

这让我们终于找到了一种新方式,去保存记忆、连接情感、理解世界

🚥

具身智能正在补全 AI 的身体,空间智能让它真正站在三维世界里看见事物。

老爷爷的照相馆,是这些技术变得柔软、亲近、可感的地方。

它不再只是照相馆。

它是一个始于 3D 高斯的起点,是我们开始重建数字与物理桥梁的入口。

它不打烊。

每个人都能推门而入,坐下,留下自己的某一刻人生。