世界模型与智能基建:深聊具身新浪潮,我们看见不同答案|云启 × WRC

来自前沿探索者的一线判断

机器人怎样真正理解世界?支撑这种智能的底座,又该如何搭建?

刚刚落幕的2026 世界机器人大会上,密集亮相的新产品、新技术与新应用,呈现着具身智能的当下;一场场前沿分享与观点交锋,也在不断打开具身智能未来的更多可能。

8 月 21 日下午,由**云启资本与无限基金 SEE Fund 联合主办,火星加速器、清华校友总会电子工程系分会联合支持的「具身智能新浪潮:世界模型与智能基建」专题活动成功举办。这是云启连续第五年走进世界机器人大会,与行业一线交流具身智能的新变化。

此次活动聚焦世界模型与智能基建两大热点议题。来自高校前沿研究团队、国内头部大模型与云服务平台,以及世界模型、机器人本体与应用、数据和算力基础设施等一线创业公司的嘉宾**齐聚现场。现场还吸引了 200 余位来自具身智能产业、科研与投资一线的观众。三个多小时里,话题从技术路线延伸至数据效率、算力 Infra 与真实场景落地,台上台下共同探寻具身智能迈向下一阶段的答案。

共识形成之前,如何判断方向?

新热点、新团队不断涌现,技术路线却尚未统一。如何判断方向?这是联合主办方主办方云启资本与无限基金 SEE Fund 共同关注的问题。两家机构均是国内最早一批投身具身智能浪潮的早期投资机构,近年围绕机器人本体与应用、世界模型,以及数据、算力等基础设施持续布局。

“作为早期投资人,我们比较习惯于追逐那些答案还没有形成、技术路线还没有统一的方向和阶段。很多重要技术的变化,其实都在行业共识成立之前最有价值。”

云启资本执行董事韩义在开场环节介绍,云启自 2014 年成立以来始终专注早期科技投资,过去十余年陪伴 200 多家科技创业企业成长;早在具身智能成为创投市场广泛关注的热点之前,云启便已开始投资相关方向,并逐步形成系统性布局。

他表示,机器人行业的目光,正从如何感知世界、获得更强的行动能力,转向如何真正理解物理世界。这要求机器人不仅识别自己看到了什么,还要理解空间关系、因果关系与物理规律,并作出预测和调整,世界模型也由此受到广泛关注。

但无论 VLA 还是世界模型,都“远未形成统一答案”。韩义指出,模型之外,数据采集、算力支撑,以及仿真与真实数据如何结合,同样关系着具身智能的下一步。

云启资本执行董事韩义

技术路线尚未收敛,创业公司和资本已快速涌入。如何看待这股热潮?

无限基金 SEE Fund 管理合伙人马麟在开场致辞中表示,无限基金从 2023 年开始投资具身智能赛道,已经形成产业链布局。今年具身智能市场融资活跃,但相比短期估值,更重要的是企业是否走在正确的道路上,是否仍在坚持正确的事情。

从近些年的世界机器人大会、春晚和机器人赛事,机器人能力持续提升。“具身智能和机器人对于产业的改变,乃至对于世界的改变,已经不再遥远。”但他坦言,通用具身智能虽是目标,却“不可能一步登天”,仍需尊重产业规律,稳步前进。

具身智能会为人类提供更多的增量价值,做人所不能,达人所未到,这是全产业更应该给予更多关注的方向。

无限基金 SEE Fund 管理合伙人马麟

从一线探索

看 AI 如何理解物理世界

技术路径尚未收敛,不同方向的探索已经深入具身模型训练与真实场景。主题演讲中,三位嘉宾结合一线实践,分别分享大模型方法如何进入具身场景、物理直觉如何高效学习,以及世界模型如何走向物理可信。

大模型的方法

如何进入具身场景?

立足大模型平台与产业实践,火山引擎副总裁杨立伟结合博物馆导览等案例,介绍了豆包大模型家族系列模型在实时多模态交互、感知与执行打通,以及后训练和强化学习等方向的探索。 大模型领域已经验证的方法也开始进入具身场景。杨立伟以 In-Context Learning 为例:大语言模型无需更新参数,只需读取少量示例便能适应新任务。具身智能也可借鉴这一思路,但需要提升上下文的模态丰富度、时间长度与窗口能力。

数据效率同样关键。当前不少 UMI 数据已达百万乃至千万小时,却未必带来相应的能力提升。杨立伟认为,提升数据质量还需解决跨模态表征统一、真实场景保真,以及提取对下游动作有益的先验信息等问题。

火山引擎副总裁杨立伟

除了"攒家底"

还要提高 Scaling 效率

上海交通大学人工智能学院副教授李永露以《World Model 与物理直觉学习》为题,介绍了团队利用真实数据、互联网视频、游戏与仿真,训练模型理解几何关系、物理变化与长时序任务的研究。 在他看来,模仿学习和强化学习已形成相对成熟的范式,行业技术趋同性越来越高,“这说明整个行业有共识了”。但有效的方法仍需持续“攒家底”。数据进入百万、千万小时量级后,存储、调用与分布式训练,也让竞争延伸至 Infra 能力。

不过,“小时”未必是衡量数据价值的最佳单位,关键是数据能否提升模型能力。李永露介绍,团队也在尝试利用游戏和仿真等低成本数据训练模型的“物理直觉”,并通过跨任务表现及适配新任务所需的数据量,衡量模型的泛化能力。

上海交通大学人工智能学院副教授李永露

世界模型如何跨过

"物理可信"这一关?

世界模型"看起来真实",是否就意味着符合物理规律、能够真正服务机器人行动?云启早期投资项目「飞捷科思」联合创始人兼 CTO 杨鼎康以《创造、理解与推演物理世界》为题,分享了团队的探索。 他分析了世界模型的几类主流路径:视频生成路线擅长视觉呈现,却未必符合真实动力学;隐变量中的物理知识难以验证;3D/4D 模型可以重建和漫游场景,但“可漫游并不代表可交互、可仿真”。杨鼎康认为,世界模型要进入物理世界,还需补上基于动力学与物理属性的模拟推演能力。

真正面向机器人时,物理世界模型不能只预测“下一帧看起来像什么”,还要判断一个动作将带来怎样的结果。沿着这一思路,飞捷科思于今年 7 月发布 Fysiverse,以“显式物理模拟器+生成式渲染器”建立可计算的物理状态,推演符合物理规律的未来变化。

飞捷科思联合创始人兼 CTO 杨鼎康

报告发布:

谁能把真实世界变成可验证的经验?

模型如何学习并理解物理世界,离不开数据与基础设施。此次专题活动,火星加速器、云启资本与无限基金 SEE Fund 联合发布《2026 具身智能数据产业链与新基础设施研究报告》,从数据基础设施、技术演进与投融资趋势等角度,对产业现状作出阶段性梳理。

活动现场,火星加速器联合创始人李芬以《数据飞轮:从手工作坊到经验工厂》为题,分享了报告的部分洞察。

李芬提到,机器人进入真实产线,需要技术团队长期驻场、反复调试,早期落地不仅是“劳动密集型”,更是“博士密集型”。一项简单动作也要经过任务设计、采集同步、人机映射和数据治理。因此,“一次动作不等于一条有效经验”,重要的不是采集了多少数据,而是产生了多少机器人能力。

只有将真实部署中的失败样本与边缘情况带回数据生产,让流程持续迭代,数据闭环才能成为飞轮。世界模型有望让经验生产从“被动记录”走向“主动设计”,但仍需要数据、算力、仿真与工程体系的支撑。“谁能持续把真实世界变成可验证的经验,谁就掌握了新基础设施。”

火星加速器联合创始人李芬

世界模型

范式如何演进?

从模型训练到数据飞轮,具身智能正成为一场系统能力的竞争。其中的共识与分歧,也在两场圆桌讨论中得到集中呈现。

第一场圆桌以"世界模型不同路线:机器人技术范式会如何演进?"为题。云启资本执行董事桑煜与云启 2026 年新出手投资的三家具身智能企业创始人——破壳机器人创始人许华哲、昆腾动力创始人兼 CEO 李强、费莫一科技创始人兼 CEO 刘念邱,围绕技术演进与产业落地展开讨论。

什么才是真正"有用"的世界模型?许华哲认为,关键不仅在于预测下一帧,还在于能否帮助机器人学习表征、评估策略与完成通用操作。李强提出,预测世界最终是为了改变世界,模型还要结合业务语义判断任务是否完成。刘念邱则认为,机器人需要处理的不只是环境预测,还包括认知、推理与人机交互等更复杂的能力,仅靠狭义的世界模型并不足以支撑机器人在开放环境中的自主行动。

具身智能如何加速 Scaling ?讨论中的一个共识是:Scaling 不能简单等同于增加参数或堆积数据小时数。相比重复数据,物体、环境、交互方式与失败样本的多样性更加重要——"成功可能千篇一律,失败却各有特点"。

从 Demo 走向规模化落地,模型只是其中一环。许华哲关注家庭等非结构化场景中的泛化能力;李强认为,末端执行器的可靠性,异常识别与自主恢复等系统能力同样关键;刘念邱则将移动能力视为机器人进入开放、动态场景的基础,只有具备在真实环境中的行动能力,机器人才能进一步走向更广泛的任务应用。

除此圆桌还谈及具身人才与未来三年的行业图景。圆桌还谈及具身人才与未来三年的行业图景。无论投资人还是创业者,期待的都不只是更好的 Demo,而是机器人真正走入家庭、物流与更多场景,创造使用价值。

智能基建

卡点不只在算力

第二场圆桌以"智能基建:数据、算力和 Infra 创新的下一步?"为题,由无限基金 SEE Fund 高级投资经理蔡靖东主持,上海交通大学人工智能学院副教授李永露、魔豆领刻 CTO 曾新宇、X-Era Lab(拓元智慧)总裁仲黎若、无问芯穹技术副总裁张权路参与讨论。

行业眼下最缺什么?四位嘉宾都谈到了数据。李永露关注有效数据的获取效率:数采数据真正能够进入训练的,可能只有 5%—10%。 曾新宇**用"原油"与"精炼油"形容其中的差距——大量原始数据仍需经过标准化的数据管线,才能真正被模型使用。

仲黎若提到,团队积累了千万小时数据,真正进入训练管线的只有十万至二十万小时。 张权路**则提出,除了追求更高质量的数据,也要通过新的训练方法降低模型对数据质量的要求,并让数据在采集、训练与部署之间持续回流。

具身 Infra 也不能照搬大模型时代的技术方案。李永露指出,机器人没有现成的数据集和统一 Benchmark,需要自行打通数据、训练、评测与反馈链路;曾新宇认为,视觉、点云、触觉与动作等多模态数据,也让存储、对齐、解码和加载成为新的训练瓶颈。

模型如何进入机器人,是另一个关键问题。仲黎若判断,模型最终要"长在机器人本体上",端侧部署与连接不同本体的操作系统将更加重要。张权路则关注云、边、端协同:机器人对延迟更加敏感,真机也要进入训练和迭代,Infra 必须同时连接不同层级的算力与设备。

讨论还延伸至 Scaling、标准化与部署。观点交锋也让智能基建的轮廓更加具体:它不是某一个单点工具,而是一套贯穿数据采集、模型训练、真机部署与反馈回流的系统工程。

**机器人怎样真正理解世界?支撑这种智能的底座,又该如何搭建?**三个多小时的分享与讨论,没有给出一套标准答案,但让我们看见,具身智能的下一步不止一种可能。

技术路线仍在演进,产业共识尚未形成,真正的答案还要在一个个真实任务与场景中反复验证。讨论暂告一段落,探索仍将继续。云启也将与创业者、研究者和产业伙伴同行,陪伴具身智能一步步走进真实世界。

完整讨论,欢迎收看"云启资本"视频号直播回放