当AI走进物理世界,世界模型还缺什么?| Attention WAIC专场回顾
六位嘉宾聊完,世界模型“几分熟”仍没有标准答案

活动开始前,我们曾问:"世界模型几分熟了?"
听完三场分享和一场圆桌,这个问题反而更难给出简单答案。因为同样是在谈"世界模型",现场嘉宾关注的问题却各不相同:有人关注如何搭建可供机器人反复训练、试错的环境,有人用它预测行动之后的未来状态,也有人更关心它如何与动作模型、强化学习和真实数据形成闭环。技术路线仍在分化,行业对世界模型的定义、实现方式和成熟标准,也尚未形成共识。
但有一条趋势已经越来越清楚:AI的下一步,在物理世界。
7月18日,「云启」联合「NICE学术」,在WAIC期间举办了**「世界模型BBQ」**。活动发布后,共收到超500份报名。原计划开放40个席位,最终到场观众却超过百人,刷新了该场地同系列活动的观众人数纪录。云启创始管理合伙人毛丞宇也来到现场,与大家一起交流。
现场既有来自高校和科研机构的教授、博士及青年学者,也有来自世界模型、具身智能、机器人和AI for Science等方向的创业者、企业研究员与一线工程师。不同背景和视角在现场交汇,讨论也从模型架构逐渐延伸到数据闭环、产品落地与创业选择。

三场分享中,上海交通大学人工智能学院副教授陈思衡、上海交通大学计算机学院助理教授李阳,以及破壳机器人首席科学家袁哲诚,分别从数字智能体赋能具身训练、开放世界中的多智能体决策和机器人的Manipulation能力三个方向展开分享。
随后的圆桌上,脸谱心智创始人陆弘远、Sreal AI创始人邹应天和Ropedia CEO陈昭熹,三位从研究者走向创业一线的创始人,在云启资本执行董事桑煜的主持下,把讨论进一步延伸到技术路线、商业化与研究者创业。
沿着这些分享,几个关键问题逐渐变得具体:世界模型如何帮助机器人训练?怎样预见行动之后的未来?模型要走到哪一步,机器人才能真正伸手干活?

先造一个训练场
再训练成千上万个"小脑"
上海交通大学人工智能学院副教授、博导陈思衡首先把问题从数字世界带到了物理世界,他的主题演讲是《From Digital to Physical? 数字智能体技术赋能具身机器人的思考与尝试》。

今天的数字智能体,已经逐渐形成一套相对清晰的工作方式:一个负责统筹和规划的"大脑",调用不同的子智能体与工具,完成一项复杂任务。陈思衡提出,类似的架构也可以被迁移到具身智能中——高层的EmboBrain负责任务理解与拆解,底层的VLA工具负责走路、开门、抓取等具体动作。
比如,让机器人从冰箱里取一罐可乐。对人来说,这是一件事;对机器人来说,却是一连串相互关联的任务:先规划路线、避开障碍,走到冰箱前,再开门、识别目标并完成抓取。每一步都需要一个可靠的专用模型,大脑还要知道何时、以什么顺序调用它们。
问题随之而来:这样一个理解物理世界的"大脑",要去哪里训练?现实环境很难承受机器人低成本、高频率地反复试错,因此他搭建了一个名为EmboMatrix的具身决策训练场。它既能生成符合人类常识的空间布局,也能通过多智能体社会模拟,让不同"居民"基于性格和偏好产生需求,进而批量生成复杂、多样的训练任务,并提供高效仿真与精确奖励。
在EmboMatrix中,EmboBrain通过大量交互形成具身决策能力。面对长程任务,具备规划能力的VLM会先将目标拆成有限的子任务,再调用不同的VLA工具执行。团队还通过TAPT(Tool-Aligned Post-Training),训练出各有所长、边界明确的一组VLA工具。
但当具身智能需要成百上千种技能时,依靠人逐个训练"小脑"成本极高。于是,他跟团队进一步提出EmboCoach,让数字智能体读取任务文档和代码,自主完成策略设计、调试、改进,并在仿真和真机中闭环验证。进入真机VLA微调阶段,RoboCoach还能根据仿真中的失败案例调整训练策略。
由此形成了一条颇具想象力的路径:先用AI搭建训练场、训练具身"大脑",再让AI批量训练执行具体任务的"小脑",最终推动Physical AI的研发从线性项目走向自主迭代。

世界模型要"看见"的是
行动之后的未来
上海交通大学计算机学院助理教授李阳的主题演讲《面向开放世界的具身多智能体决策》,把世界模型的讨论从"生成下一帧"推进到"支撑下一步行动"。

在他看来,当多个机器人共同进入真实环境,问题会迅速复杂起来:它们可能搭载不同的传感器和本体,需要与陌生队友协同;场景、任务乃至对手随时在变;灾后救援、实验室值守这类任务往往持续数天甚至数周。机器人必须在缺少持续人工指令的情况下,维持长期而稳定的自主行为。
这也重新定义了世界模型的目标。对机器人导航而言,画面里一面墙的纹理是否逼真并不关键;真正重要的是,机器人能否判断障碍物在哪里,几条备选路径各自通向什么后果,以及下一步行动是否安全有效。换句话说,世界模型要预测的不是像素,而是决策所依赖的未来。
围绕这一目标,李阳介绍了DF3(Decoder-Free World Models)。它直接在视觉基础模型的编码器空间中预测未来特征,省去视频生成器、潜空间解码器和任务解码器,把计算集中在真正影响决策的信息上。相较基线方法,DF3仅以轻微的预测精度代价,将延迟降低70%,峰值GPU显存占用降低67%,预测参数量降低41%,让世界模型贴近机器人端侧的算力预算。在决策回路中,它更像一个"预测器"加"判别器":先想象不同动作可能抵达的未来状态,再从多条路径中选出更合适的一条。
预见未来之后,机器人还要回答"接下来该做什么"。李阳提出的PEPA是一个人格驱动的持续自主具身智能体,要为长期自主行为找到一套"组织原则"。这里的人格远不止聊天或交互风格,而是一种目标生成机制:人格塑造价值偏好与内在奖励,进而决定智能体每天生成什么目标、采取什么行动;记忆与反思再把当天的经验写回系统,让长期行为既保持一致,又持续适应。实验中,五种不同人格的机器人在第三天均完成24小时自主运行,并在各自价值观的驱动下表现出截然不同的行为模式。
这一套具身多智能体研究还被带进了自主科学实验。李阳与团队通过具身科学统一接口,连接智能体系统、机器人和不同化学设备。在有机废水降解实验中,系统用45小时完成15轮迭代,达到99.7%的降解效率,相当于两名研究生约30天的工作量。目前,李阳正将多智能体协作引入真实的高通量催化剂实验平台,在16亿种高熵合金组合中加速寻找高活性催化剂,这项工作仍在推进中。
从DF3的"可预测未来",到PEPA的"可组织长程",再到具身科学智能体的"可验证发现",世界模型所预见的"未来",已经越过下一帧画面,开始覆盖一段连续行动乃至一个完整实验闭环的结果。

从"会预测"到"会干活"
中间还隔着Manipulation
「云启—交大AI天使基金」被投企业破壳机器人首席科学家袁哲诚,把视角落到机器人与物理世界最直接的连接点:操作(Manipulation)。他从公司具体的实操出发,发表了题为《Manipulation,通往physical AI的下一件大事》的演讲。

机器人会跑、会跳、会完成极限动作,距离进入生产生活、真正替人干活,依然有不短的路。袁哲诚认为,操作能力的突破依赖三个彼此咬合的要素:理解世界的基础模型、能从真实反馈中持续学习的强化学习机制,以及高质量、高效率的数据采集。三者共同指向的终局,是Physical AGI——他的PPT将其概括为"极致的灵巧、绝对的泛化"。
机器人需要怎样的世界模型?他把当前的主要路线逐一过了一遍:3D重建几何表达清晰,但几何不等于物理理解,因为它不知道物体受力后会怎么变化;JEPA/隐空间方法训练高效,物理语义却难以验证;手工物理引擎规则明确,可规则永远写不完;视频生成视觉真实度高,却缺少物理关系建模,容易出现反物理现象。他的判断是:兼顾预测与控制的WAM(World Action Model),是具身操作的最优路线。
但主流WAM仍有问题。它先用视频模型预测下一刻画面,再由逆动力学模型从前后两帧反推动作,而画面本身可能产生"物理幻觉":手机明明在桌上、夹爪正准备抓取,下一帧手机却凭空消失了。这对视频观看影响有限,对机器人的下一步动作却可能是致命的。
破壳WAM为此提出Action Forcing:利用IDM-DM循环,在"预测观测—反推动作—修正观测"的迭代中,把生成结果不断拉回更符合物理规律的方向。 在与两款主流视频生成模型的叠衣服对比中,破壳 WAM的生成结果在物理一致性上更接近真实实拍。袁哲诚回忆,他第一次看到导出的视频时,还反复问同事"是不是搞错了"。
在他现场演示的视频里,机器人全自主完成了制作麻婆豆腐的长程操作任务:豆腐落点随机、器具位置会变化,单机器人都能精准抓取,与此同时,它需要判断何时倒入食材、何时停止翻炒,并在看到水沸腾后自主关火。
"Demo做成一次不稀奇,如果能连续地做,并且能现场展示,才是真功夫。" 这句话也点出了机器人Demo与真实能力之间的距离。
为了让一次成功变成可重复的稳定执行,破壳搭建了全链路真机强化学习体系Poke RL,让历史数据能够持续转化为训练资产:TRFO算法通过Off-policy数据利用和优势函数动态加权打造真机环境优化引擎,任务无关的奖励机制只需"及格/不及格"的二元标签,Chunk-level动作块支撑长时序操作,多任务统一架构则让一个大脑掌握多种技能。在他现场演示的视频中,我们可以清晰看到,价值函数对叠衣服的每个状态实时打分:当完成一次衣服整理时,数值回落,而当一件新衣服被扔到桌面时,函数值随即回升。
数据侧,自研的Poke UMI手套与灵巧手承担高质量数据采集,开瓶盖、拿卡、勾水壶这类精细操作都能覆盖。Poke WAM负责理解与预测,Poke RL负责从反馈中学习,Poke UMI负责供给数据——三者构成的飞轮,用他的话说:"每一圈都更快。"

当世界模型
走到创业一线
最后的圆桌环节由云启执行董事桑煜主持。他长期关注具身智能及其上下游赛道,此次他把讨论从技术路线进一步带到了创业现场。巧合的是三位创始人都有一个共同的经历,他们都是从学术到创业:脸谱心智创始人陆弘远博士毕业于香港中文大学;Sreal AI创始人邹应天现任上海交通大学人工智能学院副教授;Ropedia联合创始人陈昭熹拥有清华大学与南洋理工大学MMLab的科研经历。

开场时,桑煜先开了个玩笑:"如果大家觉得哪位嘉宾分享得不够犀利,或者没有说真话,一会儿BBQ时可以跟他多碰一杯。"
圆桌先从一个基础问题聊起:世界模型最核心的能力究竟是什么?
有嘉宾把世界模型的发展概括为三个阶段:早期服务于强化学习,让智能体在"想象"中推演未来;随后走向空间智能,关注3D空间、观察视角和记忆的一致性;当AI进入物理世界,模型还要理解动力学,预测一个动作将如何改变环境。
视频生成与世界模型的关系也成为现场反复提及的话题。一位嘉宾直言:"现在最混乱的一点,是大家会把视频生成当作World Model。"视频可以生成逼真的场景,但对机器人而言,物体受力后如何变化、动作能否抵达预期状态更加关键。世界模型最终还要服务于预测、规划和执行。
讨论随后落到泛化与数据效率。自动驾驶、灵巧操作、夹爪操作等场景各不相同,创业公司的数据和算力却很有限。如果手里有20项任务,哪些最值得先做?哪些数据能够迁移到更多场景?Task Scaling、相关案例检索、有监督训练信号和高迁移价值数据筛选,都是嘉宾们提到的可能方向。相比一次Demo,模型能否用有限数据覆盖更多任务、支撑更长程的行动,更接近创业公司的现实问题。
到了商业化环节,讨论也从"模型能做什么"转向"公司现阶段应该做什么"。
有嘉宾用**"沉浸,同时抽离"**概括创始人的状态:既要深入技术、产品和客户,也要保留独立判断。"共识中的非共识,才可能是最后100倍、1000倍的机会。"
但长期判断之外,公司还要解决当下的生存问题。世界模型研发投入高、验证周期长,现场有一句话很有代表性:"做世界模型,没有办法去做一件现在看起来很小的事。"
以游戏行业为例,世界模型能力越强,越可能从底层工具进入内容生产,进而改变现有公司的生产方式。这种想象空间也让部分产业客户对合作更加谨慎。围绕创业公司如何度过早期阶段,嘉宾们分别提到了数据服务、模型能力和软硬一体化等选择。它们未必构成一条固定路线,却反映出同一个现实问题:在通向长期目标的过程中,公司仍要找到适合当下阶段的生存方式。
谈到从Researcher走向Founder的经验,一位嘉宾复盘了此前做端侧模型的经历。产品进入C端后,如果团队以用户点赞作为反馈,这种信号就不够直接,难以有效验证模型表现。用他的话说,当时的核心问题是"Verify不够好"。
嘉宾也提到,世界模型之所以受到关注,一个重要原因是它有机会为机器人提供带有直接奖励信号的模拟器,让智能体在其中反复交互和试错。进入真实应用后,团队还可以从用户使用过程中收集与任务相关的数据,再将这些数据带回模型训练,形成持续迭代的闭环。
谈到New Lab,嘉宾们也提到,研究者创业面临的难题并非"不懂商业化"。产品定义得太小,可能限制基础能力;目标设得太大,又要承受较长的落地周期。随着Agent进入公司协作流程,权限管理、信息安全和上下文对齐也会成为新的组织问题。
这场圆桌没有得出统一的创业路线,却把几个现实问题摆到了桌面上:技术路线怎么选,有限资源投向哪里,模型如何获得真实反馈,公司又如何在长期目标与阶段生存之间找到自己的节奏。

从会对话
到会"脑补",再到会动手
干货环节结束后,屏幕里的麻婆豆腐换成了桌上的烤串和啤酒,人们开始互相交流、互换微信、探讨合作机会,甚至发起招聘……关于世界模型的讨论也从台上延续到桌边。
如果再问一次"世界模型几分熟",答案或许仍然因技术路线而异。但当晚的讨论至少提供了三把更具体的尺子:它能否理解物理规律,能否预测行动后果,能否在真实环境中稳定完成长程任务。
从会对话,到会"脑补",再到会动手,AI每向物理世界迈出一步,难度都会成倍增加。也正因为难,更需要让研究者、创业者与投资人坐到同一张桌边,把模糊的概念拆成具体问题,把未来的想象落到今天的实践。
这也是云启希望可以持续做的事:关注正在发生的技术变量,也关注那些愿意把未来一步步做出来的人。
关于「Attention」
「Attention」是云启面向科技创业者与产业生态打造的系列品牌活动。其前身为云启自14年成立之初打造的品牌特色活动"云启 BBQ",旨在建立与科技创业者的深度交流并打造创业者生态社区。 自 2023 年升级至今,「Attention」秉承 "Attention is all you need" 的理念,深度聚焦 AI Agent、具身智能、AI 硬件及全球化等前沿议题。活动已落地京/沪/深/杭及硅谷等地,累计举办近70期,吸引10,000余位参与者,持续为 AI 创业者和高潜创业者提供观点交流、资源连接,致力于成为前沿 AI 创新者的深度生态连接平台。





