VLA和世界模型争论不休,这场4小时的技术沙龙有结论吗?
在飞速发展的领域,持续观察

机器人和具身智能领域,未来会走向哪里?如今VLA和世界模型成为受关注的两条技术路线,它们是不同的发展方向?还是会走向技术融合?目前领域发展持续加速,但模型发展路线的标准答案还未出现,而技术也将从实验室走向真实世界和产业,所以一切讨论和问题皆有可能。
上周六,蓝驰创投「不鸣 Booming」联合智元创投 A 计划,召集不同研究机构的技术负责人和科技爱好者,在北京举办了一场**《VLA与世界模型:非此即彼or双生时代》**技术向线下沙龙。
蓝驰创投合伙人曹巍在沙龙中提到:“具身智能和机器人都是超长周期、超大体量的超级赛道。” 这也意味着我们目前需要敞开胸怀,保持更开放的态度,迎接更多创新机会。这场4小时的交流不断延伸出更深度的问题,从VLA和世界模型,讨论到Human-centric Data、未来工厂和家庭、产业价值。
蓝驰长期关注机器人和具身智能领域,进行了深度理解和早期投资布局。而蓝驰也相信,在这样的时间节点,重要的是持续理解技术演进的方向,并在开放交流中,逐渐寻找到影响产业发展的关键变量。
以下是线下沙龙的具体内容,如果你也关注具身智能、VLA和世界模型等相关领域,欢迎和我们一起将这场讨论继续下去。

“今天的VLA和世界模型,虽然已经出现了一些先发团队,但行业还没有形成真正的共识。” 蓝驰创投曹巍在沙龙开始时提到。
在具身智能技术领域,VLA(视觉-语言-行动模型)和世界模型(World Model)是当下讨论热烈的两条技术路线。VLA的重点在“完成任务”,能直接将视觉、语言等映射为物理动作,反应快,延迟低;而世界模型则更强调机器人对真实世界的理解、预测和模拟,希望机器人能通过推演,调整行动策略。人们讨论的要点在于:这两种模型会往不同的方向发展?还是会互补融合?
在曹巍看来,今天的具身智能仍然处于技术栈非常早期的发展阶段。关于模型持续学习的能力,真实世界数据压缩等问题,其实都没有形成统一的答案。但同时,具身智能领域的技术发展也处于持续加速的上升期,所以还有许多值得探索的内容和创新的空间。
这场沙龙从技术人员的研究课题出发,并在Q&A和自由讨论环节将话题延伸到真实世界中技术的场景落地,泛化能力和具身智能的未来发展方向。


来自清华大学交叉信息学院陈建宇课题组的张荐科从VLA的模型架构出发,讨论了VLM迁移到VLA过程中出现的视觉语言理解能力的遗忘问题。团队提出的解决方案UIM(Unified Interaction Model)方案尝试将不同类型的信息进行解耦为“what”和“where and how”两类能力进行学习,在保留视觉语言理解能力的同时,进一步提升机器人的动作能力。
孙振国是星源智联合创始人、智源研究院具身交互世界模型研究中心负责人,他表达了对VLA与世界模型之间的关系的看法,认为两者并不是简单的替代关系,而是共生关系。VLA擅长从成功轨迹中学习具体动作,而世界模型则能够通过预测环境变化,引入更多交互信息,为机器人提供更丰富的训练信号。团队基于此提出的ω-EVA 工作,希望能将预测和动作联合建模。他也提到,世界模型这一技术发展路线仍未收敛,未来还有模型范式、多模态信息融合、机器人能力提升等问题值得探索。
莫刻机器人的联合创始人Kevin 分享了团队围绕世界模型开展的一系列工作,重点围绕着世界模型的推理框架,比如团队提出的HDR(Hierarchical Diffusion Forcing)希望提升世界模型在长时序推理中的稳定性,并通过多个Benchmark验证模型效果。此外,他也提出了团队对于数据范式的思考,认为机器人真实执行数据与互联网视频仍存在明显差异,因此更关注机器人第一人称视角(Ego-centric)的真实交互数据。
即将加入清华大学人工智能学院的冯瑶教授,则分享了一些关于以人为中心的AI研究工作和思考。她认为,随着具身智能的发展,AI基础模型正在从理解语义世界逐渐走向理解物理世界。 因此相比仅依赖互联网中的文本和图像,未来模型还需要理解人的姿态、动作以及人与环境的交互。她的相关研究也希望建立能感知、理解并与人自然交互的基础模型。
清华大学智能产业研究院(AIR)助理教授、博士生导师,智源学者(BAAI Scholar)赵昊,讨论了关于世界模型和多模态基础模型的观点。他认为,随着模型能力不断提升,强化学习等后训练范式正在成为世界模型持续进化的重要路径,而具备更强理解、推理和交互能力的多模态基础模型,也有望成为下一代具身智能的重要基础。

不同研究团队选择不同的模型表征,这也关乎机器人如何理解真实世界。几位技术人员给出了自己的理解。
Kevin:团队更关注如何从视频中提取具有语义信息的表征,希望通过预训练Encoder学习更加紧凑的特征表示,并提到近期CVPR的Delta Token工作,希望利用两帧之间的差异更好地表示运动(Motion)信息。
冯瑶:模型需要建模什么,取决于最终的应用目标:工业机器人需要更精确地理解物理属性,而面向家庭等生活场景的机器人,则需要建模更多物体外观以及人与环境交互的信息。
赵昊:在大规模深度学习中,离散表征仍具有优势,未来的重要研究方向之一是将力学信息进一步融入3D表征,同时继续探索运动(Motion)的表征方式。
而数据也是支撑模型的关键。Kevin提到团队数据选择时认为,真机遥操作数据采集成本高、质量有限,而Ego-centric数据与真机数据混合训练,目前能够取得较好的效果。
不同应用场景对于数据策略也有影响:如果目标是生活场景,数据来源可以更丰富多样;如果聚焦特定任务和本体,则需要尽量从本体角度控制数据多样性。数据并不是越多越好,而是要服务于模型泛化和真实任务闭环。

各个研究团队有不同的模型架构,**架构会通过应用场景迁移和演进,还是会出现一个统一的架构?**在这个广泛讨论的问题中,在场的技术人员则给出了不同的看法。
Kevin:图像生成模型的发展历程,认为优秀的模型架构往往是在不断试错中演进出来的,而最终更重要的是具备高效的数据基础设施和持续迭代能力。
冯瑶:相比架构本身,更重要的是找准技术方向,并建立持续获取数据和反馈的能力。
赵昊:目前Transformer仍然是主流架构,未来值得关注的方向更多集中在提升模型效率,以及视频生成、多尺度建模和Motion等能力的持续探索。

模型之外,技术也将从实验室走向产业:机器人最先会在哪些产业创造价值?
多位技术人员认为,物流、上下料(Pick and Place)是下游复杂动作的动作基元,而物流、工厂及商超分拣、酒店清洁、危险作业等场景,被认为具有较大的应用潜力。
另外,关于模型与数据闭环的问题,目前工业场景的数据和模型仍然难以复用,预训练模型的开箱即用能力有限,真实场景产生的数据也难以有效反馈到基础模型中。大家认为,具身智能仍处于长期发展的早期阶段,产业界需要持续推进技术落地,在真实场景中不断验证和迭代模型能力。
这是一个没有标准答案,也不断持续的讨论。讨论中有人认为,可以借鉴自动驾驶的发展路径,从物流等能形成数据闭环的场景切入。

具身智能技术在技术创新、发展和落地的每个阶段都有研究人员在进行持续的探索,未来的发展方向还十分宽广。
蓝驰已有十年的机器人领域布局,近几年也持续关注具身智能赛道,从多层技术角度在这一赛道进行系统性的、深度的早期布局,如智元机器人、银河通用、至简动力、它石智航、Hillbot、灵初智能、OriginFlow等。
这也是蓝驰举办这场“纯技术局”的原因。我们相信,一线研究者和技术人员的真实项目和思考在此刻十分重要。**蓝驰将继续关注具身智能技术领域的讨论,希望理解技术发展的最新方向,看到不同技术路线的可能性,和更多研究者、创业者一起,在开放讨论中观察技术演进,寻求对底层技术的长期积累和深刻理解,探索具身智能发展的关键变量。**并陪伴优秀的团队将技术创新推向真实世界,找到价值入口和现实生产力。


蓝驰陈维广对话智源王仲远、银河通用王鹤、面壁智能李大海:大模型时代的长期价值与下一条曲线
蓝驰对话智元、银河通用、它石智航、灵初智能、Hillbot——具身智能:破晓时的「破」与「立」
蓝驰AI年度观察:中国AI创业者的生存、进化与叙事 | Booming Talk


