具身智能的下一步:边部署,边进化

智元 LWD 之后,真实世界不再只是机器人的考场,也开始成为训练场。

智元 LWD 之后,真实世界不再只是机器人的考场,也开始成为训练场。

👦🏻 作者: 镜山

🥷 编辑: Koji

🧑‍🎨 排版: NCon

过去这半年,国产具身智能进入了一段比较快速的小跑期,尤其是自从春晚的「武侠 Bot」出现后,整体速度跑的更快了。

人形机器人量产、商超试点、产线落地的消息明显密集的变多,整个行业的节奏被踩了一脚油门。

3 个月前,我们系统性地介绍过国内具身智能厂商:智元具身研究中心罗剑岚团队发布的 SOP(Scalable Online Post-training),核心判断是:

人形机器人能不能长期存在于现实世界,关键在于它能不能在部署之后继续学习,让真实世界本身变成训练场。

昨天,该团队再次公开了一篇新的研究成果,名字叫:

LWD(Learning While Deploying),核心是真实世界的强化学习预训练 + 后训练。

具体研究网址:

https://finch.agibot.com/research/lwd

如果说 SOP 解决的是「机器人能不能在真实世界里持续学习」,那 LWD 想回答的,是「机器人能不能靠自己越用越强」。

🚥

「十字路口」团队第一时间下载了这份论文,认真「研读」了一下。

接下来,我们顺着 LWD 这套系统的逻辑,把里面几个值得关注的点拆开说一说。

先说回那个老问题:机器人变强,卡在哪儿

具身智能领域一直是「十字路口」团队比较关注的高潜力领域,这个领域里的技术路线比较复杂。

我们先简单回顾下。

VLA(视觉-语言-动作)大模型给机器人带来了通用的泛化能力,但通用泛化和真实世界里的可靠性是两件事。

任务越多、环境越复杂,固定的预训练策略就越容易在某些场景下出问题。机器人在 Demo 里看起来很稳定,到了店里、家里、车间里,长尾问题会被持续放大。

行业里目前主流的「补救」方式大致就这几种:

【1】采集更多人类示范数据,让模型再训一遍;

【2】部署时让操作员盯着,遇到问题就接管,一条一条的轨迹纠偏;

【3】事后人工标注失败案例,再重新微调

这三种方式都有效,但绕不开同一个问题点:

每一次让机器人变强,都得有人在前面盯着。机器人部署得越多、任务越复杂,配套的人力反而越重,边际收益却递减得很快。

这已经成为了目前机器人进入线下场景的最真实的困难之一。

LWD 的本质就是提出了一套方法论,把「机器人变强的来源」从外部人工监督,切换到机器人自己跑出来的交互经验上。

人还在,但人不再是每一次模型更新都必须经过的瓶颈。

智元这次的 LWD,到底在做什么

正如我们前面所说,LWD 是一套比较系统的方法论。我们不重新概述整篇论文,找了几个亮点。

先简单说一下 LWD 到底是什么。

LWD(Learning While Deploying,边部署边学习)是一套面向通用机器人策略的「集群规模(fleet-scale)」强化学习框架。

这里的「集群规模」其实是一个很工程化的概念,但意思很简单:让一整批机器人一起学。

简单说,就是让一个预训练好的 VLA(视觉-语言-动作)模型先上线跑任务、自主收集在线数据,再把新数据和原本的离线数据混在一起重新训练模型,更新后再推回机器人继续跑,循环往复

这个循环就是 LWD 框架的核心。下面我们具体看看里面几个值得关注的点。

1)真实世界的「数据飞轮」开始转起来

LWD 的第一个核心,是一个由真实世界强化学习驱动的数据飞轮:

机器人集群在真实任务里执行 → 把执行轨迹(成功的、失败的、被人工介入的)回传到云端 → 云端用这些数据更新策略 → 更新后的策略再下发回每一台机器人。

这件事在 SOP 里已经有雏形。SOP 解决的是「在线后训练」这个范式骨架,LWD 则是第一次通过 RL 预训练+后训练,使得具身模型通过自主经验持续提升。

差别在哪?

SOP 阶段更接近「让机器人模仿做得更好的轨迹」,LWD 把训练目标换成了「让机器人去最大化任务的成功」。机器人除了重复学一遍人类示范,还会用自己的执行结果去判断哪种动作更接近完成任务。

飞轮的转速直接由集群的运行时间决定。机器人越多、运行越久,能用的真实数据就越多,模型更新得也越快。

2)把所有「不完美的轨迹」都用起来

第二个值得说的点,是 LWD 怎么定义「有用的数据」。

传统模仿学习里,能进入训练集的基本只有人类专家的成功示范,失败的、卡住的、被纠偏的轨迹会被当成噪声扔掉。

LWD 是强化学习框架,逻辑变了,它需要的是动作和结果之间的因果信号,失败和成功一样能提供这种信号。

它们会被放进同一个回放缓冲区,一起进入下一轮的策略更新。一个真实环境里跑出来的机器人,绝大多数轨迹其实都不算完美。

把不完美的轨迹也用起来,数据池才能跟着部署规模一起涨。

3)两个核心算法:一个负责「评估」,一个负责「改进」

把强化学习用在 VLA 这种通才策略上,把现成的 RL 算法拿过来直接跑是不行的。论文里花了挺大篇幅讲两个算法组件:DIVL 和 QAM

这两个组件都比较复杂,我们尽量简单说一下。

DIVL(分布式隐式价值学习)负责「评估」。

强化学习里要给每个动作打分,传统做法是直接预测一个数字。但放到真实部署里,数据情况比较复杂,单一数字容易跑偏。

DIVL 的做法是把「打一个分」换成「估一个分布」,也就是这个动作的得分大概率落在哪个区间,再从分布里取需要的值。这种方式比直接预测数字更稳。

QAM(伴随匹配的 Q 学习)负责「改进」。

现代 VLA 的动作要经过多步「画」出来才能输出(flow 或 diffusion 这种多步生成方式)。传统强化学习在这种结构上不太好用——要么算不出来,要么训练不稳。

QAM 的解法是不去碰整个生成过程的反向链路,只在每一小步生成里做一次微调,把动作慢慢推向更高分的方向。

DIVL 负责评估,QAM 负责改进,两者搭配。LWD 在离线和在线两个阶段都用这同一套算法,避免了之前一些方法在两阶段切换不同算法时的过渡问题。

4)统一的「离线 → 在线」训练流水线

LWD 把整个训练过程拆成两个阶段,但用的是同一套算法和同一个 learner。

【1】第一阶段是离线初始化,数据来源有三块:历史专家示范、过往策略跑出来的 rollout(成功和失败都有)、人工专门收集的失败模式探索数据。

【2】第二阶段是在线持续训练。

这种设计的意义在于离线训练得到的 critic 能直接用到在线阶段,避免之前一些方法在两阶段交接时出现的不稳定期。

5)真实物理集群上的验证

LWD 这次的验证是在真实硬件上做的。

平台是智元自家的 Agibot G1 双臂机器人,每台两条 7 自由度机械臂、3 个 RGB 相机,策略以 30 Hz 做关节位置控制,集群规模 16 台。

任务一共 8 项,分成两组:

第一组:商超动态补货(4 项):平货架补货、错放商品纠正、冷柜补货(开门)、开放式冷柜补货(处理纸箱)。主要考验语义识别和指令理解。

第二组:分钟级长程任务(4 项):调酒(8 个连续子步骤)、功夫茶(5 步)、鲜榨果汁(6 步)、装鞋盒(5 步)。

每集 3–5 分钟,单集十几次接触丰富的物理操作,对中间状态恢复和长跨度连贯性要求都比较高。

6)成绩单如何? 8 项任务平均成功率如下:

需要强调的是,这些结果是同一个通才策略跑出来的,不是为每项任务单独训练一个模型。

把 LWD 离线和在线对比,可以看到一个比较明确的趋势:随着真实部署的数据持续回流,模型在每一项任务上的表现都在变好。

这个趋势在长程任务上更明显。

除了成功率,论文里还报了周期时间(cycle time)。在长程任务上,LWD 的平均周期时间更少,方差更小。除了能做完,做的过程也比之前更连贯,少了反复尝试和卡顿。

离线数据以长时序任务为主,里面大约三分之一是失败样本。这部分数据在传统的行为克隆里基本会被丢掉,但 LWD 是强化学习框架,能把这些失败信号用起来,反而成了模型继续变强的关键来源。

视角拉「高」一点

把 SOP 和 LWD 放在一起看,会形成一条比较清晰的路径。SOP 解决的是范式问题,LWD 是在这个范式下面把强化学习真正放进去。

一个回答了「能不能学」,一个回答了「能不能自己变强」。

我们之前在《2026 开年 AI 对谈》播客里,戴雨森讲过一个观点:在预训练和后训练之外,决定下一阶段上限的「第三个口袋」,可能是 Online Learning,系统在部署之后还能持续吸收反馈、调整自己行为的能力。

LWD 把这个判断又往实操层面推进了一点距离:

Online Learning 这一层之上,得有 Online RL 把成功和失败的信号都用起来,这件事在通才机器人策略上才算真正落地。

当机器人能从自己每一次执行里继续变强,部署本身就从一个终点,变成了另一段进化的起点。

智元这次发的论文,是这条路径上的一个具体的进度节点。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。

如果你写过类似文章:《实测 PixVerse C1》、《实测 LibTV》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。

我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪