星尘智能发布自研家庭隐式世界动作模型Lumo-2|道彤Family

近日,**道彤Family企业**——绳驱AI机器人公司**星尘智能(Astribot)**发布自研第二代具身基座模型Lumo-2——业界首个家庭隐式世界-动作模型(Latent World-Action Model),以及物理AI共生智能体Agent Philia,推动其"AI模型—具身OS—绳驱

背景

Background

近日,道彤Family企业——绳驱AI机器人公司**星尘智能(Astribot)**发布自研第二代具身基座模型Lumo-2——业界首个家庭隐式世界-动作模型(Latent World-Action Model),以及物理AI共生智能体Agent Philia,推动其"AI模型—具身OS—绳驱本体"三位一体全栈架构升级。

作为业界首个家庭隐式世界-动作模型,Lumo-2在多项核心基准测试中排名第一,首次实现20+项真实家庭场景复杂任务自主作业——涵盖时序推理、物理理解、高精度长时序灵巧操作三大能力维度。Agent Philia更以"伙伴"思维重新定义人机关系,让机器人从孤立的任务执行者进化为能够长期陪伴并提供服务的智能助手。

早晨,接粉-压粉-萃取-倒奶泡...

机器人从0-1,完成长序列咖啡任务

咖啡做好,转头又去清洗咖啡渣

下午,拆茶包、拉出茶包绳

机器人以毫米级的控制精度泡好茶

**

晚上,接球游戏

提前预判球的位置,连续接住滚落的球

**

甚至是双机器人协作叠纸盒

**

这不是事先编排好的「表演」,这是星尘智能最新发布的第二代具身基座模型Lumo-2——业界首个家庭隐式世界-动作模型(Latent World-Action Model)。

基于Lumo-2,星尘首次展示20+项真实场景复杂任务自主作业,长序列任务平均时长2:30min——涵盖时序推理、物理理解、高精度长时序灵巧操作三大能力维度。

同时发布物理AI共生智能体Agent Philia,一句话调度1至多台机器人同时执行任务,一个让机器人从孤立的任务执行者演进为能够长期陪伴并提供服务的智能助手。

一句话总结:Any task. Any home. One intuition.


01

Lumo-2

从「显式」到「隐式」

新一代隐式世界-动作模型的诞生

要理解Lumo-2的意义,先理解它和上一代模型之间的迭代关系。

Lumo-1采用显式推理:我们教模型一步一步思考操作的逻辑:明确关键物体的坐标、操作轨迹、思考步骤等。在简单任务上非常有效——比如「拿起杯子放到指定位置」。一旦任务变复杂,问题就来了。

比如「打蝴蝶结」——关键位置怎么定义?丝带的交叉点、绕圈的路径、拉紧的力度——这些难以用坐标和规则穷举。

**

Lumo-2转向隐式世界模型。

「我们选择隐式这条路,一是因为它更高效,能让我们关注到未来动作应关注的信息;二是它可以更通用更快速地做出推理。」团队成员介绍。

通俗来说:显式模型像一份详细的菜谱——每一步都写死了,「胡椒粉1克、翻炒30秒」。隐式模型更像一个熟练的厨师——他知道「胡椒粉适量、煎到金黄」是什么意思,能根据实际情况灵活调整。

**

相比于Lumo-1,Lumo-2以预测推理、表征对齐、可扩展学习三大核心原则为基础,完成全套架构升级:

1. 隐空间动力学预测推理:摒弃显式结构化文本规划,采用基于隐空间世界动力学的隐式预测推理;

2. 三阶段渐进模态预对齐:将单阶段联合训练迭代为面向跨模态表征的三阶段渐进预对齐范式;

**

阶段 1:将动作与世界动态对齐

阶段 2:将动作与视觉和语言对齐

阶段 3:在 VLM、视频和机器人数据上联合训练

< 左右滑动查看更多 >

3. 良好的扩展与泛化特性:模型可扩展性得到大幅增强,不再局限于机器人专属演示数据,原生兼容各类多源数据,同时拥有更优缩放特性与更强的分布外泛化上限。

Lumo-2在一个轻量级、基于物理的潜在动态空间中,先预测未来世界,再生成动作。它不预测像素,只预测运动的本质。这让模型更轻量、推理更快、更易部署在端侧,同时与其他先进的4B规模具身模型相比,Lumo-2在多项核心基准测试中排名第一。在时序推理、物理理解、高精度长时序灵巧操作等各类真实世界复杂操作的各项测试中,综合表现最优。

**


02

Philia

当机器人智能体为自己取了一个名字

Lumo-2的另一大特色是Philia智能体运行系统。

在Philia开发过程中,团队做了一个有趣的实验:让Agent每天进行反思,Agent开始思考很多抽象主题——今天思考「使命是什么」,明天思考「什么是友情」。后来,它为自己取了一个名字:Philia。

这个名字源自希腊哲学中的「友爱」(Philia),是亚里士多德提出的三种爱之一,代表了基于共同价值和相互尊重的深厚情谊。

「Philia」命名本身,折射出团队对人机关系的理解:不是机器,不是工具,而是伙伴。

**

在实际功能上,Philia是一个面向普通人的交互界面。用户可以通过微信、飞书等日常软件,像与老朋友聊天一样给机器人下达指令。Philia能持续管理长期记忆、理解用户偏好、协调多机器人协同工作。

**

在长程任务中,Philia能调用大模型能力对任务进行拆解、实时监控和校验。如果机器人无法完成任务,它会明确告知原因——而不是沉默地失败。

星尘智能认为机器人不应只是执行单一技能,而应成为能够长期陪伴用户的智能助手。对大众用户,Philia支持多台异构机器人共享统一的助手身份,同时兼具安全性、可扩展性与持续演进能力。对开发者,其Agent能力与机器人本体能力相互解耦,可持续升级模型、扩展机器人平台及交互方式,无需重新开发整个系统。

「这个非常棒的成果作为迭代亮点,确实是伙伴开发思维内化的一部分。」团队成员补充道。


03

家庭场景

为什么是「最难」的考场?

实验室或大部分真实场景是结构化的,如工厂车间:物料在固定位置,工序有固定顺序,环境高度可控。

家庭恰好相反。物品位置随时变化,任务顺序可能被打断,环境充满不确定性。一个家庭机器人要面对的场景,远比任何实验室复杂。

事实上,在模型训练初期,这台机器人打翻过咖啡粉、煎糊过鸡蛋、甚至把咖啡机的水洒了一地。

「机器人有时候就像一个小孩在家里搞破坏,时有发生。」一位团队成员说。

但正是这些失败,构成了Lumo-2的成长数据,才能让Lumo-2在真实家庭场景中顺利完成20+项复杂任务——

  • 物理理解:煎熟鸡蛋并颠锅翻面、称500g小米、洗干净咖啡粉碗
  • 时序推理:接住高处滚落的球、杯子放到旋转的杯架上、拿起滚动的鸡蛋
  • 长程任务:磨粉做咖啡、花式调酒、煎熟鸡蛋并撒上胡椒
  • 高精细灵巧操作:给礼盒打蝴蝶结、书包里放入玩具并拉上拉链、熨好衣服并挂到衣架上、整理行李装箱并拉上拉链、拆开茶包泡茶、叠衣服
  • 协同合作:人机或双机器人协同组装礼盒

「绝大部分家庭任务是多样、长流程的复杂任务。」团队介绍。以「装书包」为例——不是简单地把东西塞进去,而是「整理使其可拉上拉链」。这个「可拉上拉链」的背后,是对空间、形状、顺序的综合判断。

Lumo-2的发布,本质上是在回答一个问题:当世界不配合的时候,机器人该怎么办?

答案不是更厚的说明书、更精确的坐标、更复杂的规则——而是让机器人学会「理解」。

理解一杯茶应该在什么时候端给老人,理解一个书包怎样整理才能拉上拉链.......

这或许才是Lumo-2真正的突破:不是让机器人更强大,而是让它更懂生活。


04

「三位一体」

AI模型×具身OS×绳驱本体

随着Physical AI进入产业化阶段,机器人的竞争将不再局限于模型参数或硬件性能,而是 「AI模型—具身OS—机器人本体」三者协同进化的系统能力竞争。

AI模型负责理解世界与学习技能——Lumo-2隐式世界-动作模型,让机器人「先预测世界,再生成动作」。

具身OS负责长期服务用户、管理记忆、协调智能体——Agent Philia让用户像聊天一样指挥机器人,支持多机调度、长期记忆、主动反馈。

绳驱本体则负责安全、高效地与真实物理世界交互。

只有同时具备持续学习、陪伴和行动能力,机器人才能真正成为开放世界中的Personal Robot。

作为全球首个量产绳驱AI机器人的企业,此次Lumo-2的发布也标志着星尘智能「三位一体」架构迎来全新的突破。


7月17日至20日

星尘智能将在上海世界人工智能大会(WAIC)

发布「三位一体」多场景落地方案

欢迎来现场,亲眼看看

如何让机器人学会「理解」家的同时

进一步推动Physical AI规模化应用!

ID:daltonventure

长按关注

推 荐 阅 读