码荟创业者 · 2025WRC系列 | 关于具身智能,听听三位创始人怎么说?
8月8~12日,备受瞩目的机器人行业盛会——2025世界机器人大会(WRC)在北京亦庄举行。今年大会的主题为"让机器人更智慧,让具身体更智能",共吸引了200余家国内外优秀机器人企业携1500余件前沿展品参展,其中人形机器人整机企业数量更是创下全球同类展会之最。


8月8~12日,备受瞩目的机器人行业盛会——2025世界机器人大会(WRC)在北京亦庄举行。今年大会的主题为"让机器人更智慧,让具身体更智能",共吸引了200余家国内外优秀机器人企业携1500余件前沿展品参展,其中人形机器人整机企业数量更是创下全球同类展会之最。
2025世界机器人大会期间,工信部中小企业发展促进中心联合源码资本等于8月10日上午举办了主题为「产融链动:重构机器人从实验室到产业的价值密度」的论坛,码荟成员企业——银河通用创始人&CTO王鹤、梅卡曼德创始人&CEO邵天兰、斯坦德创始人&CEO王永锟等三人做了主题演讲,分享了各自在机器人领域的最新探索成果,以及对中国机器人行业的观察和思考。
以下特收录了三位创业者的主题演讲内容,有适当删减:
1
银河通用机器人
创始人&CTO王鹤:
庞大的数据需求是具身智能领域要突破的第一关

今天非常高兴跟大家分享下,银河通用从合成数据驱动的技术闭环到人形机器人产业化落地的相关进展。
先简单介绍下银河通用。我们成立于2023年5月,也是由北京大学和北京智源研究院孵化,得到北大批准合法转化的新兴具身智能企业。从成立之初到今天两年时间,银河通用已经发展成为10亿美金的独角兽。我们给自己定的使命就是,让通用机器人服务千行百业、千家万户。
为什么银河通用能在两年时间内走的这么快呢?这肯定跟我们的定位分不开,就是要做真正有生产力的人形机器人。大家都知道,今天人形机器人的市场很火热,但从长远来看,一定要让机器人有真正的生产力,才能帮助应对国家未来长期的制造业和经济发展需求。
刚才有嘉宾讲到,是不是有数据就能解决所有问题?这很难回答,但是我知道,**具身智能现在最大的问题是连数据都没有,没有数据不能解决问题应当是更难或者是不太可能的,**所以现在以特斯拉为代表的国外和国内企业都在疯狂雇佣人才采集数据。但机器人的数据采集要难得多,用户把汽车开上路,数据就回流了,但机器人不是这样的。
人形机器人现在是向遥操作员付费,用这样的方式让他们去采集数据。这样的遥操作比自己干还要累,但在目前的情形下,雇佣人采数据,既没有机子,也没有足够的钱、足够的人来采。其实,具身大模型需要的数据量和图文模型都是相当的,都是在万亿Token的水平,我们与已有的真实数据还有三、四个数量级的差别,这就是具身智能领域当下第一个一定要突破的难关。如果有了足够多的数据,能否训出具身AGI,就不用多说了。
现在模型到底到没到AGI的程度呢?如果具身智能今天可以到ChatGPT、DeepSeek的水平,相信对大家的生活会有极大的帮助,但是我们离它还很远,因为连数据都没有。在这条路上,我从北大实验室到之前在斯坦福大学读博士,主要的思想就是解决具身数据荒、真实数据贵的问题,用的方法就是大面积采用物理的仿真和合成,首先有大量3D的数字资产,在此之上进行大规模的动作轨迹合成,或者是强化学习,来生成这些操作的轨迹,最后通过从仿真到真实的方法,让最后的训练模型在真实世界可以工作。
一言以蔽之,今天整个链条都已经打通,许多大量的机器人技能完全是以合成数据为训练数据,或者说99%是合成数据,只有1%是真实数据。数据的管线是先把机器人的动力学和运动学的模型建立好,把物体资产和材质、光照等环境资产,一同构成一个环境,在机器人有环境物理的情况下,用合成数据管线生产出动作,再用仿真器进行检验,保证动作都是对的,都可以干事,最后再用消费级的显卡把它们全部渲染出来,就能得到大量的合成数据。
举个例子:这就是我们合成的在上百万个房间做各种各样抓取的,是人类第一个10亿级的抓取合成大数据。用这样的合成大数据,训练出来世界上第一个抓取的基础大模型GraspVLA,真正实现在任何环境里,换各种各样的光照,都让它抓取鸭子,我们的模型全部都能在这些环境下成功的进行抓取。这些灯光光照包括桌面的所有物体都是没有训练过的,充分体现具身大模型的泛化性。比如让他抓购物车,抓挖掘机,抓游泳眼镜,抓测电笔,一句话就能让模型干起活来。

与特斯拉的遥操相比,做电池分解采了10万条数据,40个人一个月的量。我们基于基础抓取大模型,去做这样的工作只需要200条数据,一个人半天的时间就可以完成数据采集,比如采集在怡宝的这瓶水上,可以测试在农夫山泉和东方树叶的水箱中,体现零样本的泛化性;可以发现水瓶的颜色、一排有几个、高度,瓶盖大小,都跟怡宝发生了变化,机器人仍然能够泛化的对它进行处理。
这就显示**具身大模型真正的价值,就是要有举一反三和涌现的泛化能力。**GraspVLA模型在这次的世界机器人大会和上个月的世界人工智能大会上都第一次展出完全真实的货架,用户可以下单各种各样的东西,挂装的、软包装的、各种瓶装的酸奶、饮品,还有膨化食品等等全部都能送到你身边,这也是目前具身领域目前第一个能够一口气处理几十样不同形态、不同软硬度物体的大模型。
这个背后如果全靠真实数据采集,其实要花很大的功夫,对用户来说完全换不回来这笔账,所以它99%以上的数据体量都来自于合成数据。我们在这次的世界机器人大会现场也是第一次展示了强劲升级、左右开弓、一心两用,大家利用这个模型可以一次下单两个物品,只要处在双手可抓的区域里,就可以同时抓取,也不一定是瓶装,也可以一个拿袋儿、一个拿瓶儿。
相较于WAIC期间,GroceryVLA大模型在过去两周又迎来了升级,已迭代增加了能双手同时取货的功能。这系列能力的升级都离不开我们对合成数据的使用,包括对人类跟随的合成数据,都是合成的,不是真实的。

数据训练出来的模型,能够让机器狗跟着大家逛商场,这是六一儿童节当天在北京万达商场的实机拍摄,没有任何的遥操,这是模型实时的视觉输入,以及给出的机器人实时运动轨迹的预测,让它下一步怎么走,可以看到环境里有各种各样乱七八糟的东西,包括灯光也是变来变去,行走的过程中也有非常多的人去阻挡。
总的来说,我们这种以虚实融合的方式采集数据,来源是学术界的点子,真正用到了产业当中,现在已经落地。一个很鲜活的例子:我们在全球第一个落地机器人24小时智慧零售仓。今天在北京,大家如果在线上平台上下单买药,药店里头有一定概率是银河通用的人形机器人在里面取药,北京现在有10家店,都是真实在应用。今年底,我们将北京、上海、深圳等城市开100家这样的药店。
所以我一直相信技术路线能够真正让人形机器人快速从商业、工业、康养、医疗等一系列场景真正应用起来。
2
梅卡曼德
创始人&CEO 邵天兰:
具身智能真正的关键在于智能,而不在于形态。

今天希望给大家分享下,梅卡曼德对于具身智能技术的演进与商业上的一些观察。
先说应用场景,我们比较粗略的分了三大类:第一类服务于物品,最典型的是制造、物流,最后的目的是为了让某一个物体被制造出来、被加工或者被转运;第二类是直接服务人,最典型的比如餐厅、医院、酒店、家庭等,最后的目的就是为了直接服务每一个个体;第三类是科研、教育、娱乐等,是介于直接服务于人和服务物品之间的,提供知识、情绪价值等。
梅卡曼德的做法是从左边往中间做,先做制造、物流的场景。当然,也有一些公司是从右边开始做,比如一些人形机器人企业是先从科研、教育、娱乐开始做。左边和右边其实都比中间的"服务人"相对容易一点。我们在做这类场景选择时其实是根据一些维度综合判断而来,最主要的考量因素包括环境可控性、付费能力、用户专业性和每个岗位的任务种类。

比如直接服务人的场景,环境可控性非常低。最典型的就是家庭,我们自己都控制不了自己家庭的每一个细节;咖啡店、酒店这类场景,随机性也都非常大,同时付费能力也比较低,跟制造业没法比。
用户是否专业人士也很关键,我们甚至认为这是最严重的挑战,因为用户如果不是专业人士意味着场景使用非常开放,要面对很多潜在的安全性问题。在工厂里,机器人产品都是由专业人士操作,并且经过培训,还有专门的守则;一旦到了商场、酒店里面,不可避免的会有很多小孩子,或者对技术完全不熟悉的人跟机器人交互,这时候安全性的问题就非常显现了。用户的付费能力通过产品的AI程度提升,成本降低还能解决,但用户专业性问题很难解决,这就是为什么直接服务人的场景会很困难。
在技术演进上,我还特别想讲一件事:人工智能是具身智能机器人里最关键的部分,是真正的智能。但现实中存在着一些虚假智能,比如机器人展示的固定动作,这不是真正的智能,遥控操作也不是真正的智能,仍然属于L0或L1级别的智能,也就是固定动作或者遥控操作,或者此基础上做一些微调,如平衡、变换等等。
梅卡曼德是全球首家实现机器人L2级别智能规模化应用的公司。L2虽然仍然是单一任务,但里面需要做的自主决策非常多,特别是在视觉和动觉上,就是感知环境、理解环境,做出相应的决策,L3级别最大的特点就是多任务性。
在智能程度的演进上,我个人判断是这样的:此时此刻L2的智能有很好的进展,过去几年间已经看到有很多应用和快速的增长,但渗透率依然有一百倍级别的增长空间,所以未来几年L2的大量增长是可预见的,而L3级别的落地在可见的未来也是可以预见的事情,我们在此事上也有非常好的进展。
在刚刚结束的WAIC(世界人工智能大会)上,我们有展示包括机器人自主叠衣服、人形机器人到货架取货,还有现场连续不断的去展示灵巧手来操作多种物品,以及像操作透明的物品,还有各种各样的通过自然语言就可以下达的指令,这些都是现场、连续的展示。
我们在制造物流场景里面,一分钟做10次操作是非常常见的,我们在工厂里面能做到1.5秒左右一次,一分钟40次操作。一个千分之一错误率的机器人,每两三个小时左右出一次错误是可以接受的;如果是百分之一的错误率,就意味着每5-10分钟就出一次错,操作者出去吃饭的时间都不够。这是一个很大的差别,既是很低的要求,也是很重要的事。通俗来说,机器人出问题的频率要给操作者留出吃饭的时间,这个是我们现在所能够做到的。
我认为,具身智能真正的关键在于智能,而不在于形态。 我们最大的设备是三、四十米长,几十吨重的工业里面的桁架;我们做过比较小的设备,就是操作微米级别的东西。形态的大小对我们来说没有区别,在数据上都是可以操作的机器人罢了。
这种情况下,今天能够做到长时间连续稳定运行,并且达到客户ROI合理形态的机器人很多了。比如工业机器人就已经达到了,协作机器人也已经达到了,复合机器人正在快速接近,并且在局部已经超过了这个点。人形机器人还在努力当中,已经有了非常明显的进展,但还需要一点儿时间。

梅卡曼德的机器人现在服务于非常多的场景,配合的设备也非常多,覆盖的行业也非常多,做的工艺也非常多,能够处理的物品也非常多。但是我们只有一款软件,没有一行代码是定制的,我们有一半业务来自于海外,并且保持了很高的增长,年落地量达到万台了,机器人背后的代码也是一模一样的,这就是正常的通用性。
通用性有时候也有一些虚假性,比如大家很容易幻想人形机器人什么都可以用,但它跑的程序很可能是专用的,最后发现它只干一件事情,比如跳舞、去抓货、搬箱子,这其实不是真正的通用性。可以骄傲的说,我们现在真正实现了通用,同样的相机、同样的软件配合各种各样的设备。
当然,我也认为通用性是有边界的,不是所有的事情都可以通用。 我们认为眼、脑、手,是通用性相对比较好的,人都不是通用的,因为人从身体角度讲有高矮胖瘦,每个人都不一样。随便举个例子:在汽车厂操作零件和轮胎的装配,物体的大小、尺寸、重量各方面都是不一样的,有时候就要处理几十米长的物件,这个时候机械部分就很难完全通用化。
再比如搬运钢板,找八个人形机器人转一圈,像人一样一起去抬,这个效率就很低。我的看法是,机械设备上很难应用通用性机器人,主流的工业机器人厂家普遍有200个型号以上。这就可以反映出,工业机器人现在结合其中一部分形态,还有其他的形态,最终至少要有上百种形态才可以覆盖比较主流的一些应用。
真正的通用性来自于几个地方:首先是在"眼睛"的部分,一定要好。好的东西都一样,不好的东西各有各的不好。什么意思呢?当它的感知非常准确,噪声很低,没有很大的形变,就是好的。我们的产品针对于半透明的物体,针对于环境光干扰表现都很好,这就可以给后面智能算法泛化带来非常好的助力。

其次是"大脑",为机器人提供标准化、通用化软件,能够适应众多场景的复杂环境。最后是"手",可以适应各类机器人形态,抓取各种常见物体。
我们做的是人工智能,不是模仿。我特别想给大家科普一个知识:人工智能不是魔法,我们不能对抗数学和物理定律。 当你的输入里面,信号质量不够好、噪声水平过高,或者有很多模糊性的时候。人工智能即便再强大,也不能达到99.99%的正确率。比如传感器,使用一些效果不是那么好的传感器也可以达到一定的效果,也可以做到DEMO,但当我们希望能在非常普遍、各种各样的现场都达到千分之一的输入率,甚至是万分之一输入率的时候,就对传感器的要求更高了。
所以我一直很有定力,梅卡曼德是一家真正做通用化的公司。原因很简单,客户的需求注定是细碎和分散的,这是机器人的宿命。我希望我们的产品是可以配置、可以编程,可以通过它的智能化解决很多行业的问题,属于通用设备。我们为所有行业、所有客户交付的都是一套软件。
这其实很难,因为最后会发现在每一个现场都会带来10倍的挑战。给客户提供一个定制化的东西,和给客户做通用化的东西,让通用能力覆盖到特定需求,后者比前者难10倍。但当每一个现场都难10倍,把它全部加起来,真正做好之后就可以复制开来。
最后我想说:虽然梅卡曼德已经做到了全球化、标准化、通用化,MIR睿工业报告也显示我们在中国市占率连续五年都是第一,是第二名的将近4倍,在欧美、日韩也都是市场第一名,但我们仍然认为,机器人是一个非常非常系统性的工作,也是一个短板效应。大家先结合已经能够做规模化落地的领域比如工业机器人、协作机器人、复合机器人去做探索和突破,现在跟人形机器人也有配合,但最后一定是每个环节都要顶住,整体的可靠性、成功率要靠每一个部分完成。
斯坦德
创始人&CEO王永锟:
具身机器人的主要瓶颈在"智能软件"

我毕业于哈尔滨工业大学,学习的是自动化专业,2015年硕士毕业就直接出来创业。创业之初,我就把目标写在了公司的名字里——斯坦德机器人,希望为行业提供标准型机器人。
我们最早选择进入工业赛道,核心有两点考量:一是因为国家在当时发布了一系列有关制造业的顶层规划,为中国智能制造产业的发展制定了十年发展目标,其中特别提到了要在生产制造环节应用推广自主智能型性机器人,不过现在这个词变成了具身智能。早在10年前,我们看到了这个巨大的机会,是奔着这个目标来的。
二是我们当时的目标是做一个技术领先型的企业。在工业界、商业和民用场景中,我们认为工业的技术更能长期去沉淀,更具备成长性,所以最终选择进入工业赛道。进入这个领域之后,斯坦德给自己定了一个长期的使命、愿景:希望以自动化、数字化、智能化的技术来推动智能制造的变革,推动机器人向更通用、更智能的方向迭代进化,为全球工业提供标准化的智能制造解决方案。
斯坦德从创立初始就扎进了工业赛道。我们追求的是在行业内从移动机器人出发,基于对环境的理解,在其上面加装不同的模组,比如从早期的顶升模组、传输模组、牵引模组,到现在加单臂、双臂,最终机器人可实现的功能越来越丰富。
我认为,在中国会率先诞生出应用在工厂里的具身智能机器人和通用型机器人。中国拥有全世界最丰富的工业产业链和应用场景,而这正是机器人最佳的练兵场。 因为拥有场景就能拥有数据,拥有数据才能拥有智能,拥有数据理解和工艺理解才能够演化出通用性和智能性。
我们真正聚焦在一线制造业场景中,为客户从替代人工上创造增量,而不一味追求不切实际的通用性。在一线场景中发现真实问题,而非在实验室臆想产品功能。当然,这其中的难点就在于工厂场景的准入和行业Know-How都非常高。身处这个行业我们可以看到,很多产品大部分都靠想象,一旦真正进入到实际工业场景就会出现非常多长尾问题,而这需要深入一线才会发现。

比如汽车行业。在以前,因为车有很多配置,你买了一个不同型号、不同颜色的车,但工厂不是按照下单顺序生产,是先生产下单多的车,所以你下单早并不一定就提车早。但现在有些工厂可以实现完全按照订单生产了,只要你先下单,无论什么配置都能生产。因为工厂里生产的100台车,可能都是截然不同的配置。这种需求就要求所有的信息系统和执行单元,从工艺的配合、物流设备的配合、机器人的配合到人的配合,都是高度定制化、高度柔性化的设计。
斯坦德的目标是,希望通过具身智能技术在工厂里打造"超级工人"(Super Worker)。
我们是工业AMR的赛道里成立较早的公司,在很多核心技术上都是行业领先。但客户并不在乎这些技术领先性,他们最在乎的是八个字:安全、可靠、智能、高效,这是技术有效的前提。斯坦德的做法是:我们通过自研底层技术、单一核心技术平台的持续迭代来实现安全可靠,通过积累大量场景、合理分配多台机器人执行任务实现智能高效。
当前,具身机器人领域的主要瓶颈不在于硬件,而在于赋予机器人自主决策能力的"智能软件"。
机器人操控的本质,是与物体发生"物理接触",而"物理接触"这个行为会让问题的难度呈指数级上升,跟自动驾驶的难度是完全不同的。如果机器人能按照一套完整的步骤来思考和执行任务,效果可能会更好,这正是我们引入分层架构的原因。
在技术路径上,我们认为端到端VLA是一个潜力巨大的未来方向,但它在当前不是解决工业场景问题的唯一方式。我们采用的是大脑与小脑分层、单体智能和群体智能的混合架构。这是一条更务实、更安全、更落地、也更能快速为客户创造价值的技术路径。
单体智能方面,我们希望一台机器人能够逐步迭代,实现从自动驾驶到移动操作再到具身智能。我们采用快慢系统的方式,通过大小脑的分层架构,借助通用推理模型加上确定性的执行任务来保证整个机器人的执行效率。
而在群体智能方面,实际的工业场景绝不只有一台机器人。即使是一台进化完整的超级机器人放在工厂里,它也需要由信息系统下达指令,而不是人为下达,同时也需要跟其他设备和机器人进行交互,才能完成任务。
我们通过RoboVerse实现跨形态的集群协同、客户系统协同,而非只强调单体的通用能力。借此更快打通"真实场景应用-数据飞轮-智能提升-加速量产"的完整商业闭环,在规模化商业落地实现智能性的成长。现在大家过分强调单体智能的通用性,群体智能反而显得至关重要。
所以,更符合工业现实的VLA路线,是一种VLM赋能+确定性执行的大小脑分层的VLA架构。

人形机器人是机器人形态重要补充但不是唯一,制造业需要各种形态的机器人和专用设备处理不同的场景和工序。
斯坦德认为,工业场景里会长期存在着专用型和通用型机器人,不同厂家、不同品牌的机器人共存。因此,需要统一的协议、统一的软件环境去控制调度,让多种类型机器人在同一个场景里相互协作、共同完成作业任务。我们希望所有的机器人都说"普通话",这是我们开发RoboVerse的初衷和意义。
就中国制造产业的智能化来说,我认为需要经历四个步骤:
先是工人机械化。大量机器人公司,无论是做工业机器人还是做其他类型的机器人,都在金字塔最底端,因此工人机械化的目标一定是由成百上千家公司一起实现的;然后是管理软件化。在一个场景内,一定需要一个软件来统筹管理各种类型的机器人设备、信息等等;再是工厂数字化。有软件才能有数据结构,有数据结构才能沉淀出数据,有数据才能诞生出最后的数据智能化。最后在前面三个都实现的基础之上才能实现制造智能化。
这四个步骤就是金字塔的形状,一层层往上。很多公司是从上往下做,从智能化到工人机械化,一定不可能成功。我认为一定是从下往上做,没有下面的基础,制造业的智能化都是空中楼阁。

斯坦德的目标是,希望专注在工业领域上,并通过四个五年发展规划,用二十年的时间,成为真正意义上的从机器人底层技术出发、打通从下至上技术链条的中国智能制造引领者,从中国的斯坦德成为世界的STANDARD。





