产品

VLA

Vision-Language-Action

VLA(Vision-Language-Action,视觉-语言-动作模型)是具身智能领域将多模态感知直接转化为物理动作的核心技术路线。它的本质是把视觉、语言指令与机器人状态信息映射为控制信号,而非生成语言描述——这与传统 VLM 存在根本差异。

当前 VLA 的能力增量主要体现在三方面:覆盖非结构化场景、扩展至柔性及异形物体操作、降低工程配置门槛。但工业场景中的落地边界同样清晰:传统工业机器人可达 80–150 次/分钟的节拍,而 VLA 端到端执行普遍停留在 10–15 次/分钟,且难以稳定输出亚毫米级精度。

技术路线上,VLA 正经历从单一架构向分层协同的演变。智元机器人提出的 ViLLA 架构引入隐式动作标记,由 VLM 负责场景感知、Latent Planner 进行高层次规划、Action Expert 输出精细动作,试图弥合图像-文本输入与机器人执行之间的语义鸿沟。自变量机器人的 WALL-A 则尝试将 VLA 与世界模型深度融合,利用时空状态预测提升零样本泛化能力。

关于 VLA 与世界模型的关系,业内尚未形成共识。一种观点认为二者存在某种"共轭关系"——VLA 提供行动准则,世界模型预测环境反馈;另一种判断则更为激进,认为传统 VLA 依赖行为克隆、扩展性受限,JEPA 等替代框架可能重构技术栈。蓝驰创投曹巍的判断是,具身智能整体仍处于技术栈非常早期的阶段,持续学习、真实世界数据压缩等问题尚无统一答案。

由 AI 生成,可能出现错误,请仔细核对内容。

VLA产品
Vision-Language-Action
渲染中…
在 21 篇文章中被提及

相关报道