产品

VLA模型

Vision-Language-Action Model

VLA(视觉-语言-动作模型)是物理AI的重要分支,代表传统多模态大模型向行动能力的延伸,构建"多模态输入→动作输出"的端到端系统,让机器人能够"看到+理解指令→立即执行"。据峰瑞资本2025年底的报告,这类模型更适合结构清晰、任务明确、响应迅速的短期操作场景,如仓储物流、辅助驾驶等。

技术路线上,VLA通常以预训练的VLM(视觉-语言模型)为基础,根据指令提示和传感器输入训练输出控制信号。早期做法让LLM直接输出控制信号,较新的尝试如𝝅0.7则引入独立的"动作专家"模型来对接LLM。星尘智能与顶尖院所提出的CLAP框架则采用两阶段设计:先通过对比学习建立跨模态对齐的共享潜在动作空间,再分层训练"下一词元预测"VLA和包含Rectified Flow动作专家的精确控制模型。

2026年以来,这条路线正加速开源与产业化。蚂蚁灵波在1月开源了LingBot-VLA,代码、权重与工具链一并放出;逐际动力的FluxVLA Engine作为企业级开源平台,已支持人形机器人全身移动操作与模型训练。不过,VLA与世界模型的关系仍是行业争论焦点——前者侧重"完成任务",后者强调对环境的理解、预测与模拟,两者可能互补融合而非互斥。

由 AI 生成,可能出现错误,请仔细核对内容。

VLA模型产品
Vision-Language-Action Model
渲染中…
在 7 篇文章中被提及

相关报道