VLA模型
Vision-Language-Action Model
VLA(视觉-语言-动作模型)是物理AI的重要分支,代表传统多模态大模型向行动能力的延伸,构建"多模态输入→动作输出"的端到端系统,让机器人能够"看到+理解指令→立即执行"。据峰瑞资本2025年底的报告,这类模型更适合结构清晰、任务明确、响应迅速的短期操作场景,如仓储物流、辅助驾驶等。
技术路线上,VLA通常以预训练的VLM(视觉-语言模型)为基础,根据指令提示和传感器输入训练输出控制信号。早期做法让LLM直接输出控制信号,较新的尝试如𝝅0.7则引入独立的"动作专家"模型来对接LLM。星尘智能与顶尖院所提出的CLAP框架则采用两阶段设计:先通过对比学习建立跨模态对齐的共享潜在动作空间,再分层训练"下一词元预测"VLA和包含Rectified Flow动作专家的精确控制模型。
2026年以来,这条路线正加速开源与产业化。蚂蚁灵波在1月开源了LingBot-VLA,代码、权重与工具链一并放出;逐际动力的FluxVLA Engine作为企业级开源平台,已支持人形机器人全身移动操作与模型训练。不过,VLA与世界模型的关系仍是行业争论焦点——前者侧重"完成任务",后者强调对环境的理解、预测与模拟,两者可能互补融合而非互斥。
由 AI 生成,可能出现错误,请仔细核对内容。
VLA模型产品
Vision-Language-Action Model
渲染中…
在 7 篇文章中被提及
相关报道
具身领域每家公司可能都是靠谱的,关键看是否想清楚自己要成为谁 | Linear Voice
具身数据基础规模是1000万小时或更多。
元戎启行自研 VLA 落地,首批合作量产车即将上市 | 云启伙伴
开启“防御性驾驶”时代
码荟创业者 I 王兴兴:人形机器人大规模应用的最大问题是具身智能
码荟成员企业、宇树科技创始人兼CEO王兴兴在2025世界机器人大会上,分享了他对全球机器人行业发展的最新观察和独到见解。
云启伙伴 | 元戎启行 x 火山引擎,携手加速Agent上车
从驾驶工具到智能体,汽车正在进化
云启伙伴 | 天使轮项目「元戎启行」获1亿美元C1轮融资,高阶智驾量产加速中
还将探索Robotaxi规模化运营
云启季刊 | 我们是星尘,想象着宇宙
夏秋时节的新实践、新突破、新思考
机器人ChatGPT来了:大模型进现实世界,DeepMind重量级突破|蓝驰分享
具身智能不远了?






