VLA
Vision-Language-Action
VLA(Vision-Language-Action,视觉-语言-动作模型)是具身智能领域将多模态感知直接转化为物理动作的核心技术路线。它的本质是把视觉、语言指令与机器人状态信息映射为控制信号,而非生成语言描述——这与传统 VLM 存在根本差异。
当前 VLA 的能力增量主要体现在三方面:覆盖非结构化场景、扩展至柔性及异形物体操作、降低工程配置门槛。但工业场景中的落地边界同样清晰:传统工业机器人可达 80–150 次/分钟的节拍,而 VLA 端到端执行普遍停留在 10–15 次/分钟,且难以稳定输出亚毫米级精度。
技术路线上,VLA 正经历从单一架构向分层协同的演变。智元机器人提出的 ViLLA 架构引入隐式动作标记,由 VLM 负责场景感知、Latent Planner 进行高层次规划、Action Expert 输出精细动作,试图弥合图像-文本输入与机器人执行之间的语义鸿沟。自变量机器人的 WALL-A 则尝试将 VLA 与世界模型深度融合,利用时空状态预测提升零样本泛化能力。
关于 VLA 与世界模型的关系,业内尚未形成共识。一种观点认为二者存在某种"共轭关系"——VLA 提供行动准则,世界模型预测环境反馈;另一种判断则更为激进,认为传统 VLA 依赖行为克隆、扩展性受限,JEPA 等替代框架可能重构技术栈。蓝驰创投曹巍的判断是,具身智能整体仍处于技术栈非常早期的阶段,持续学习、真实世界数据压缩等问题尚无统一答案。
由 AI 生成,可能出现错误,请仔细核对内容。
相关报道
哪条路线,才能通往「世界模型」的终局?|对话黄碧薇:Aether AI 创始人
因果世界模型,一种 AI 新范式
图灵奖得主押上 10 亿美元的「世界模型」,是AI 的下一个十年?(下)
真正的智能,不始于语言,而始于世界。
哪条路线,才能通往「世界模型」的终局?|对话黄碧薇:Aether AI 创始人
2026年了,我们还在用爱迪生试灯丝的方式评估World Model
一场关于World Model的严肃讨论。
英伟达科学家的20分钟演讲:机器人终局,2040 预言
从 VLA 到 WAM,英伟达正在用 LLM 的剧本重写具身智能
几十亿年前,生物就造出了第一个"世界模型"
把果蝇大脑\x26quot;上传\x26quot;之后,我们离世界模型还有多远?
通向具身智能 GPT-3 时刻的数据路径|高阳 x 北坡计划
“大量数据会造就智能”
高阳:会思考的芦苇,会行动的机器|北坡计划
制药实验室的“OpenAI 时刻”:「合碳智能」完成 5000 万融资,机器人科学家走上实验台
机器人科学家的故事刚刚开始
偏执、野心,与一副 AI 眼镜:顶级产品经理的底层燃料|对谈理想 SVP 范皓宇
不甘心世界就这样。
元戎启行真实路测:当 AI 学会“害怕”,辅助驾驶的“黑盒”被打开了 | 云启伙伴
当车开始理解世界
云启季刊 | 向上,是一致的回答
新成长、新收获
自变量机器人王潜:具身智能 Scaling law 还有多远? | 云启实干派
具身智能 ≠ 把 Deepseek 塞进宇树
云启伙伴 | 「元戎启行」9 月份量产交付超 30000 台,再创新高
VLA 如何开创驾驶新未来
AI 是具身智能的胜负手吗?半年融资3亿后,VBot 首款产品做得怎么样?|对谈维他动力联创赵哲伦
我希望能做一个回家送给妈妈的产品。
在进展中看清节奏|Vital Monthly
参赞生命力
逐际动力获京东战略领投,加速具身智能技术落地|绿洲生命力
参赞生命力
千寻智能完成 5.28 亿融资,全面加速迭代|绿洲生命力
参赞生命力
AI驱动,加速进化!五位蓝驰家族成员入选「投中榜·锐公司100」榜单
展现锐利锋芒,一路勇往直前
具身智能的月亮与六便士
参赞生命力



















