产品

ViT

Vision Transformer

ViT 即 Vision Transformer,是一种将 Transformer 架构应用于计算机视觉任务的模型,通过将图像分割为 patch 序列并像处理文本 token 一样进行自注意力计算,从而替代传统的 CNN 骨干网络。在具身智能领域,ViT 或其变体常被用作视觉感知的基础模块:例如智元机器人的 GO-1 基座模型中,VLM 多模态理解层基于 InternVL-2B 构建,能够处理多视角视觉图片、力觉信号、语言输入等信息;自变量机器人的 WALL-WM 世界模型则在 Wan 视频生成模型的 DiT block 基础上加入 cross-view attention,继承单视角时空注意力能力的同时实现多相机信息交互。

此外,英伟达与斯坦福联合发布的 RoboTTT 工作也将视觉—动作上下文扩展至 8,000 个时间步,在保留原有 Transformer Attention 分支的同时引入 Fast Weights 机制处理长期状态。elsewhere 暂未覆盖 ViT 在更广泛的图像分类、检测等经典视觉任务中的具体技术细节。

由 AI 生成,可能出现错误,请仔细核对内容。

ViT产品
Vision Transformer
暂无关系图谱
在 3 篇文章中被提及

相关报道