长期指南
什么是 VLA?Vision-Language-Action 模型如何让机器人理解并执行指令
解释 Vision-Language-Action 模型如何连接语言、视觉与机器人行为,以及它在完整机器人控制架构中的位置。
- 发布于
- 2026年9月2日
- 内容更新
- 2026年9月1日
- 最近核验
- 2026年9月1日
核心要点
- VLA 把语言指令和视觉观察连接到机器人动作表示。
- 动作表示可以是 token、位姿、路径点、轨迹或 action vector,并不等于电机力矩。
- VLA 只是学习型策略层,仍需要规划、控制、执行和安全系统。
引言
机器人可以观察环境,并不代表它理解人的意图。一个能够完成真实任务的系统,需要把人的语言、机器人看到的场景,以及机器人能够执行的动作连接起来。
Vision-Language-Action,简称 VLA,是一类用于建立这种连接的模型。它可以成为机器人更完整的 Physical AI 技术栈中的学习型策略层,但不会自动取代规划器、反馈控制、执行器或安全系统。
VLA 是什么意思?
Vision:视觉
视觉输入描述机器人所在的物理环境,包括物体、表面、障碍物、人员、机器人身体和工作空间。输入可能来自 RGB、深度、腕部摄像头或其他传感器。
Language:语言
语言表达任务、目标、约束或纠正,例如“拿起红色方块,把它放进托盘”。它让人可以用自然表达指定任务,而不必为每种变化重新编程。
Action:动作
动作是模型根据指令和观察提出的行为结果,可能表示为离散 token、位姿、路径点、轨迹、关节目标或连续 action vector。它们不等于电机力矩。RT-2 使用动作 token,其他系统也可能生成连续动作或动作序列。 [RP-VLA-01] [RP-VLA-07] [RP-VLA-10]
动作接口决定下一步需要哪些系统。规划器或控制器还要检查可执行性、施加限制,并把输出转换成硬件可以执行的命令。

VLA 把任务上下文连接到动作表示,再交给下游控制和物理执行。
- 01指令 · 视觉 · 机器人状态语言目标 · 场景 · 关节状态
- 02多模态表示整合任务上下文
- 03VLA 策略学习型动作映射
- 04动作表示token · 位姿 · 路径点 · 轨迹 · action vectorVLA 输出不一定是电机力矩
- 05控制器可执行性 · 反馈 · 安全
- 06物理动作现实世界中的运动
为什么 VLA 重要?
传统机器人系统通常把感知、任务规划、运动规划、控制和执行拆分为不同模块。这种模块化结构仍然重要,因为它便于检查、测试和施加明确约束。
困难在于固定模块面对变化的物体、场景和指令时往往需要大量适配。VLA 可以在视觉环境、语言指令和任务动作之间增加更灵活的学习连接,但这不意味着传统机器人方法已经过时。
VLA 是如何工作的?
一个简化流程是:指令 + 视觉 + 机器人状态 → 多模态表示 → VLA 策略 → 动作表示 → 规划器 / 控制器 / 执行器。
模型把语言、视觉观察,以及可能存在的关节位置或夹爪状态结合起来,再输出控制接口可以使用的动作表示。下游组件仍可检查可达性、碰撞风险、动力学、安全限制和恢复行为。
不同系统的职责划分并不相同。有些系统把感知和策略集成在一起,有些系统则保留独立规划器或控制器。因此,VLA 更适合被理解为学习型决策层或策略层,而不是完整的机器人“大脑”。
VLA 在机器人智能架构中的位置
LLM 主要处理文本,可以解释指令或提出步骤,但文本生成本身不提供视觉 grounding,也不等于安全控制。
VLM 把语言与图像或视频对齐,可以识别物体、描述场景,但不会自动成为操作策略。
VLA 把多模态输入连接到机器人动作。Policy 是从观察或目标到动作的更宽泛映射,VLA 可以包含或产生这样的策略。
Planner 负责较长时域的任务拆解与排序;Controller 在反馈、动力学和限制下跟踪目标;Actuator 产生真实运动。具体系统可能将部分功能合并,但这些职责不能简单混为一谈。

VLA 是更大系统中的一个学习层,与上下文、规划、控制和物理反馈协同工作。
- 01语言 / 视觉上下文LLM · VLM
- 02VLA / 策略层多模态动作映射
- 03规划器任务拆解 · 排序
- 04控制器反馈 · 动力学 · 安全
- 05执行器 / 物理反馈运动 · 接触 · 状态
- 06架构存在差异VLA 只是其中一层,不是完整机器人系统
VLA 与传统机器人系统的区别
传统模块化系统通常依赖显式接口、任务工程和明确的运行条件。VLA 系统使用学习型多模态表示,可能在变化环境中更灵活,但其表现取决于数据、本体、评估条件和安全机制。
实际问题不是“旧机器人”与“智能机器人”的二选一,而是哪些部分被显式建模、哪些部分通过学习获得、不确定性在哪里处理,以及动作到达硬件前如何被验证。
当前研究方向
机器人数据
机器人学习需要把观察、指令和物理动作联系起来的数据。Open X-Embodiment 研究跨多个机器人平台的数据共享,DROID 则展示了真实操作数据在场景、任务和操作者多样性方面的成本。 [RP-VLA-05] [RP-VLA-08]
模仿学习与强化学习
模仿学习使用示范训练模型,强化学习通过奖励或反馈改进行为。它们是训练方法,不是 VLA 的同义词;实际系统可能以不同方式组合这些方法。 [RP-VLA-03] [RP-VLA-06] [RP-VLA-07]
仿真与 Sim-to-Real
仿真可以提供可扩展的训练环境和合成数据。Domain Randomization 是一种迁移策略,但真实接触、摩擦、传感、延迟和物体差异仍会带来不确定性。 [RP-VLA-09]
跨本体学习
研究人员正在测试技能能否在不同机器人身体之间迁移。这是需要实验评估的属性,并不是使用 VLA 架构后自动获得的能力。 [RP-VLA-05] [RP-VLA-06] [RP-VLA-10]
可靠性
可靠系统需要处理歧义、遮挡、意外物体、动作恢复、长时序误差和人工干预。基准测试成功本身不能证明长期可靠运行。
代表性系统
RT-2 是 Google DeepMind 的研究系统,把大规模视觉语言预训练与机器人控制连接起来,对 VLA 研究类别的形成具有历史意义。它是研究成果,不是商业部署证据。 [RP-VLA-01]
OpenVLA 是一个使用大规模机器人示范数据训练的开源 7B VLA。它的价值在于开放研究模型和适配流程,而不是证明存在通用的生产级控制器。 [RP-VLA-03]
Physical Intelligence 的 π0 是面向多种平台和任务的研究型 VLA flow model,展示了不同的动作生成路线,不等于已经部署的机器人 fleet。 [RP-VLA-10]
Figure 将 Helix 描述为用于通用人形机器人控制的 VLA,Google DeepMind 则将 Gemini Robotics 描述为连接视觉理解、语言和物理动作的模型系列。这些属于公司披露的技术主张,不能直接视为独立部署验证。 [RP-VLA-11] [RP-VLA-12]
NVIDIA 将 GR00T N1 描述为面向人形机器人的开放基础模型,并使用真实、仿真和合成数据。公开发布不等于规模化部署。 [RP-VLA-13]
局限与开放问题
高质量机器人数据的采集、清洗和语言对齐都很昂贵。在一种本体上训练的策略也不一定能直接迁移到另一种本体,因为运动学、传感器、夹爪、负载和工作空间都可能不同。
仿真能够降低训练成本,却无法完美重现真实接触和传感。长时序任务会积累误差,而看似合理的动作仍可能不安全。因此,生产系统需要监控、约束、恢复机制、人工干预和低层控制保护。
结语
Vision-Language-Action 模型把语言指令和视觉观察连接到机器人行为。它的输出可能是 token、位姿、路径点、轨迹或 action vector,并不一定是直接的电机力矩。
VLA 为更灵活的学习型策略提供了路径,但可靠的 Physical AI 仍然依赖机器人数据、本体适配、规划、控制、安全系统以及真实运行证据。