跳到主要内容
BIMANUAL菜单English

长期指南

什么是 VLA?Vision-Language-Action 模型如何让机器人理解并执行指令

解释 Vision-Language-Action 模型如何连接语言、视觉与机器人行为,以及它在完整机器人控制架构中的位置。

发布于
2026年9月2日
内容更新
2026年9月1日
最近核验
2026年9月1日

核心要点

  • VLA 把语言指令和视觉观察连接到机器人动作表示。
  • 动作表示可以是 token、位姿、路径点、轨迹或 action vector,并不等于电机力矩。
  • VLA 只是学习型策略层,仍需要规划、控制、执行和安全系统。

引言

机器人可以观察环境,并不代表它理解人的意图。一个能够完成真实任务的系统,需要把人的语言、机器人看到的场景,以及机器人能够执行的动作连接起来。

Vision-Language-Action,简称 VLA,是一类用于建立这种连接的模型。它可以成为机器人更完整的 Physical AI 技术栈中的学习型策略层,但不会自动取代规划器、反馈控制、执行器或安全系统。

VLA 是什么意思?

Vision:视觉

视觉输入描述机器人所在的物理环境,包括物体、表面、障碍物、人员、机器人身体和工作空间。输入可能来自 RGB、深度、腕部摄像头或其他传感器。

Language:语言

语言表达任务、目标、约束或纠正,例如“拿起红色方块,把它放进托盘”。它让人可以用自然表达指定任务,而不必为每种变化重新编程。

Action:动作

动作是模型根据指令和观察提出的行为结果,可能表示为离散 token、位姿、路径点、轨迹、关节目标或连续 action vector。它们不等于电机力矩。RT-2 使用动作 token,其他系统也可能生成连续动作或动作序列。 [RP-VLA-01] [RP-VLA-07] [RP-VLA-10]

动作接口决定下一步需要哪些系统。规划器或控制器还要检查可执行性、施加限制,并把输出转换成硬件可以执行的命令。

BIMANUAL / 编辑图形VLA 如何将指令转化为机器人动作学习型动作层把语言、视觉和机器人状态连接到物理行为。
人类与机器人围绕物体协同完成操作的编辑视觉图

VLA 把任务上下文连接到动作表示,再交给下游控制和物理执行。

  1. 01指令 · 视觉 · 机器人状态语言目标 · 场景 · 关节状态
  2. 02多模态表示整合任务上下文
  3. 03VLA 策略学习型动作映射
  4. 04动作表示token · 位姿 · 路径点 · 轨迹 · action vectorVLA 输出不一定是电机力矩
  5. 05控制器可执行性 · 反馈 · 安全
  6. 06物理动作现实世界中的运动

为什么 VLA 重要?

传统机器人系统通常把感知、任务规划、运动规划、控制和执行拆分为不同模块。这种模块化结构仍然重要,因为它便于检查、测试和施加明确约束。

困难在于固定模块面对变化的物体、场景和指令时往往需要大量适配。VLA 可以在视觉环境、语言指令和任务动作之间增加更灵活的学习连接,但这不意味着传统机器人方法已经过时。

VLA 是如何工作的?

一个简化流程是:指令 + 视觉 + 机器人状态 → 多模态表示 → VLA 策略 → 动作表示 → 规划器 / 控制器 / 执行器。

模型把语言、视觉观察,以及可能存在的关节位置或夹爪状态结合起来,再输出控制接口可以使用的动作表示。下游组件仍可检查可达性、碰撞风险、动力学、安全限制和恢复行为。

不同系统的职责划分并不相同。有些系统把感知和策略集成在一起,有些系统则保留独立规划器或控制器。因此,VLA 更适合被理解为学习型决策层或策略层,而不是完整的机器人“大脑”。

VLA 在机器人智能架构中的位置

LLM 主要处理文本,可以解释指令或提出步骤,但文本生成本身不提供视觉 grounding,也不等于安全控制。

VLM 把语言与图像或视频对齐,可以识别物体、描述场景,但不会自动成为操作策略。

VLA 把多模态输入连接到机器人动作。Policy 是从观察或目标到动作的更宽泛映射,VLA 可以包含或产生这样的策略。

Planner 负责较长时域的任务拆解与排序;Controller 在反馈、动力学和限制下跟踪目标;Actuator 产生真实运动。具体系统可能将部分功能合并,但这些职责不能简单混为一谈。

BIMANUAL / 编辑图形VLA 在机器人智能架构中的位置不同层级协同工作;不存在唯一的通用架构。
抽象的分层机器人智能架构与物理交互视觉图

VLA 是更大系统中的一个学习层,与上下文、规划、控制和物理反馈协同工作。

  1. 01语言 / 视觉上下文LLM · VLM
  2. 02VLA / 策略层多模态动作映射
  3. 03规划器任务拆解 · 排序
  4. 04控制器反馈 · 动力学 · 安全
  5. 05执行器 / 物理反馈运动 · 接触 · 状态
  6. 06架构存在差异VLA 只是其中一层,不是完整机器人系统

VLA 与传统机器人系统的区别

传统模块化系统通常依赖显式接口、任务工程和明确的运行条件。VLA 系统使用学习型多模态表示,可能在变化环境中更灵活,但其表现取决于数据、本体、评估条件和安全机制。

实际问题不是“旧机器人”与“智能机器人”的二选一,而是哪些部分被显式建模、哪些部分通过学习获得、不确定性在哪里处理,以及动作到达硬件前如何被验证。

当前研究方向

机器人数据

机器人学习需要把观察、指令和物理动作联系起来的数据。Open X-Embodiment 研究跨多个机器人平台的数据共享,DROID 则展示了真实操作数据在场景、任务和操作者多样性方面的成本。 [RP-VLA-05] [RP-VLA-08]

模仿学习与强化学习

模仿学习使用示范训练模型,强化学习通过奖励或反馈改进行为。它们是训练方法,不是 VLA 的同义词;实际系统可能以不同方式组合这些方法。 [RP-VLA-03] [RP-VLA-06] [RP-VLA-07]

仿真与 Sim-to-Real

仿真可以提供可扩展的训练环境和合成数据。Domain Randomization 是一种迁移策略,但真实接触、摩擦、传感、延迟和物体差异仍会带来不确定性。 [RP-VLA-09]

跨本体学习

研究人员正在测试技能能否在不同机器人身体之间迁移。这是需要实验评估的属性,并不是使用 VLA 架构后自动获得的能力。 [RP-VLA-05] [RP-VLA-06] [RP-VLA-10]

可靠性

可靠系统需要处理歧义、遮挡、意外物体、动作恢复、长时序误差和人工干预。基准测试成功本身不能证明长期可靠运行。

代表性系统

RT-2 是 Google DeepMind 的研究系统,把大规模视觉语言预训练与机器人控制连接起来,对 VLA 研究类别的形成具有历史意义。它是研究成果,不是商业部署证据。 [RP-VLA-01]

OpenVLA 是一个使用大规模机器人示范数据训练的开源 7B VLA。它的价值在于开放研究模型和适配流程,而不是证明存在通用的生产级控制器。 [RP-VLA-03]

Physical Intelligence 的 π0 是面向多种平台和任务的研究型 VLA flow model,展示了不同的动作生成路线,不等于已经部署的机器人 fleet。 [RP-VLA-10]

Figure 将 Helix 描述为用于通用人形机器人控制的 VLA,Google DeepMind 则将 Gemini Robotics 描述为连接视觉理解、语言和物理动作的模型系列。这些属于公司披露的技术主张,不能直接视为独立部署验证。 [RP-VLA-11] [RP-VLA-12]

NVIDIA 将 GR00T N1 描述为面向人形机器人的开放基础模型,并使用真实、仿真和合成数据。公开发布不等于规模化部署。 [RP-VLA-13]

局限与开放问题

高质量机器人数据的采集、清洗和语言对齐都很昂贵。在一种本体上训练的策略也不一定能直接迁移到另一种本体,因为运动学、传感器、夹爪、负载和工作空间都可能不同。

仿真能够降低训练成本,却无法完美重现真实接触和传感。长时序任务会积累误差,而看似合理的动作仍可能不安全。因此,生产系统需要监控、约束、恢复机制、人工干预和低层控制保护。

结语

Vision-Language-Action 模型把语言指令和视觉观察连接到机器人行为。它的输出可能是 token、位姿、路径点、轨迹或 action vector,并不一定是直接的电机力矩。

VLA 为更灵活的学习型策略提供了路径,但可靠的 Physical AI 仍然依赖机器人数据、本体适配、规划、控制、安全系统以及真实运行证据。

相关主题

来源

  1. Gemini Robotics-ERGoogle DeepMind · 第一手来源 · reasoning-and-action-separation

    Research Pack source for VLA article claims (gemini-er); company sources are explicitly company-reported.

  2. Vision-Language-Action ModelsNVIDIA Technical Documentation · 第一手来源 · vla-action-interface

    Research Pack source for VLA article claims (nvidia-vla); company sources are explicitly company-reported.

  3. NVIDIA Isaac GR00T N1: An Open Foundation Model for Humanoid RobotsNVIDIA Research · 第一手来源 · company-reported-groot

    Research Pack source for VLA article claims (groot); company sources are explicitly company-reported.

  4. Introducing Gemini Robotics and Gemini Robotics-ERGoogle DeepMind · 第一手来源 · company-reported-gemini-robotics

    Research Pack source for VLA article claims (gemini); company sources are explicitly company-reported.

  5. FigureFigure AI · 第一手来源 · company-reported-figure-helix

    Research Pack source for VLA article claims (helix); company sources are explicitly company-reported.

  6. π0: A Vision-Language-Action Flow Model for General Robot ControlPhysical Intelligence / Black et al. · 第一手来源 · flow-action-generation

    Research Pack source for VLA article claims (pi0); company sources are explicitly company-reported.

  7. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real WorldTobin et al. · 第一手来源 · simulation-and-sim-to-real

    Research Pack source for VLA article claims (domain); company sources are explicitly company-reported.

  8. DROID: A Large-Scale In-The-Wild Robot Manipulation DatasetKhazatsky et al. · 第一手来源 · real-robot-data-collection

    Research Pack source for VLA article claims (droid); company sources are explicitly company-reported.

  9. Diffusion Policy: Visuomotor Policy Learning via Action DiffusionChi et al. · 第一手来源 · continuous-action-representation

    Research Pack source for VLA article claims (diffusion); company sources are explicitly company-reported.

  10. Octo: An Open-Source Generalist Robot PolicyOcto Model Team · 第一手来源 · generalist-policy-transfer

    Research Pack source for VLA article claims (octo); company sources are explicitly company-reported.

  11. Open X-Embodiment: Robotic Learning Datasets and RT-X ModelsOpen X-Embodiment Collaboration · 第一手来源 · cross-embodiment-data

    Research Pack source for VLA article claims (oxe); company sources are explicitly company-reported.

  12. PaLM-E: An Embodied Multimodal Language ModelGoogle Research / Driess et al. · 第一手来源 · multimodal-embodiment

    Research Pack source for VLA article claims (palme); company sources are explicitly company-reported.

  13. OpenVLA: An Open-Source Vision-Language-Action ModelStanford / collaborators · 第一手来源 · open-vla-and-demonstrations

    Research Pack source for VLA article claims (openvla); company sources are explicitly company-reported.

  14. RT-1: Robotics Transformer for Real-World Control at ScaleGoogle Robotics · 第一手来源 · robot-policy-and-data

    Research Pack source for VLA article claims (rt1); company sources are explicitly company-reported.

  15. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic ControlGoogle DeepMind · 第一手来源 · vla-definition-and-action-tokens

    Research Pack source for VLA article claims (rt2); company sources are explicitly company-reported.

继续阅读