长期指南
从 LLM 到机器人动作:VLM、VLA、世界模型、强化学习、Sim2Real 和机器人控制到底是什么关系?
用一个“把红色杯子放进盒子”的任务,拆开 LLM、VLM、VLA、世界模型、模仿学习、强化学习、仿真、Sim2Real、规划、策略与控制在 Physical AI 中的分工。
- 发布于
- 2026年8月27日
- 内容更新
- 2026年8月27日
- 最近核验
- 2026年8月27日
核心要点
- 这些概念属于不同层级,不是一条从 LLM 到控制器的线性升级链。
- VLA 可以生成动作表示,但不自动替代规划、反馈控制和安全层。
- 模仿学习、强化学习、仿真与 Sim2Real 是训练和迁移方法,不是同一种模型。
1. 为什么这些词总让人混淆?
混淆的第一个原因,是同一家公司或论文经常同时谈模型、数据、训练方法和机器人产品。第二个原因,是“能看懂图像”“能生成动作”“能在真实世界完成任务”经常被营销语言压缩成一句“机器人理解并执行指令”。第三个原因,是论文中的演示任务和工厂里的持续运行并不是同一种证据。
先记住一个原则:模型类型、学习方法、训练环境和机器人系统层是不同的分类轴。
这五个轴可以交叉。一个 VLA 可能使用模仿学习数据和强化学习微调,在仿真中训练一部分,再由控制器执行它输出的末端位姿;另一个系统可能没有显式的世界模型或规划器。
2. 先把它们放回正确的层级

五个相互作用的层级,以空间系统呈现,而不是一条普适顺序。
- 01模型LLM · VLM · VLA · 世界模型不同模型家族 · 不同作用
- 02学习方法模仿学习 · 强化学习学习行为 / 策略的方法
- 03训练 / 迁移仿真 · Sim2Real训练语境 · 校准 · 迁移
- 04机器人系统感知 · 规划 · 策略 · 控制
- 05物理执行关节 · 执行器 · 运动
可以把一个教学版 Physical AI 系统画成这样:
这是功能地图,不是每台机器人都必须具备的代码模块。现代系统可能合并感知和策略,弱化显式规划,输出 action chunk、waypoint、末端执行器位姿、关节目标,或直接交给另一层策略。VLA 不一定直接输出电机电流。
3. 从 LLM 到 VLM:机器开始理解语言和视觉
3.1 LLM 与机器人有什么关系?
LLM 主要在语言 token 序列上学习统计结构,擅长生成文本、结构化计划、工具调用或子目标。它可以帮助机器人把“把红色杯子放进盒子”拆成“找到杯子 → 抓住杯子 → 移到盒子 → 松开”等高层步骤,也可以选择一个工具或技能。
但这仍然不是电机控制。LLM 默认没有摄像头中的像素、关节状态、接触力、控制周期或执行器接口。即使它输出了一个看似合理的动作,也还需要感知、技能/策略、规划、控制和安全检查把它落到现实。SayCan 的启发正是:语言模型可以提供高层知识,但动作选择还需要结合机器人在当前环境中的可执行性或 affordance,而不是让语言生成直接驱动电机。[SRC-LLM-01]
3.2 VLM 比 LLM 多了什么?
VLM 将图像或视频与语言放在同一任务中,能够把“红色杯子”“盒子左侧”等词语与视觉中的实体或区域联系起来。CLIP 展示了语言与视觉表征对齐的典型方式:文本可以引用视觉概念,图像也能进入共同表示空间。[SRC-VLM-01]
在杯子任务中,VLM 可以回答:画面里是否有红色杯子、盒子在哪里、杯子是否已经在盒子里。这是比纯文字模型更接近机器人现场的语义 grounding。
3.3 为什么 VLM 仍不等于机器人控制系统?
“看见”不等于“会稳定地做”。抓杯子还需要估计三维位姿、选择抓取点、考虑碰撞和可达性、处理遮挡与滑动,并在几十毫秒到更长时间尺度上持续闭环。控制器还要面对摩擦、负载、关节限制、延迟和安全边界。
因此,VLM 可以给出感知或语义输入,但它通常不是完整的机器人策略,更不是低层实时控制器。把一个视觉问答模型接到机械臂上,并不会自动得到可靠的抓取系统。
4. 从 VLM 到 VLA:多了 Action,但 Action 到底是什么?
4.1 VLA 做了什么?
Vision-Language-Action(VLA)模型把视觉观察、语言/任务上下文和机器人状态,与某种机器人动作接口关联起来。RT-2 研究了如何把机器人观察映射为动作,同时利用大规模视觉语言预训练;RT-1 则以图像和指令为输入,输出离散化动作 token,并在真实机器人任务上评估。OpenVLA 将互联网规模的视觉语言数据与机器人示范结合,学习可适配不同输入和动作接口的策略。[SRC-VLA-01][SRC-VLA-02][SRC-VLA-03]
4.2 Action 可能是什么?
“Action”不是一个固定字段。它可能是:
• 离散 action token;
• 末端执行器的位姿或增量;
• 一小段动作序列(action chunk);
• 关节位置、速度或目标轨迹;
• 抓手开合、移动基座或其他机器人特定向量。
输出格式取决于机器人 embodiment、数据集、控制频率和下游接口。模型输出“向左移动 3 厘米”与输出“第 1 关节施加多少电流”是完全不同的抽象层。
4.3 VLA 可以直接控制机器人吗?
在工程上,“直接”要先定义。VLA 可以直接成为高层策略,持续输出短时域动作,随后由一个现成控制器转换和执行;但这与直接输出并闭环负责每个电机电流不同。即使一个模型输出关节目标,也通常仍需底层反馈控制、限幅、碰撞检测和安全状态机。
所以更稳妥的表述是:VLA 可以直接参与动作生成,但是否直接连接执行器取决于动作接口和系统架构;它不自动替代传统机器人控制。
5. VLA 后面为什么通常还有机器人控制系统?
策略更像是在回答“下一步做什么”,控制器更像是在回答“怎样在当前动力学和约束下做到”。一个典型链条可能是:
控制不是“过时的旧模块”。机器人必须在真实动力学、摩擦、柔顺性、延迟、传感噪声和安全限制下工作。Modern Robotics 将控制描述为把任务规格转化为机器人需要施加的力或力矩,并通过反馈让运动遵守目标和约束。[SRC-CONTROL-01]
当然,也存在端到端程度更高的系统。它们可能把感知、策略和部分规划合并在一个模型中,再输出可执行的动作序列。系统边界变了,但低层执行问题没有消失。
6. World Model:让机器学习“如果这样做,会发生什么”
世界模型不是 VLA 的同义词。它的核心问题是:给定当前状态和一个动作,环境接下来可能怎样变化?World Models 工作展示了学习压缩的时空环境表征,并在潜在空间中进行“想象”或滚动预测的路线。[SRC-WM-01]
在杯子任务中,世界模型可能帮助评估:
• 夹爪从这个角度靠近,杯子是否会被碰倒;
• 把杯子移过盒壁,轨迹是否会碰撞;
• 松开夹爪后,杯子是否会落在盒内。
它可以支持规划、模型预测控制、策略训练或候选动作评估,但预测本身不是动作选择,也不是现实动力学的完美复制。
6.1 World Model 与 VLA 是竞争路线吗?
通常不是非此即彼。VLA/Policy 更偏向“基于当前观察和任务选择动作”;世界模型更偏向“预测动作后果”。系统可以让 VLA 提出候选动作,再让世界模型进行短期想象和筛选;也可以在世界模型产生的经验上训练策略。
有些系统没有显式世界模型,有些系统把预测能力内置在策略或规划器里。比较时,应问清楚“预测模块在做什么”,而不是仅凭产品名判断路线。
7. Robot Learning:Imitation Learning 与 Reinforcement Learning
7.1 Imitation Learning 为什么重要?
模仿学习从专家示范、遥操作轨迹或状态—动作对中学习行为。它为机器人提供一个“怎样做通常可行”的起点,尤其适合真实机器人交互昂贵、危险且难以定义奖励的任务。行为克隆可以直接拟合示范动作,其他 Learning from Demonstration 方法也可以学习更抽象的目标或约束。[SRC-IL-01]
在杯子任务中,人类操作者多次展示“对准杯子、闭合夹爪、抬起、移动、放下”。示范包含了许多很难手工写成规则的细节:接近方向、速度、抓取余量和失败恢复。
但示范也有边界:它可能覆盖场景有限,可能复制人的偏差,也不一定提供“如果这样做会失败”的反馈。
7.2 Reinforcement Learning 又解决什么?
强化学习通过奖励、价值估计和交互数据优化策略。它可以鼓励更高成功率、更少碰撞、更短路径或更轻柔的接触,也可以在示范之外探索新的行为。[SRC-RL-01]
RL 不等于必须在真实机器人上从零开始。奖励优化可以使用仿真、离线数据、示范初始化或有限的真实交互;真正的硬件交互只是某些阶段所需的证据或训练资源。
7.3 Imitation Learning 和 RL 是二选一吗?
不是。一个常见组合是:先用示范学习一个能工作的策略,再用 RL 或离线优化改善鲁棒性和目标表现。也可以先在仿真中用 RL 探索,再用真实示范或校准修正。需要报告的是训练顺序、数据来源和奖励定义,而不是笼统地说“机器人用了 AI 学习”。
8. 为什么机器人需要 Simulation 和 Sim2Real?
Policy vs Controller — Policy 回答下一步做什么;Controller 让目标在动力学和反馈约束下稳定执行。
真实机器人每次摔倒、碰撞或抓取失败都可能损坏硬件、占用工程时间或带来安全风险。仿真可以快速复制场景、生成轨迹、测试策略和运行大量重复实验。
但仿真只是现实的近似:摩擦、柔性、传感器噪声、延迟、材料、光照和未建模碰撞都可能不同。Sim2Real 指的是把仿真中学到或验证的能力迁移到真实硬件,并处理这种差异;它不是一个单独的神经网络模型。
域随机化是一个代表方法:训练时故意改变纹理、光照、物理参数等,让策略不依赖某个过于理想的仿真细节。[SRC-SIM-01] 其他方法还包括系统辨识、真实世界校准、适应和少量真实数据微调。
在杯子任务里,仿真可能教会策略在不同杯子位置下接近目标;Sim2Real 阶段还要确认真实杯子的重量、桌面摩擦、摄像头延迟和夹爪弹性没有让这个策略失效。仿真成功不是部署成功的同义词。
9. Planning、Policy、Controller 到底怎么区分?
Simulation vs Sim2Real — 仿真提供可控训练环境;Sim2Real 处理从仿真到真实硬件的迁移差异。
可以用时间尺度和输出类型作一个实用区分:
边界并不绝对。Diffusion Policy 和 Octo 展示了不同的动作生成与跨任务策略路线;它们不是控制理论的唯一实现,也不意味着每个 policy 都是 VLA。[SRC-POLICY-01][SRC-POLICY-02]
一个 LLM 可以参与任务规划,一个 VLM 可以帮助状态估计,一个 VLA 可以承担策略,世界模型可以提供预测;但这些角色在不同系统中可能由同一个模型或多个模块共同承担。阅读论文时,要看实际输入、输出、控制频率和闭环位置。
10. 一个完整案例:把红色杯子放进盒子

架构可以不同,但指令需要经过表征、策略与控制,才能改变物理世界。
- 01指令 + 场景“拿起红色杯子, 把它放进盒子。”
- 02表征 / 推理语言 · 视觉 · 场景状态
- 03策略 / VLA状态 → 动作表征VLA ≠ 低层控制器
- 04可选的规划可以独立存在,也可以并入策略
- 05动作表征token · 位姿 · 路点 · chunk
- 06低层控制器反馈 · 安全
- 07关节 / 执行器电流 · 力矩 · 速度
- 08物理动作抓取 · 移动 · 放置
以下是帮助初学者建立直觉的抽象流程,不代表唯一实现:
• 语言理解: LLM 或语言模块把指令解析成目标“红色杯子进入盒子”。
• 视觉 grounding: VLM 从相机画面中定位杯子、盒子、障碍物,并区分颜色和空间关系。
• 策略生成: VLA/Policy 结合指令、图像和机器人状态,生成接近、抓取或移动的动作表示。
• 后果预测: 如果系统有 World Model,它可以比较不同接近角度和放置轨迹的短期结果。
• 规划: Planning 将目标拆成可执行的子目标,检查可达性和碰撞约束。
• 控制: Controller 把目标位姿或轨迹变成关节级速度、力矩或阻抗命令,并持续纠偏。
• 物理执行: 执行器、传动、夹爪和传感器共同产生运动与接触。
• 反馈: 相机、本体感觉和力觉判断杯子是否滑动、是否在盒内,系统再更新动作。
• 学习: 示范可能提供初始策略,RL 可能优化成功率,仿真可能扩大训练覆盖,Sim2Real 处理迁移误差。
真实系统可能在第 3 步同时完成部分感知,也可能没有第 4 步的显式世界模型;第 6 步几乎不会因为使用 foundation model 就消失。
11. 把整个 Physical AI 技术栈重新拼起来
最有用的阅读方式,不是问“哪个模型最终赢了”,而是按以下顺序追问:
• 机器人看到了什么状态?传感器和视觉输入是什么?
• 语言或任务目标如何与这个状态对齐?
• 模型输出的是语义、子目标、动作 token、位姿、轨迹还是关节命令?
• 谁负责规划、碰撞约束和失败恢复?
• 谁以什么频率闭环控制执行器?
• 行为从示范、奖励、仿真还是混合数据中学到?
• 结果是在论文演示、内部测试、试点还是持续商业运行中观察到?
这样就能避免几个常见跳跃:VLA ≠ 完整机器人系统;World Model ≠ VLA;RL ≠ Robot Learning 的全部;Sim2Real ≠ 一种模型;LLM ≠ 直接驱动电机;Foundation Model ≠ low-level controller。
一分钟复习
• LLM / VLM: 分别提供语言结构与视觉—语言 grounding,不负责完整物理执行。
• VLA / Policy: 把任务上下文映射为某种动作表示;输出格式由具体架构决定。
• World Model: 预测动作可能带来的状态或环境变化,可辅助规划和训练。
• Imitation Learning / RL: 一个从示范学习,一个按奖励或目标优化;可以组合。
• Simulation / Sim2Real: 一个提供可控训练环境,一个处理从仿真到真实机器人的迁移。
• Planning / Control: 前者决定较长时域的子目标或轨迹,后者让关节和执行器在反馈下稳定跟踪。
12. 今天行业真正还没有解决什么?
Physical AI 的难点不是把名词串起来,而是让系统在变化、长尾和安全约束下稳定工作。仍需持续验证的问题包括:跨场景和跨 embodiment 的数据效率,接触丰富任务的鲁棒性,长期运行中的错误恢复,仿真与真实动力学的差距,以及如何把高层语义目标转化为可审计、可验证的低层行为。
因此,看到“机器人学会了某任务”时,至少要继续问:任务边界是什么?成功率如何定义?是在什么硬件、场景、人工干预和运行时长下得到的?论文演示、内部测试、试点和商业部署必须分别记录,不能互相替代。
13. FAQ
VLA 是不是机器人版的 LLM?
这是一个便于入门的比喻,但不够准确。VLA 使用视觉、语言和机器人动作数据学习动作相关映射;它的输出接口和闭环位置取决于具体系统,不是统一的“机器人 LLM”。
VLA 是否一定需要 VLM?
不一定以独立模块存在。VLA 通常需要视觉和语言条件,但感知、表示和动作头可以在一个架构中联合训练。
World Model 能代替真实机器人吗?
不能。它可以帮助预测、规划或训练,但仿真/预测误差、传感器差异和接触动力学仍需真实硬件验证。
RL 一定比模仿学习更高级吗?
不应这样排序。两者优化目标和数据来源不同,实际系统经常组合使用,效果取决于任务、奖励、示范和验证条件。
Sim2Real 是不是把模型直接复制到机器人?
不是。它是迁移问题及一组缓解方法,需要处理动力学、传感、视觉、延迟和控制接口差异。
机器人控制器为什么还重要?
因为真实关节和执行器需要在高频反馈下处理动力学、接触、稳定性、限幅和安全。高层模型的语义能力不会自动提供这些保证。
论文视频能证明机器人已经部署了吗?
不能。视频通常证明在声明的实验设置中完成过一次或一组任务;部署还需要客户、地点、持续运行、人工干预和规模等更具体证据。
初学者先学哪个概念?
先掌握“感知—规划—策略—控制”的层级,再分别学习 VLA、世界模型、模仿学习、RL 和 Sim2Real。这样可以避免把模型名称当成系统架构。
继续阅读:Physical AI、VLA、Robot Learning、Robot Manipulation。