跳到主要内容
BIMANUAL菜单English

长期指南

机器人如何学习?从示范学习、强化学习到 Sim2Real

机器人学习是机器人通过数据、示范、环境交互或仿真获得并改进能力的方法集合。本文解释行为克隆、强化学习、机器人数据与 Sim2Real 的作用,同时区分学习策略、规划器、控制器和真实部署证据。

发布于
2026年9月8日
内容更新
2026年9月7日
最近核验
2026年9月7日

核心要点

  • 机器人学习是一个方法领域,不是单一模型,也不存在唯一的技术路径。
  • 示范可以通过模仿学习教会策略;行为克隆简单有效,但会受到数据分布偏移的影响。
  • 强化学习通过奖励和交互优化行为,但探索、样本效率与安全仍是重要约束。
  • 仿真可以扩展训练经验,但仿真中的成功不等于现实世界中的稳健性。
  • 机器人学习数据可以支持 VLA 和通用策略,但机器人学习的范围大于 VLA,也不取代底层控制。

引言

机器人可以执行预先编写的动作,却不一定因此获得可迁移的能力。机器人学习关注的是另一个问题:机器人如何从示范、数据、环境交互或仿真中改进行为?这个问题把感知、行动、评估与真实运行条件连接起来。

本文把机器人学习放在更完整的 Physical AI 技术栈中理解。它不是一条固定配方,也不意味着学习会取代规划、控制或安全工程。

什么是机器人学习?

机器人学习是机器人通过数据、示范、交互或仿真获得并改进行为、策略、技能、模型或表征的过程。被学习的对象可以是完整任务策略、子策略、价值估计或有用的表征,不一定是端到端神经网络。

学习能力与执行编程行为的区别

编程行为通常预先规定规则、轨迹或控制器参数;学习能力则从示例或反馈中推断,并在特定机器人、任务和环境中评估。实际系统里,学习组件往往与状态估计器、规划器、控制器和安全监测并存。

从编程行为到学习能力

学习改变了工程工作分布。团队不必为每个场景手写全部响应,而是需要选择观测、动作接口、数据收集方式、训练目标和评估协议。最终系统仍然是被设计出来的:数据覆盖、奖励设计、身体形态与部署约束都会影响策略能力。

因此,机器人学习不是 Data → 模仿学习 → 强化学习 → Sim2Real → Robot 这样的通用顺序。项目可以只使用示范、只使用仿真、使用离线数据、采用混合目标,或在学习模块周围保留传统控制。

机器人训练数据来自哪里?

机器人数据通常包括时间对齐的观测、机器人状态、动作、任务上下文、结果以及身体形态元数据。具体字段会因数据集而异,数据规模更大也不自动意味着数据更好或更具泛化性。

示范与远程操作

示范可以来自人类、专家控制器、另一台机器人或脚本教师。远程操作能让复杂行为变得可观察,但采集可能缓慢、昂贵,并受到相机位置、身体形态、操作者水平和任务变化的影响。

自主尝试与记录的交互经验

机器人也可以记录自己的尝试、结果、人工干预与失败。这些记录可以支持离线学习或后续评估,前提是时间戳、动作和上下文保持对齐。

跨身体形态数据集

来自不同机器人类型的数据可以呈现任务中的共同结构,也会凸显传感器、运动学、动作空间和校准差异。跨身体形态迁移仍然需要实证验证,不能因为共享数据就自动成立。

从示范中学习

模仿学习(IL)从示范或其他专家信号中学习行为。它可以减少手写行为逻辑,但结果取决于示范的覆盖范围与质量,以及学习者进入示范中很少出现的状态后会如何行动。

模仿学习

模仿目标可以拟合状态—动作或观测—动作样本,也可以比较轨迹,或在执行时使用反馈。“模仿”描述的是学习信号,而不是某一种固定模型架构。

行为克隆

行为克隆是一个监督学习基线,根据观测或机器人状态预测记录中的动作。它简单且有用,但当学习者进入示范中罕见或没有覆盖的状态时,小误差可能逐步累积。

为什么 DAgger 重要?

DAgger 让专家标注学习者实际访问的状态,并聚合这些标注,从而应对序列决策中的分布不匹配。它是一种交互式模仿学习方法,并不是所有模仿学习系统的必选步骤。

通过奖励与交互学习

强化学习(RL)依据交互、仿真或记录转移得到的奖励或回报改进行为。探索、奖励设计、样本效率和安全性,决定了这一目标对物理任务是否有用。

强化学习增加了什么?

当完整示范难以提供,或结果比动作更容易评估时,强化学习可以优化行为。但奖励仍需代表真实任务,真实机器人交互也可能昂贵或有风险。

在线与离线强化学习

在线强化学习在学习过程中收集新经验;离线强化学习在学习阶段使用固定数据集,不再额外采集在线数据。离线方式可以降低探索成本,却带来分布偏移与数据支持范围外动作的风险。之后是否在线微调,是另一个独立决定。

示范与强化学习可以结合

示范可以用来初始化策略、塑造奖励,或为后续强化学习提供数据。也有系统只使用其中一种信号。组合方式是设计选择,而不是技术成熟度阶梯。

机器人为什么在仿真中学习?

仿真可以提供大量试验、更快迭代和比实体机器人更安全的探索,也更容易复现少见的失败。但它的价值取决于仿真器、任务、传感器、动力学和评估协议是否适合当前问题。

Sim2Real 到底是什么?

Sim2Real 指把策略或表征从建模环境迁移到实体硬件。视觉外观、动力学、接触、延迟、校准和传感器噪声都可能在两种环境之间不同。

现实差距

在仿真中成功的策略,可能因为摩擦、抓取几何、时序或感知误差变化而失败。视觉或动力学随机化、系统辨识、目标机器人微调和真实数据都是应对差异的策略,但都不能保证现实差距已经消失。

常见迁移策略

团队可以随机化视觉或物理参数,用硬件数据辨识模型,在目标机器人上微调,或把仿真与逐步增加的实体评估结合起来。选择取决于任务和可获得的证据。

证据边界

仿真成功是仿真证据;基准测试、受控实验室试验、试点和持续生产运行属于不同证据层级,应分别报告。

BIMANUAL / 机器人学习机器人能力如何被学习出来不同系统会以不同方式组合这些要素。
机器人学习执行物理任务的编辑插图,标注示范、机器人数据、仿真、环境交互、策略、评估与真实世界反馈等概念关系。

不同系统会以不同方式组合这些要素。

  1. 01示范来自人类、专家、机器人、脚本或模拟器的例子可能的数据与交互来源
  2. 02机器人数据观察 · 状态 · 行动 · 结果
  3. 03仿真模拟训练或评估环境
  4. 04环境交互在世界中行动产生的后果
  5. 05学习更新策略、技能、模型或表征学习得到的行为或策略
  6. 06策略行动选择规则,不一定输出电机力矩
  7. 07评估任务、机器人、环境与评测协议不同评估环境对应不同证据
  8. 08真实世界反馈物理结果、失败与修正

概念关系图,不代表统一的训练流程。

现代通用机器人策略处于什么位置?

通用策略研究会共享任务、数据、接口或身体形态,以检验一个学习组件能否覆盖多个行为。“通用”描述研究范围,不代表普适能力、零样本部署或对所有身体自动迁移。

RT-1、Open X-Embodiment、DROID 和 Octo 等机器人数据与策略研究,展示了扩展数据和策略接口的不同方式。它们的结果仍受各自研究中的机器人、任务、数据划分和适配流程限制。

机器人学习与 VLA 的区别

机器人学习是更宽的方法领域,包含模仿学习、强化学习、离线学习、仿真、扩散策略、经典或基于模型的方法,以及混合系统。Vision-Language-Action(VLA)模型是其中一种根据多模态上下文预测动作的模型或策略家族。VLA 可以使用机器人学习数据训练,但二者不是同义词。

学习策略可以输出位姿、路点、速度、动作片段、token 或其他接口,并不自动等同于电机力矩。规划、控制和执行器仍是不同的运行时环节。

学会一项技能不等于能够部署

训练阶段使用数据或交互更新参数;推理阶段根据当前观测应用策略;规划器、控制器、安全层和执行器则把动作接口转化为物理运动。训练得分或实验室演示本身,并不能证明系统能在变化环境中可靠运行。

关于多模态模型层,可以参阅Vision-Language-Action(VLA)模型,将策略家族与更广的训练和部署系统区分开来。

BIMANUAL / 机器人学习机器人学习中的主要方法不同方法、数据形态与迁移策略承担不同角色。
机器人学习方法的编辑生态关系图,包含模仿学习、行为克隆、强化学习、离线学习、仿真与 Sim2Real、机器人数据集、通用机器人策略和 VLA 模型。

不同方法、数据形态与迁移策略承担不同角色。

  1. 01机器人学习由相关方法与数据形态构成的领域
  2. 02模仿学习从专家或教师信号中学习
  3. 03行为克隆模仿学习中一种常见的监督学习方法行为克隆是模仿学习中一种常见方法。
  4. 04强化学习使用奖励与交互,或使用已记录的转移数据
  5. 05离线学习从固定数据集中学习,不自动等同于离线强化学习
  6. 06仿真 / Sim2Real迁移问题与策略空间Sim2Real 描述的是迁移问题,不是单一学习算法。
  7. 07大规模机器人数据集数据资源,质量与覆盖范围仍然重要
  8. 08通用机器人策略在多个任务或设置上评估的策略
  9. 09VLA 模型一种多模态 / 行动模型家族VLA ≠ 机器人学习 · 通用机器人策略 ≠ VLA

相关方法,不代表成熟度阶梯或固定层级。

开放问题

仍待解决的问题包括:采集多样且对齐的机器人数据,在不安全探索的情况下利用失败经验,跨身体形态迁移,评估长时程行为,以及让 Sim2Real 证据更可复现。可靠性还依赖校准、监测、恢复机制和任务边界,而不只是模型规模。

当问题涉及身体、环境、感知、行动与反馈时,可以结合具身智能的视角来理解学习所处的背景。

结论

机器人学习让机器人能够从示范、数据、交互和仿真中获得或改进能力。它的方法多样,输出接口不等于力矩,证据也必须绑定到具体机器人、任务、环境与评估条件。学习只是物理系统的一部分;成功部署仍需要规划、控制、硬件、安全和谨慎的现实验证。

相关主题

来源

  1. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic ControlGoogle DeepMind · 第一手来源 · RLE-015

    VLA as one robot-learning implementation and its action-token boundary.

  2. A Survey of Imitation Learning: Algorithms, Recent Developments, and ChallengesMaryam Zare et al. · 第二手来源 · RLE-003,RLE-004

    Imitation-learning taxonomy, demonstrations, distribution shift, and challenges.

  3. Interactive Imitation Learning in Robotics: A SurveyCarlos Celemin et al. · 第二手来源 · RLE-004,RLE-005,RLE-006

    Interactive human feedback and the imitation/reinforcement boundary.

  4. Sim-to-Real Transfer in Deep Reinforcement Learning for Robotics: a SurveyW. Zhao et al. · 第二手来源 · RLE-017,RLE-019,RLE-022,RLE-023,RLE-024

    Sim-to-real strategies, evidence tiers, and limitations.

  5. Sim-to-Real Transfer of Robotic Control with Dynamics RandomizationXue Bin Peng et al. · 第一手来源 · RLE-017,RLE-018,RLE-019,RLE-024

    Dynamics randomization and bounded physical-arm transfer evaluation.

  6. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real WorldTobin et al. · 第一手来源 · RLE-017,RLE-018,RLE-019,RLE-024

    Visual domain randomization and bounded sim-to-real evidence.

  7. Octo: An Open-Source Generalist Robot PolicyOcto Model Team · 第一手来源 · RLE-012,RLE-014,RLE-023

    Generalist policy pretraining, new interfaces, embodiments, and fine-tuning.

  8. DROID: A Large-Scale In-The-Wild Robot Manipulation DatasetKhazatsky et al. · 第一手来源 · RLE-010,RLE-011,RLE-012,RLE-022

    Diverse robot manipulation data collection and its operational constraints.

  9. Diffusion Policy: Visuomotor Policy Learning via Action DiffusionChi et al. · 第一手来源 · RLE-014,RLE-016,RLE-020

    Conditional action-generation representation for visuomotor policy learning.

  10. Open X-Embodiment: Robotic Learning Datasets and RT-X ModelsOpen X-Embodiment Collaboration · 第一手来源 · RLE-010,RLE-012,RLE-013,RLE-015,RLE-023

    Cross-embodiment data standardization and bounded positive-transfer experiments.

  11. RT-1: Robotics Transformer for Real-World Control at ScaleGoogle Robotics · 第一手来源 · RLE-001,RLE-010,RLE-011,RLE-014,RLE-015,RLE-020,RLE-021,RLE-022

    Large-scale real-robot data, multitask policy, action representation, and evaluation.

  12. Offline Reinforcement Learning Hands-OnLouis Monier et al. · 第二手来源 · RLE-003,RLE-008,RLE-009

    Offline dataset properties, return quality, and behavior-cloning comparison.

  13. Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open ProblemsLevine, Kumar, Tucker, Fu · 第二手来源 · RLE-001,RLE-006,RLE-008,RLE-009,RLE-020

    Fixed-dataset RL, distribution shift, and evaluation limitations.

  14. Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy UpdatesGu, Holly, Lillicrap, Levine · 第一手来源 · RLE-007,RLE-022

    Deep off-policy learning on simulation and bounded physical manipulation evidence.

  15. Reinforcement learning in robotics: A surveyKober, Bagnell, Peters · 第二手来源 · RLE-001,RLE-006,RLE-007,RLE-020,RLE-021

    Robotics RL framing, reward, exploration, and robot-specific constraints.

  16. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online LearningRoss, Gordon, Bagnell · 第一手来源 · RLE-004,RLE-005

    Learner-induced distribution shift and DAgger-style interactive relabeling.

  17. A Survey of Robot Learning from DemonstrationArgall, Chernova, Veloso and Browning · 第二手来源 · RLE-002,RLE-003

    Demonstration data and state-action policy derivation; design choices.

  18. Recent Advances in Robot Learning from DemonstrationArgall, Chernova, Veloso, Browning · 第二手来源 · RLE-001,RLE-002,RLE-010,RLE-011,RLE-021

    Scope of learning from demonstration, data, policy derivation, and evaluation.

继续阅读