长期指南
什么是机器人控制?从高层指令到真实运动
机器人控制通过反馈、运动与力调节、预测式优化、全身协调和学习组件,把期望行为转化为真实物理动作。
- 发布于
- 2026年9月29日
核心要点
- 高层机器人指令本身还不是物理运动;控制负责把期望行为转化为真实系统能够执行的命令。
- 机器人控制通常是闭环过程:传感器测量真实结果,控制器再据此调整下一步命令。
- 接触会改变控制问题,使力、柔顺性和交互动态成为任务的一部分。
- 现代机器人控制可以结合基于模型、基于优化和学习得到的组件,而不是遵循一种统一控制栈。
从高层指令到真实运动
机器人可能收到一个看起来很简单的任务:拿起杯子、把一个零件放进治具,或者把机械手移动到目标位姿。VLA 或其他策略甚至可能已经输出了用于完成任务的动作。但“决定应该做什么”并不会自动告诉真实机器应该怎样到达目标、各个关节怎样响应负载,也不会告诉系统在动作开始偏离预期时应该如何修正。高层动作意图,本身还不是物理运动。
从任务层面的决定到真实运动之间,机器人可能使用多种中间表示。系统可能指定末端执行器的目标位姿、生成轨迹、给出关节位置或速度参考、调节力,或者直接产生更低层的控制输入。这些都可以用来描述控制栈中的某些环节,但不能把它们理解为所有机器人的统一流水线。不同机器人架构对规划、控制以及中间接口的划分可能并不相同。
这正是机器人控制开始发挥作用的地方。控制把“希望机器人怎样行动”与“真实机器实际上正在怎样运动”连接起来,并根据机器人和环境的实际响应继续调整命令。从更大的 Physical AI 链条来看,控制是把计算结果变成物理执行的重要环节之一:智能最终必须经过真实动力学、接触、扰动、传感和执行,才能成为物理世界中的有效行为。
什么是机器人控制?
机器人控制,是把期望行为转化为真实机器人的控制命令,并通常利用反馈缩小目标与实际运动、力或物理交互之间偏差的过程。这个定义故意比某一种具体算法更宽。机器人控制并不等于 PID,也不等于力矩控制,更不是所有机器人架构里都固定存在于同一层级的“底层模块”。
控制器到底调节什么,取决于任务以及系统能够提供的接口。有的控制器跟踪关节位置,有的调节速度,有的产生力矩或力目标,还有的需要同时协调多个量。因此,运动控制、力控制、运动—力混合控制和阻抗控制是相互关联但目标并不完全相同的控制问题,而不是同一件事的不同名称。
控制器也不等于执行器。控制负责计算或调节命令,而执行器负责真正产生物理作用。在不同系统中,控制接口可能是关节位置参考、速度、力矩,或者交给更低层控制环的其他目标量。最终,机器人的执行器与机械结构把这些命令转化为真实的物理作用和运动。不同系统的边界并不完全相同,因此也不能用某一种固定输出形式来定义“机器人控制”。
为什么反馈如此重要?
真实机器人很少会完全按照理想命令运动。负载变化可能改变所需作用力,摩擦可能变化,动力学模型可能存在误差,延迟、意外接触或外部扰动也可能让机器人偏离原本的运动目标。就连机器人对自身状态的判断,也来自可能不完整或带有噪声的传感测量。因此,控制系统需要知道:希望发生的事情,与真实发生的事情之间究竟差了多少。
这就是反馈控制的基础。传感器可以测量关节位置、速度、交互力等信息,控制器再利用这些实际测量更新后续命令。机器人控制通常是一个反馈过程,而不是一次性命令。可以把它简单理解成:期望行为 → 控制器 → 机器人 → 传感器 → 实际状态 → 再回到控制器。这个闭环只是教学上的抽象,并不意味着所有机器人都采用完全相同的软件结构。

反馈控制器利用实际测量结果更新命令,使机器人在运动过程中持续跟踪目标。
期望量与实际测量之间的差异,通常可以理解为误差。例如,机械臂原本应该沿一条轨迹运动,但实际动作稍微落后,那么反馈控制器可以据此调整接下来的命令,而不是假设之前的命令已经被完美执行。这里的目标不一定是在每一个瞬间都让误差严格等于零,而是让真实机器的响应持续保持在任务所需要的范围内。
PID 是这种反馈逻辑中最常见的例子之一。粗略来说,P 根据当前误差做出响应,I 累积持续存在的误差,D 则关注误差变化的趋势。实际机器人控制还可能同时使用前馈项、动力学模型、优化方法或其他机制。PID 只是常见的反馈控制方法之一,并不等于机器人控制本身。
从任务目标到关节与控制命令
很多机器人任务最自然的描述方式,并不是“第几个关节转多少度”,而是“让机械手移动到这里”“让工具沿这个表面运动”或者“在这个方向保持一定的力”。这类描述属于任务空间或操作空间,它们表达的是对任务本身有意义的量,而不是直接规定每一个关节应该怎样变化。
机器人也可以在关节空间中描述,也就是关注各个关节自身的构型和运动。因此,任务空间和关节空间是服务于不同目的的描述方式,并不是包含完全相同信息的可互换表示。末端执行器位姿更适合表达任务目标,而关节坐标则更直接地描述机器人的内部机械构型。
逆运动学可以连接其中一部分关系,但逆运动学并不等于机器人控制。它主要回答一个几何问题:为了让末端执行器到达某个位姿,可以采用怎样的关节构型?逆运动学主要处理几何关系,而控制还要处理真实机器人随时间如何运动和响应。真正运动到目标还可能涉及速度、动力学、扰动、反馈、执行器限制以及与环境的接触。
操作空间控制提供了另一个理解角度。Khatib 的经典工作把末端执行器的运动与接触力直接放在操作空间的动力学框架中处理,而不是把关节坐标视为唯一有意义的控制目标。但这并不意味着关节和执行器消失了:任务空间中的目标最终仍然必须通过真实机器人的动力学、关节以及执行器产生物理效果。
运动、力与阻抗控制
当机器人在没有接触环境的自由空间中运动时,控制目标往往可以集中在位姿、速度或轨迹跟踪上。例如,机械臂需要让末端执行器从一个位置运动到另一个位置,而反馈负责让实际运动尽量跟上参考目标。但在自由空间中移动,与真正接触环境并不是同一种控制问题。
接触会改变控制问题本身。在插入、擦拭、打磨、推动或抓取任务中,“位置正确”可能已经不够了。交互力可能决定任务能否成功,也可能决定物体会不会滑动、卡住或者受到损坏。这也是为什么 机器人操作 不能只被理解成“把机械手移动到某个坐标”的问题。

一旦任务涉及接触,控制系统可能不仅要调节运动,还要同时管理交互力。
运动—力混合控制把这种区别表达得更加明确:在机器人能够自由运动的方向上,可以主要控制运动;而在被环境约束的方向上,更重要的目标可能变成接触力。因此,一个接触任务可以同时需要运动调节和力调节,而不是机器人一旦接触物体之后,就完全从“运动控制”切换成“力控制”。
阻抗控制则从另一个角度处理物理交互。阻抗控制关注的是运动与交互力之间的动态关系,而不是孤立地指定位置或力。通俗来说,当外力作用于机器人时,控制系统可以表现出不同程度的等效刚度和阻尼,从而产生更强或更弱的柔顺响应。Hogan 的经典工作强调,操作任务会让机器人与环境形成机械耦合,因此这种动态交互关系本身也可以成为控制目标。
规划、策略与模型预测控制
规划与控制之间可以做出有用的区分,但这条边界并不是绝对的。作为一种教学上的简化,规划更关注未来可能经过什么路径、状态或动作序列,而控制更关注真实物理系统在运行过程中究竟怎样响应。但在实际机器人架构中,优化、重新规划、轨迹生成和反馈控制可能紧密耦合,而不是被分成几个完全独立的模块。
策略和控制器之间也有类似的关系。“策略”描述的是从信息到动作的映射,而“控制器”描述的是调节真实物理行为的系统角色。VLA 或其他学习策略可以输出较高层的动作,但策略也可以直接产生关节目标或更低层的命令,从而承担控制栈中的一部分角色。因此,这些术语描述的是不同概念,并不天然对应固定的高低层级。
模型预测控制,也就是 MPC,很好地说明了为什么这些边界会重叠。MPC 会利用当前状态和模型预测有限时间范围内的系统演化,对一组候选控制序列进行优化,执行当前控制动作,然后根据新的反馈再次求解。MPC 是一种把类似规划的优化过程放进反馈闭环中的典型方法。MIT Cheetah 3 的工作就使用凸 MPC 为力矩控制的四足机器人计算地面反作用力,并在真实机器人上进行了实验。
不过,MPC 使用的预测模型并不能自动被称为 世界模型。经典 MPC 可以依赖针对特定系统建立的数学动力学模型。相比之下,Ha 和 Schmidhuber 的 World Models 工作学习环境的压缩时空表示,并利用模型中的“想象”式滚动来支持策略学习。两者都会预测系统可能怎样变化,但它们代表的是不同的建模选择和研究语境。
全身控制与学习控制
当机器人拥有更多自由度,并且同时与环境形成多个接触时,控制问题可能包含多个目标。系统可能一边移动机械手,一边维持稳定支撑、保持平衡、避免关节极限和碰撞,同时还要保持合适的整体姿态。这些目标之间可能互相影响甚至发生冲突,因此只控制一个末端执行器往往不足以描述整个物理问题。
全身控制框架就是为了协调这类问题。它可以在整个高维机器人上同时组织任务、姿态目标、接触、优先级与物理约束。Sentis 和 Khatib 的工作把任务导向控制、约束与姿态组织进分层框架,后续的 constraint-consistent formulation 又进一步处理了复杂任务、障碍、平衡和多接触的组合问题。全身控制尤其适用于高自由度、多接触系统,但不能简单把它等同于“人形机器人控制”。

全身控制需要在整个机器人上同时协调多个任务、接触与物理约束。
控制栈中的所有映射也不一定都必须由工程师手工设计。机器人学习 可以产生在运动控制中承担重要角色的学习策略。例如,Hwangbo 等人先在仿真中训练神经网络策略,再把它部署到真实 ANYmal 四足机器人,使机器人能够按照高层身体速度命令执行真实运动。这说明学习策略可以在特定真实机器人控制系统中承担重要功能,但并不能据此推出神经策略能够普遍取代所有其他控制组件。
现代机器人控制栈可以同时包含基于模型的反馈控制、优化方法、学习策略以及更低层的控制环,并根据具体机器人和任务划分职责。学习策略可以承担控制栈的一部分,但不会因此让反馈、物理约束和真实世界验证消失。这也直接连接到 Sim2Real:在模型或仿真中有效的策略与控制器,最终仍然必须面对真实机器人中的动力学差异、延迟、传感、接触和硬件限制。
结论
高层决策本身不会让机器人真正动起来。控制把期望行为与真实测量连接起来,并持续调节接下来应该发生什么。随着任务变化,需要控制的对象也会变化:自由空间运动更强调跟踪,接触会引入力和交互动态,高自由度机器人还可能需要同时协调多个任务与物理约束。现代控制系统可以结合基于模型、基于优化和学习得到的方法,而不是遵循一种统一架构。对于 Physical AI,高层智能最终仍需要经过控制转化为真实世界中可靠的物理行为。