长期指南
什么是具身智能?身体、环境与行动如何共同塑造智能
具身智能不是一个单独的模型名称,而是一种系统视角:智能体的身体与环境会共同影响它能感知什么、如何学习,以及如何行动。本文定义这一概念,并厘清它与相邻 AI 术语的边界。
- 发布于
- 2026年9月4日
核心要点
- 具身智能描述的是智能体、身体与环境之间的耦合关系,而不是单一模型。
- 感知、行动与反馈是核心;身体既可能限制行为,也可能帮助产生行为。
- LLM、VLM、VLA 与机器人学习可以成为具身系统的组成部分,但都不等同于具身智能。
- 人形机器人只是具身形态之一,不能代表具身智能的全部。
引言
一个系统可以描述场景,却未必能够在其中行动。具身智能从一个更难的问题出发:当智能与身体、环境以及行动后果相互耦合时,问题究竟发生了什么变化?
本文将具身智能作为系统层面的概念来讨论。它不是产品标签、单一模型架构,也不能因为机器人连接了语言模型,就断言它已经具备具身智能。
什么是具身智能?
具身智能描述的是这样一类智能体:它的感知、决策、学习与行动会被身体形态和所处环境实质性地塑造。身体可以是真实的,也可以是被明确建模的仿真身体,但必须说明证据边界。
因此,具身智能是一种由智能、身体、感知、行动、环境和反馈共同构成的关系。它帮助我们比较不同系统,而不是规定一张通用的运行流程图。
为什么智能需要身体?
身体会改变行动空间。可达范围、平衡、柔顺性、传感、接触、能耗和执行器限制,共同决定哪些行动可行、哪些后果足够安全。形态可以让某些行为更容易,也会让另一些行为更困难;它不能取代学习或控制。
环境也是问题的一部分:观测往往不完整,物体会移动,表面条件会变化,而每一次行动都会改变智能体下一刻能够观测到的世界。
具身智能如何工作?
具身智能没有唯一规定的流程。在具体系统中,感知可能更新状态估计,学习型策略可能提出动作表示,规划器或控制器再对执行施加约束。来自接触、运动和任务结果的反馈,可以在不同时间尺度上更新状态、策略或下一次决策。

具身智能把智能连接到物理身体、环境,以及两者之间持续发生的反馈。
- 01智能推理与目标
- 02身体物理能力
- 03环境周围世界
- 04感知感知环境
- 05行动在世界中行动
- 06反馈通过互动学习
具身智能与传统 AI 的区别
生成式 AI、LLM 和 VLM 可以提供表示或推理能力,却不因此拥有身体。VLA 可以把多模态上下文连接到动作表示或策略,但它不自动等于完整机器人系统,也不一定直接输出电机力矩。机器人学习提供获取行为的方法;它与具身智能有关,却不等同于具身智能。
具身智能在 Physical AI 中的位置
在 Physical AI 中,具身智能是把智能连接到物理能力、感知、行动、环境与反馈的系统层关系。不同系统会以不同方式组合语言、视觉、学习型策略、规划、控制和执行器。

具身智能横跨 Physical AI、学习型行动、机器人学习,以及不同的机器人身体形态。
- 01Physical AI在现实世界中行动的机器
- 02具身智能由互动塑造的智能
- 03VLA语言 · 视觉 · 行动
- 04机器人学习从数据与经验中学习
- 05人形机器人一种具身形态
- 06操作机器人接触与物体互动
- 07移动机器人在空间中移动
例子
RT-2 与动作表示
RT-2 是一个研究案例:它使用机器人数据适配视觉语言模型,并把动作表示为 token。它说明了一个可能的学习层,但不能证明存在通用的具身架构,也不能证明商业化部署。
Open X-Embodiment 与跨身体学习
Open X-Embodiment 研究如何共享机器人学习数据,并在不同身体形态之间进行迁移。这是一个研究方向的证据,并不意味着同一个策略可以在所有身体、任务或环境中普遍工作。
挑战
具身系统仍面临真实世界数据采集成本高、身体差异与校准负担、仿真到现实的不确定性、长时程任务恢复以及安全要求等挑战。离线指标或有说服力的演示本身,都不能证明系统能够稳定地在物理世界中运行。
结语
具身智能最好被理解为一种关系:智能在身体、环境、感知、行动与反馈的耦合中形成。人形机器人只是众多身体形态之一,VLA 等模型也只是可能参与更大系统的组件。