主题
视觉—语言—动作(VLA)
理解视觉—语言—动作模型如何把环境观察和自然语言指令转化为机器人行动。
视觉—语言—动作模型(Vision-Language-Action,VLA)把图像或视频观察、自然语言指令与机器人动作连接起来,目标是让机器人利用跨模态知识理解任务并生成可执行行为。VLA 是机器人学习与基础模型交叉形成的模型路线,但并不等同于所有机器人基础模型,也不意味着所有控制环节都必须端到端学习。
本主题关注训练数据、动作表示、模型架构、跨机器人与跨任务迁移、推理速度和安全约束,并区分基准成绩、实验室演示与真实环境中的稳定执行能力。
从这里开始
长期指南什么是机器人基础模型?从 AI 模型到物理智能
机器人基础模型把基础模型思想带入物理系统,解释数据、感知、行动、具身与反馈如何在现实约束下共同工作。
阅读文章 →相关内容
相关公司
最近更新: 2026年8月21日