跳到主要内容
BIMANUALEnglish

主题

视觉—语言—动作(VLA)

理解视觉—语言—动作模型如何把环境观察和自然语言指令转化为机器人行动。

视觉—语言—动作模型(Vision-Language-Action,VLA)把图像或视频观察、自然语言指令与机器人动作连接起来,目标是让机器人利用跨模态知识理解任务并生成可执行行为。VLA 是机器人学习与基础模型交叉形成的模型路线,但并不等同于所有机器人基础模型,也不意味着所有控制环节都必须端到端学习。

本主题关注训练数据、动作表示、模型架构、跨机器人与跨任务迁移、推理速度和安全约束,并区分基准成绩、实验室演示与真实环境中的稳定执行能力。

从这里开始

长期指南

什么是机器人基础模型?从 AI 模型到物理智能

机器人基础模型把基础模型思想带入物理系统,解释数据、感知、行动、具身与反馈如何在现实约束下共同工作。

阅读文章 →

相关内容

相关公司

最近更新: 2026年8月21日