主题
视觉—语言—动作(VLA)
理解视觉—语言—动作模型如何把环境观察和自然语言指令转化为机器人行动。
视觉—语言—动作模型(Vision-Language-Action,VLA)把图像或视频观察、自然语言指令与机器人动作连接起来,目标是让机器人利用跨模态知识理解任务并生成可执行行为。VLA 是机器人学习与基础模型交叉形成的模型路线,但并不等同于所有机器人基础模型,也不意味着所有控制环节都必须端到端学习。
本主题关注训练数据、动作表示、模型架构、跨机器人与跨任务迁移、推理速度和安全约束,并区分基准成绩、实验室演示与真实环境中的稳定执行能力。
最近更新: 2026年8月21日