PART 07 · CHAPTER 37

从 VLM 到 VLA:语言怎样进入机器人控制

一句话理解

VLM 把视觉和语言放进同一套表示中理解世界,VLA 再把机器人动作加入输出,使模型能够从“看懂和听懂”走向“提出可执行动作”。

约 2,151 字约 5 分钟6 个来源1 幅教学图

视觉语言模型(VLM)接收图像和文本,输出文本、类别或其他语义表示。它可以回答“红色杯子在哪里”“哪件工具适合拧螺丝”,也能把自然语言目标转成任务计划。PaLM-E 展示了一条典型路线:把图像、机器人状态等连续输入编码成与语言 token 同维度的向量,再送入预训练语言模型。语义能力扩大了任务接口,但 VLM 的文本输出通常仍需调用抓取、导航等技能。

视觉—语言—动作模型(VLA)把动作也纳入模型输出。RT-2 将末端位移、旋转、夹爪状态和终止标志离散成 token,与网页视觉问答数据和机器人轨迹共同训练;OpenVLA 采用开源视觉语言骨干,在机器人示范上微调;后续系统也使用连续动作头、扩散头或流匹配生成动作块。VLA 的共同目标是学习条件分布:

\[\pi_\theta(a_{t:t+H}\mid I_{t-k:t},l,q_{t-k:t})\]

其中 \(I\) 是一个或多个相机序列,\(l\) 是语言指令,\(q\) 是本体状态,\(a_{t:t+H}\) 是未来一段动作。一次预测多个动作能减少逐步推理带来的抖动和计算开销,也会降低遇到突发变化时的反应速度。工程上常用滚动时域:每次只执行动作块前一小段,然后重新观察并预测。

语言模型带来的“世界知识”主要是语义先验。例如“可乐罐属于可回收物”可以帮助选择目标,“易碎”可以提示需要轻拿。物理执行仍依赖机器人数据建立语言、视觉和动作之间的接地关系。网页图像很少告诉模型具体机械臂的关节限位和夹持力,文本也无法校准相机外参。RT-2 的价值正在于共同训练如何让网页语义迁移到机器人任务;它的公开实验同样提醒读者,结果来自指定机器人、任务和评测分布,不能自动推广到任意身体和场景。

VLA 有两类系统形态。端到端策略直接从感知和指令输出低层动作,接口短、能够联合优化,却更难诊断和施加硬约束。分层系统让 VLM 生成计划或选择技能,再由技能策略与控制器执行。SayCan 就把语言模型认为“有助于目标”的程度,与技能价值函数估计“当前能否成功”的程度组合起来。分层架构便于复用经过验证的技能,也会受到技能库覆盖和高低层接口误差限制。

动作表示是经常被忽视的关键。模型可以输出关节位置、关节速度、力矩、末端增量、绝对位姿、关键点或轨迹草图。末端增量较容易跨相近机械臂共享,仍需逆运动学和低层控制;直接力矩控制表达力强,对频率、动力学和安全要求更高;二维轨迹草图可借助视觉预训练,却无法完整描述深度、接触力和姿态。评估 VLA 时必须写清动作坐标系、单位、频率、时间窗和执行控制器。

FIGURE 01VLM、分层机器人系统与端到端 VLAVLM任务计划技能选择控制器图像+语言+本体状态VLA
图 1 VLM、分层机器人系统与端到端 VLA

模型规模也要服从实时预算。假设相机采集、预处理、推理、网络传输和控制下发的总时延为 \(T_{loop}\),闭环带宽就受其限制:

\[T_{loop}=T_{sensor}+T_{pre}+T_{infer}+T_{network}+T_{actuate}\]

云端大模型擅长高层推理,网络抖动和数据治理使其很难直接承担高频安全控制;端侧模型响应稳定、隐私边界清楚,算力和热设计限制更强。实际系统可以用云端或大模型做低频计划,端侧策略做技能执行,独立控制器维持稳定与安全。

理解 VLA 的正确期待是:它降低了新任务的编程成本,扩大了语义和场景泛化范围,同时把传统软件中的显式规则转移成了数据、模型和评测责任。输入中的歧义、数据偏差和模型过度自信会直接进入动作链,因此部署还需要任务确认、动作前检查、低置信度接管和可追溯日志。

从原始数据训练 VLA 可以按四段理解。第一段把图像、语言、本体状态和动作对齐成统一时间窗;第二段使用视觉语言预训练获得对象、关系和指令表示;第三段在机器人轨迹上共同微调,让动作头学会身体特定的控制接口;第四段在部署时用滚动窗口反复观察、推理和执行。任何一段的坐标、时序或归一化变化都会让后续模型失效,因此模型配置必须和相机、标定及控制器版本绑定。

VLA 的失败可分为语义、空间、动作和闭环四类。语义失败会选错对象或误解指令;空间失败会理解对象却估错深度、遮挡或可达性;动作失败会生成不平滑、越界或不适合末端的轨迹;闭环失败会在物体滑动或人介入后继续执行旧计划。四类失败需要不同测试与修复,单纯增加模型参数无法自动解决标定、控制频率和安全通道问题。

部署还要校准“会拒绝”的能力。模型输出概率通常没有直接对应物理风险,温度缩放等统计校准也只能在相近分布内改善置信度。工程系统可组合图像质量、可达性、碰撞距离、动作变化率、策略不确定性和历史失败,形成动作准入条件。准入失败时先重新观察或询问,随后降级到已验证技能,最后请求人工接管。

深入阅读