监督学习、模仿学习与强化学习
监督学习学“输入对应什么答案”,模仿学习学“专家在这个状态会怎么做”,强化学习学“哪些动作序列最终更有价值”。
机器人学习的名字很多,核心差异落在监督信号来自哪里。监督学习使用带标签样本 \((x_i,y_i)\),寻找参数 \(\theta\) 让模型预测接近标签。相机里的目标检测、深度估计、抓取点预测和故障分类都可以这样训练:
它的难点通常是标签成本与数据分布。工厂采集的清晰零件图,不能自动覆盖家庭里的遮挡、反光和杂乱背景。准确率也可能掩盖安全问题:一个 99% 准确的分类器若把所有错误集中在“有人进入工作区”这一类,仍然无法使用。
行为克隆是最直接的模仿学习。操作者通过示教器、主从机械臂、VR 控制器或手柄执行任务,系统记录观察 \(o_t\) 与动作 \(a_t\),再训练策略复制专家:
这把序列决策暂时变成了监督学习,训练稳定、容易利用真实示范,也不需要手写奖励。ALOHA 工作展示了低成本双臂遥操作和 ACT 策略如何学习精细双臂任务;Diffusion Policy 则把动作序列看作条件扩散生成过程,能够表达“从左绕开”与“从右绕开”等多峰动作分布,并通过滚动执行持续重规划。
行为克隆的核心漏洞是分布偏移。专家数据主要包含正确轨迹,部署后的策略会犯小错,下一帧就进入训练数据很少出现的状态;小错逐步累积,系统可能离专家分布越来越远。DAgger 的处理方式是让当前策略实际运行,再请专家标注这些新状态应采取的动作,把数据并回训练集。真实机器人上使用这种方法需要严格安全接管,因为有价值的数据往往就在策略快要失败的边缘。
强化学习把问题写成马尔可夫决策过程:智能体观察状态或观察,执行动作,环境返回奖励。目标是最大化折扣累计回报:
强化学习能发现人类未示范的动作,在步态、平衡、灵巧手和资源调度中很有价值。它也会忠实利用奖励函数的漏洞。若只奖励移动速度,机器人可能学会摔倒后滑行;若只奖励任务完成,策略可能用危险碰撞换取成功。奖励设计需要同时表达任务、能耗、平滑、碰撞、关节限制和安全终止,且各项权重改变可能带来完全不同的行为。
真实机器人试错昂贵,强化学习常在仿真中并行采样,再迁移到实机。离线强化学习尝试从已有日志学习,避免在线探索,但数据覆盖不足时会高估未见动作。模仿学习与强化学习也可以组合:先用专家示范把策略带到合理区域,再用奖励优化;或让示范参与回放缓冲区,提高稀疏奖励任务的学习效率。选择组合时应记录每一阶段改变了什么,避免最终成功无法归因。
“自监督学习”描述的是标签生成方式。模型可以从视频预测下一帧、从遮挡图像恢复内容、从多视角判断同一物体,标签由数据自身产生。它常用来预训练视觉或时序表示,随后再进入模仿或强化学习。人类第一视角视频拥有巨大的动作与场景覆盖,却通常缺少机器人的准确关节动作;它更适合学习语义、物体状态和粗略运动线索,无法直接替代带标定的机器人轨迹。
评估三类学习方法时,应同时看平均成功率、最差条件、恢复能力和所需干预。监督任务要按场景和风险类别拆分错误;模仿策略要测试起始偏差与中途扰动;强化策略要检查奖励分解、域外状态和安全约束。训练损失下降只说明优化目标被改善,部署目标是否改善还需实机重复试验。
状态、观察、动作和训练信号之间的区别值得反复确认。状态是完成决策所需的真实信息,观察是传感器能提供的部分;动作是策略可命令的变量,电机实际产生的效果还经过控制器和动力学;训练信号只指导参数更新,部署时可能完全不存在。行为克隆训练时看见专家动作,部署时只能依靠自己的观察;强化学习训练时获得奖励,现场运行往往不会即时得到准确奖励。把训练期特权信息误接到部署接口,是仿真结果无法落地的常见原因。
样本效率和最终性能也要分开。模仿学习借助人类高质量轨迹,通常能用较少交互进入可用区域,却容易复制示范偏差;强化学习可以超越示范并主动探索,真实试错成本高;监督预训练可以吸收大规模图像和视频,动作接地仍需机器人数据。项目常用的顺序是表示预训练、行为克隆初始化、仿真强化或离线优化、受限实机纠正。每一步都应和前一步做固定协议的增量比较。
深入阅读
- OpenAI, 强化学习基本概念:https://spinningup.openai.com/en/latest/spinningup/rl_intro.html
- MIT *Underactuated Robotics*,模仿学习:https://underactuated.mit.edu/imitation.html
- DAgger 原始论文:https://proceedings.mlr.press/v15/ross11a/ross11a.pdf
- ALOHA 项目与论文:https://tonyzhaozh.github.io/aloha/ 、https://arxiv.org/abs/2304.13705
- Diffusion Policy:https://diffusion-policy.cs.columbia.edu/ 、https://arxiv.org/abs/2303.04137