PART 01 · CHAPTER 03

具身智能到底是什么

一句话理解

具身智能研究一个有身体的智能体,怎样在“感知—判断—行动—反馈”的循环中学会完成现实任务。

约 2,031 字约 5 分钟5 个来源1 幅教学图

“具身”首先意味着智能受到身体和环境的共同约束。一个只在屏幕上回答问题的模型,可以用文字描述水杯;一台端水杯的机器人还要判断杯子在哪里、杯里有多少液体、手能否伸到、夹持力会不会把杯子压坏、移动时怎样避免液体晃出。每一次动作都会改变下一刻看到的世界,动作也可能带来不可逆的后果。机器人因此面对一个闭环问题:它观察到的内容取决于过去做过什么,未来能做什么又取决于身体结构、能源、摩擦、时延和安全边界。

早期具身思想强调“世界就是最好的模型”。Rodney Brooks 在 1991 年的论文《Intelligence without Representation》中主张,让完整的感知—行动系统逐层获得能力,避免把全部问题都押在一套中心化符号表示上。Pfeifer 与 Bongard 随后从形态计算的角度指出,身体材料、形状与环境接触本身也承担计算:被动顺应的手指能贴合物体,弹性腿能储存并释放能量,这些结构会降低控制算法的负担。今天的具身智能又吸收了深度学习、基础模型和大规模数据,使系统能够从图像、语言、触觉与动作轨迹中学习可迁移的表示。历史路径发生了变化,闭环交互这一核心没有变化。

可以把具身智能拆成六个相互牵制的问题。第一是身体:关节、末端、传感器和驱动器决定动作空间。第二是感知:摄像头、力传感器和本体传感器只能给出带噪、局部且有时延的观察。第三是状态:系统要估计“世界现在怎样”,包括机器人位姿、物体状态和人的意图。第四是决策:在任务约束下选择下一步。第五是控制:把目标转成稳定、实时、受限的电机命令。第六是学习:从示范、试错、仿真和运行数据中改善上述环节。任何一个环节失真,都可能让语言上合理的计划变成物理上失败的动作。

在数学上,机器人通常无法直接看到完整状态 \(s_t\),只能得到观察 \(o_t\);策略根据当前观察和历史记忆 \(h_t\) 选择动作 \(a_t\)

\[o_t \sim O(\cdot\mid s_t),\qquad a_t\sim\pi_\theta(\cdot\mid o_t,h_t),\qquad s_{t+1}\sim P(\cdot\mid s_t,a_t)\]

这组式子说明了三个边界。视觉图像只是状态的投影;同一张图可能对应不同的重量、摩擦和遮挡关系。策略输出会进入动力学,不能停留在概率空间。历史信息可能不可缺少,例如机器人刚才把工具放进哪个抽屉,当前画面已经看不到它。

FIGURE 01智能发生在闭环里身体执行安全约束失败记录数据安全监督本图用于解释“具身智能到底是什么”的关键关系
图 1 智能发生在闭环里

具身智能和机器人学的范围有交集,也各有外延。机器人学还研究无需学习的机构、运动学、控制、安全和系统集成;具身智能也可以在虚拟环境里研究导航、交互和学习,而不一定使用实体机器人。人形机器人提供一种接近人类尺度和工作空间的身体,具身智能还可以运行在轮式底盘、机械臂、四足、无人机或软件模拟体上。判断一个系统是否具有较强具身能力,应观察它能否在环境变化后重新感知和调整,能否处理未完全预编程的任务,以及失败时能否安全退出。

现实项目常见的误区是把自然语言接口当作具身智能的全部。语音指令能让演示更直观,却不能自动解决抓取稳定性、碰撞、急停和恢复。另一个误区是把“端到端”理解为取消工程边界。即使策略从像素直接预测动作,执行链上仍然需要标定、时钟同步、低层伺服、安全控制器和运维系统。端到端描述的是学习映射的跨度,并不取消物理系统的分层责任。

理解具身系统时,还要区分能力、自治与通用性。能力说明它能完成哪些任务;自治说明完成过程中需要多少人类判断和控制;通用性说明同一套系统能覆盖多少任务、身体和环境。远程操控机器人可以拥有很强的机动与操作能力,但自治程度有限;自主扫地机器人自治程度较高,任务范围却很窄。三个维度分别测量,才能避免把“动作漂亮”“无人遥控”和“可完成多任务”混成同一句宣传。

一个简单观察实验能建立闭环直觉:让机械臂面对位置固定的杯子执行十次抓取,再把杯子平移、换成透明材质、在抓取中轻推杯子。开环轨迹可能只在第一组成功;带视觉重定位的系统能处理位置变化;带力或触觉反馈和恢复策略的系统才可能应对接触扰动。每增加一类变化,系统需要的新能力都可以定位到感知、状态、策略、控制或安全层。

深入阅读