PART 04 · CHAPTER 20

计算与控制电子:CPU、GPU、MCU、FPGA怎样分工

一句话理解

机器人用不同计算器处理不同时间尺度:GPU 吞吐感知与模型,CPU 组织复杂程序,MCU 守住确定性的电机回路,FPGA 处理固定而并行的高速数据通路。

约 2,243 字约 5 分钟2 个来源1 幅教学图

原理组成

CPU 擅长通用控制流、操作系统、规划和复杂分支,少量强核能快速处理串行任务;GPU 包含大量并行计算单元,擅长矩阵、图像和神经网络,吞吐高,任务调度与内存搬运会带来延迟;MCU 把处理器、存储、定时器、ADC、PWM 和通信外设集成在芯片上,功耗低、启动快,适合电机电流环、传感采样和安全监控;FPGA 由可配置逻辑与片上存储组成,可把协议、滤波和并行流水线直接映射为硬件,确定性强,开发验证成本较高。

常见分层是:关节驱动板上的 MCU 以数十微秒到数百微秒周期采样电流并更新 PWM;整机实时控制器以亚毫秒到数毫秒周期计算关节力矩;高层 CPU/GPU 以数十毫秒处理视觉、地图、规划或大模型。周期数字只是示意,必须由被控对象带宽、通信和安全需求推导。高层指令即使偶尔迟到,底层仍应维持稳定或进入安全状态。

实时性关注截止期限。吞吐量回答一秒能完成多少工作,实时性回答每次工作是否在最晚时刻前完成。控制循环要限制页面错误、动态内存分配、不可控锁等待、中断风暴和温度降频。操作系统可使用实时调度、CPU 隔离、锁定内存和优先级继承;硬件看门狗监督软件活性,独立安全 MCU 可以在主计算机死机时切断使能。

数据路径同样重要。摄像头数据经 MIPI、USB 或以太网进入内存,GPU 运算前后可能发生复制;零拷贝与共享内存可降低延迟,但会增加生命周期与一致性复杂度。电流采样需要与 PWM 中点对齐,编码器采样要与总线分布式时钟对应。时钟源、晶振漂移、同步触发和时间戳位置都属于计算架构。

电子硬件由处理器之外的电源树、存储、PHY、时钟、监控、隔离和 PCB 构成。高 di/dt 的功率回路要小环路布局,模拟采样要远离开关节点,地与屏蔽策略要依据回流路径设计。连接器引脚错误、启动时序和固件升级中断,都会让“算力足够”的系统无法稳定运行。

参数与取舍

CPU/GPU 选型应从任务模型、精度格式、内存容量、内存带宽、端到端延迟、平均/峰值功耗、热设计功耗、启动时间、长期供货与软件生态出发。TOPS 只描述某类数值格式下的理论算力,内存、算子支持和调度可成为瓶颈。MCU 看主频之外,还要看 PWM 分辨率、ADC 同步能力、定时器、浮点、存储、通信外设、功能安全机制与工具链。FPGA 看逻辑、DSP、片上 RAM、收发器、时序余量和工程团队验证能力。

集中式计算减少板卡数量,传感与执行线路更长,单点故障影响大;分布式关节控制缩短模拟与功率路径,节点、协议、固件版本和同步管理更多。异构系统要明确每层的“降级契约”:GPU 过热降频时是否降低视觉帧率;主 CPU 重启时关节 MCU 保持、软停还是断能;总线中断后本地控制器能维持多久。

FIGURE 01四级计算栈与截止期限MCU:ADCPWM保护实时 CPU:状态估计全身控制CPU:规划
图 1 计算分工依据时间确定性、数据并行度和故障边界。

算力选型可以用端到端流水线核算。以四路相机为例,应依次列出传感器输入带宽、解码与预处理、模型权重和中间张量占用、推理时间、结果后处理与跨进程传输,峰值内存往往高于模型文件大小。多个任务共享 GPU 时,调度和显存回收会改变长尾时延。把感知模型缩小一半可能释放热与功耗余量,也可能降低困难场景召回;硬件决定前需用目标模型、目标精度和真实输入做剖析。

计算预算应写最坏执行时间(WCET)的测量条件和裕量。平均一帧 10 ms、偶发 80 ms 的视觉任务,无法稳定支撑 30 ms 截止期限。需要同时统计高分位与最大值,触发缓存回收、日志写盘、网络拥塞、模型切换和温度降频等压力条件。内存预算还要覆盖峰值图像队列、模型工作区和故障日志;队列应有长度上限和丢弃策略,防止过时数据不断堆积。

上电与掉电也是控制电子的工况。各电源轨必须按器件要求排序,复位保持到时钟和电压稳定,安全输出在 GPIO 配置前保持禁用。棕断时 MCU 可能仍运行而驱动电压已不足,输出状态要可预测;关机日志不能依赖已经掉电的存储。硬件在环测试可注入 CPU 负载、总线风暴、传感异常、过温和电源跌落,确认每层的看门狗、超时和降级契约真的生效。

典型失效包括算力峰值造成电源跌落、热降频导致周期超时、内存纠错事件、存储磨损、接插件瞬断、MCU 固件死锁、FPGA 时序边界在温度下失效和 OTA 更新后版本不兼容。系统应记录循环最大执行时间、超时次数、温度、频率、内存与错误复位原因,方便把偶发故障变成可复现证据。

工程例子

一台移动操作机器人可让 GPU 每 33 ms 处理一帧多相机感知,CPU 每 10 ms 更新局部规划,实时 CPU 每 1 ms 计算全身控制,各关节 MCU 每 50 μs 更新电流。若视觉耗时突然升到 80 ms,高层可以丢弃旧帧;1 ms 控制任务仍按惯性与关节反馈维持平衡。这样的时间隔离来自明确队列、优先级和降级策略,不能只靠平均算力余量。

验证时应在冷启动、热稳态和低电压三个边界运行相同任务,并叠加日志写盘、网络突发和后台升级检查长尾。示波器可用 GPIO 翻转标记控制循环起止,与 PWM 更新和传感触发放在同一时间轴;软件则统计每周期执行时间和截止期限违例。对看门狗、ECC、存储损坏和升级断电做故障注入后,还要验证输出先进入定义状态、复位原因可回读、兼容版本能够安全恢复。

深入阅读

ROS 2 pendulum_control 实时演示 解释控制路径为何要避免页面错误、动态分配和无界阻塞;边缘 GPU 平台可从 NVIDIA Jetson Modules 了解集成形态,产品数字应按项目时点重新核验;电机控制 MCU 与安全架构需继续阅读具体器件参考手册、勘误表和安全手册。