近年来,人形机器人正在以惊人的速度走出实验室,进入工厂车间、仓储物流、家庭护理等实际场景。特斯拉的Optimus、波士顿动力的Atlas……一台台外形酷炫的"钢铁人"接连亮相,让外界对人形机器人的期待值拔到了新高。但一个关键问题被长期忽视:当这些机器人真正开始搬东西、推箱子、和人协作时,它们是否真的能扛得住现实世界里无处不在的外力冲击?
来自国内研究团队的最新研究,给出了一个令人警醒的答案:很多机器人控制系统,其实是"温室里的花朵"。
纸面上的优等生,现实里的落马者
长期以来,人形机器人的性能评估,主要依赖所谓的运动追踪基准测试,也就是看机器人能不能跟上一套参考动作。这类测试通常在"零阻力"的理想环境下进行,没有重量、没有摩擦、没有来自外部的推拉干扰。
这样的测试逻辑,有点像只考察运动员在空气中挥拳的姿势是否标准,却从不让他们实际打到沙袋。
研究团队在论文中直接点出了这一盲区:"传统的无力评估在很大程度上掩盖了系统之间真实的性能差异。"
为了填补这个空白,他们推出了一套名为ThorArena的基准测试体系。这套体系的核心思路是:先采集真实人类在执行物理交互任务时的运动数据和力数据,再把这些数据"喂给"虚拟机器人,看它在真实力量的冲击下能撑多久、表现如何。
怎么测?先让人穿上传感器套装
数据采集阶段颇具创意。操作员佩戴PICO 4 Ultra VR头显和全身动作捕捉器,同时手持一套配备三轴力传感器的定制3D打印工具,完成六项极具代表性的日常物理任务:擦桌子、从高处放下水桶、从地面举起水桶、拉动椅子、推动椅子,以及与另一人配合搬运物品。
每项任务采集60段完整演示序列,共计360段原始数据。每段记录不仅包含人体关键点的运动轨迹,还同步记录左右手三维方向上的实时受力情况。这份"运动+力"的配对数据,成为整套基准测试的核心素材。
在评估阶段,系统将录制好的受力序列实时"注入"物理模拟器,作用在虚拟人形机器人的手部,同时让不同的控制系统尝试驱动机器人跟随参考动作。
评分采用一种名为FATS(力感知跟踪分数)的综合指标,它将机器人的动作跟踪精度、在不同力度级别下的稳健性、能耗开销以及任务存活时长整合为一个分数,且有意加大了高强度力的权重,让"扛打"能力更直接地体现在最终评分中。
一旦施力,差距立现
研究团队对四个代表性人形机器人控制系统进行了对比评估,分别为自研的Thor2,以及另外三套主流系统TWIST2、GMT和SONIC。
在不施加外力的情况下,四个系统表现相当接近:存活率几乎都接近满分,跟踪精度差异不大。看起来,谁都是不错的选手。
然而,一旦打开力的回放,格局发生了剧变。在最具挑战性的"推椅子"任务中,TWIST2、GMT和SONIC三套系统的存活率骤降至0.73到0.81之间,远低于无力条件下接近满分的表现。这一任务之所以最难,是因为持续施加的水平推力会直接威胁机器人的整体平衡,而不只是干扰上肢动作精度。
Thor2在全部六项任务中保持了近乎完美的存活率,平均FATS得分达到81.71,比第二名高出约8个百分点,关键点跟踪误差也比其他系统低约25%。
值得注意的是,四个系统各有其"个性":SONIC倾向于顺应外力以保住平衡,却以牺牲动作精度为代价;GMT在高强度力下的追踪精度优于SONIC;TWIST2在力量级别变化时表现相对稳健。但在综合得分面前,这些局部优势并不足以掩盖整体差距。
这套结果印证了研究团队的核心判断:只看运动追踪,是看不出机器人真正实力的。而当外力加入,差距无处可藏。
下一步,团队计划扩充数据集,覆盖更多类型的任务和力的条件,并最终将测试延伸到真实的物理机器人上,以验证模拟结果与现实之间的一致性。
对于整个人形机器人行业而言,ThorArena提出的问题,或许比它给出的答案更重要:我们评估机器人的方式,是不是本身就出了问题?