每项任务采集60段完整演示序列,共计360段原始数据。每段记录不仅包含人体关键点的运动轨迹,还同步记录左右手三维方向上的实时受力情况。这份"运动+力"的配对数据,成为整套基准测试的核心素材。
在评估阶段,系统将录制好的受力序列实时"注入"物理模拟器,作用在虚拟人形机器人的手部,同时让不同的控制系统尝试驱动机器人跟随参考动作。
评分采用一种名为FATS(力感知跟踪分数)的综合指标,它将机器人的动作跟踪精度、在不同力度级别下的稳健性、能耗开销以及任务存活时长整合为一个分数,且有意加大了高强度力的权重,让"扛打"能力更直接地体现在最终评分中。
一旦施力,差距立现
研究团队对四个代表性人形机器人控制系统进行了对比评估,分别为自研的Thor2,以及另外三套主流系统TWIST2、GMT和SONIC。
在不施加外力的情况下,四个系统表现相当接近:存活率几乎都接近满分,跟踪精度差异不大。看起来,谁都是不错的选手。
然而,一旦打开力的回放,格局发生了剧变。在最具挑战性的"推椅子"任务中,TWIST2、GMT和SONIC三套系统的存活率骤降至0.73到0.81之间,远低于无力条件下接近满分的表现。这一任务之所以最难,是因为持续施加的水平推力会直接威胁机器人的整体平衡,而不只是干扰上肢动作精度。
Thor2在全部六项任务中保持了近乎完美的存活率,平均FATS得分达到81.71,比第二名高出约8个百分点,关键点跟踪误差也比其他系统低约25%。