关于ACT训练和推理时图像和state的token分析

关于ACT训练和推理时图像和state的token分析
最近在做UMI采集的数据验证时,发现一个很奇怪的现象。背景说明:UMI采集的数据中轨迹点state是基于起点的,所以轨迹信息可以理解为是绝对的位姿信息,在模型训练时state就是UMI中的数据即绝对位姿,没有做修改,只是action是使用的相对的方式进行训练的(参考https://blog.csdn.net/qq_45445740/article/details/159967775?spm=1001.2014.3001.5501中 TouchGuide的训练思路),基于这个训练思路,认为在进行真机推理时,机械臂的起始位姿最好和UMI的起始位姿大致相同(就是在UMI上的末端夹爪和RGB相机的相对位姿要和机械臂上的严格一致前提外,还需要保证两个RGB相机中看到的目标画面大致相同,即UMI末端夹爪到平面的高度要和机械臂起始点上夹爪到平面的高度基本一致),模型需要建立一个空间中机械臂起始点的概念,得知道自己在哪儿才能更好的进行推理。实际推理结果:测试发现在 PI0.5 模型上进行推理,机械臂的起始位姿可以随意放置,只要不是偏离的很多并且能在第一帧看到物体的情况下,整个任务基本都能完成,似乎和上面的前提冲突了。问题:为什么初始state不同模型也能有不同程序的泛化?基于上面的实际推理结果,查看了 PI0.5 在推理中(单臂state + 夹爪state + 腕部相机image + 左触觉相机image + 右触觉相机image),state的总token占比很低,图像的总token占比很高,所以猜测是图像在模型推理中发挥了主要的作用。做了对比实验,在模型推理时会将输入的当前state转化为token送入给模型进行推理,在送入模型之前,将state的token都设置为0,表示推理时,仅靠图像的数据进行action的预测,发现也有一定的成功率,这就能解释的通为什么推理时对初始位姿不用那么严格一致了。这里以上面的思路为例,看一下ACT中state和image的token占比情况。目录