ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

SEED-UMI 论文深度分析总结

SEED-UMI 论文深度分析总结 SEED-UMI 论文深度分析总结论文题目SEED-UMI: Sharing the Exoskeleton between Human and Robot for onE-to-one Dexterous Demonstration人类与机器人共享外骨骼实现一对一灵巧演示作者机构于腾博、吴嘉豪、李道翰等来自北京大学通用人工智能全国重点实验室智能科学技术学院与 Delta Intelligence增量智能通讯作者为刘航欣hx.liupku.edu.cn项目主页https://tengbo-yu.github.io/SEED-UMI/​一、研究背景与问题定位灵巧手操作是机器人学习领域公认的最具挑战性的方向之一其难点源于机器人手极高的自由度本文中为 20 个自由度以及操作过程中大量富含接触contact-rich的交互。模仿学习Imitation Learning, IL虽然已经让机器人在运动控制和手臂操作上取得显著进展但在灵巧操作上的进展相对滞后。作者将瓶颈明确定位于两个环节示教数据采集与重定向retargeting——即如何精确记录人类自然的手部运动并将其可靠地迁移到运动学、传感与接触特性均不相同的人形/机械手上。1.1 现有示教采集方法的困境论文系统梳理了三类主流采集路线及其“精度—自然度”的固有矛盾1基于视觉的手部追踪。此类方法如手部姿态估计系统不约束手部运动示教自然流畅。但一旦手与物体发生实际接触遮挡和时间抖动会显著降低数据质量。更关键的是视觉系统通常把灵巧操作简化为末端执行器控制精细的指间运动难以可靠恢复。2基于手套的系统。配备惯性或弯曲传感器可为交互式任务提供更可靠的运动数据但存在皮肤运动伪影skin-motion artifacts且需要复杂的人手—机器人关节对应映射。3外骨骼式设备。产生的手部姿态测量与机械约束下的手部运动完全一致一致性最高但硬件笨重、束缚性强牺牲了操作员舒适度和示教吞吐量。论文进一步指出一个深层问题采集方式从根本上塑造了下游学习问题的形式。现有灵巧模仿学习流水线大多把“人类示教”和“机器人执行”当作两个独立的域通过越来越复杂的重定向模型连接起来。近期外骨骼系统如 DexUMI 系列通过与目标机器人手协同设计缩小了对应差距——将关节编码器对齐到机器人自由度、把腕部相机装在机器人末端视角——但它们仍是从人手到机器人手的单向开环映射重定向在自由空间free space中标定一次在真实接触负载摩擦、外力、关节耦合下会退化DexUMI 等还依赖生成式图像翻译inpainting弥合人—机视觉差异机器人侧的测量本身却没有被用来改进对应学习。1.2 核心思想共享物理测量SEED-UMI 的破题思路不是继续改进重定向算法而是重新设计人与机器人本体之间的接口让人类操作员和机器人灵巧手穿戴同一个外骨骼。由此产生两个关键性质关节编码器成为物理共享的测量——同一机械结构下人侧和机侧产生同源的编码器读数 e_t ∈ ℝ²⁰两侧在相同指令下的编码器轨迹差异自然成为有监督的配对信号腕部相机刚性安装在外骨骼上——人采集数据和机器人策略回放时观察到的“外骨骼—外部机构—物体”视觉布局完全一致策略可以直接在原始外骨骼中心腕部图像上训练无需分割、无需图像修复/生成式翻译。这一转变把重定向从“开环标定”问题转化为配对跨本体监督学习paired cross-embodiment supervision问题。二、系统总体框架对应 Figure 1、Figure 3Figure 1展示了 SEED-UMI 的数据采集界面与任务集上方为人类操作员与灵巧机器人手穿戴同一外骨骼的场景——示教和机器人回放通过同一物理设备记录编码器匹配、腕部相机匹配下方为五个代表性富接触任务工具使用、小物体放置、抓取—抛掷时序控制、富接触桌面清理、多指驱动喷雾。Figure 3给出完整流水线人类通过共享外骨骼采集示教 → 配对机器人回放精化“编码器—指令”映射 → 学习到的策略在匹配的外骨骼中心观测下于机器人上回放执行。三段式软件适配第 4 节 硬件共享设计第 3 节构成方法主体实验第 5 节验证有效性。三、硬件设计一个共享的外骨骼第 3 节硬件设计的总原则是让人侧与机侧的接触面外骨骼几何与编码器坐标系完全匹配而袖套和安装件按各自本体适配。由此编码器读数成为共享的跨本体测量同指令下的两侧编码器差异即可监督残差的“指令—关节”映射。Figure 2展示了同一外骨骼分别由人类操作员左和全驱动目标灵巧手右穿戴的情形每个关节一个非接触式旋转编码器、背侧 T265 用于 6 自由度腕部跟踪、掌侧鱼眼相机全部刚性固连在外骨骼框架上保证编码器向量 e_t 和腕部相机内参在两侧本体上完全一致。3.1 外骨骼机构设计该外骨骼与单一全驱动灵巧手作为唯一目标平台协同设计。作者明确放弃了跨平台通用性以换取两个更强的性质E.1 运动学同构骨架Isomorphic kinematic skeleton。目标手的每个主动自由度对应一个旋转关节连杆长度与机器人指骨长度一致关节轴朝向相同硬限位复现机器人的运动范围。因此操作员能到达的位形恰好就是机器人能到达的位形。外骨骼共实现 5 指共 20 个独立测量的关节。E.2 平行四连杆编码器走线Parallel four-bar linkage。若把编码器直接装在指间关节侧轴上外壳会侵入侧向间隙包络、限制外展/内收范围并遮挡部分掌面接触面破坏共享几何性质。论文将旋转运动通过平行四连杆引至背侧安装的非接触式磁性编码器连杆保持关节轴与编码器轴之间的一对一角度对应同时掌面和侧面保持无遮挡Figure 4 (a) 展示了设计在运动过程中的避碰效果(b) 展示了连杆的工作过程。连杆长度按手指逐一调优以最小化背部高度各枢轴采用压装磁体组件与精密轴套轴承保证反复穿戴下编码器对位稳定。E.3 两侧完全相同的接触几何。人侧与机侧实例共享同一外部骨架连杆长度、关节轴、背侧连杆、掌面指尖垫均一致袖套与安装件只在不变更关节坐标系的前提下适配各自本体。因此两侧对物体呈现相同的外部接触几何人—机编码器差异主要反映负载相关效应接触力、摩擦、迟滞这正是第 4 节残差映射学习所利用的信号。3.2 传感器集成所有传感器均安装在外骨骼框架上使每个信号无论由哪一侧穿戴都记录在同一物理坐标系中。两个设计目标(i) 捕获下游策略学习所需的动作与观测通道(ii) 最小化这些通道在人侧与机侧之间的分布偏移。S.1 关节编码器每个主动关节集成非接触式磁性旋转编码器人侧与机侧实例的编码器安装位置相同拼接各关节读数得到 e_t ∈ ℝ²⁰。由于四连杆走线与制造公差外骨骼编码器读数 e_t 到机器人关节指令 q_t 的映射是非线性的因此用数据驱动模型学习第 4 节。S.2 腕部相机背侧 Intel RealSense T265 提供 6 自由度腕部位姿掌腹侧鱼眼相机150° 视场角观察工作空间。二者均刚性固连于外骨骼内参与“编码器系—相机系”外参在两侧固定不变。由于采集与回放使用同一“外骨骼—相机”组件策略获得的原始观测 I_t 只需标准光度与裁剪增广。与 DexUMI 不同这种硬件层对齐不需要手部分割或图像修复保留了接触像素这对精细操作至关重要。四、软件适配两阶段跨本体映射第 4 节共享外骨骼给出共同的编码器信号 e_t ∈ ℝ²⁰但机器人执行仍需编码器→指令映射 e_t ↦ q_t。SEED-UMI 不在自由空间一次拟合该映射而是先用机器人电机乱动motor babbling自举再在真实接触下的配对回放中精化。该映射是本体感觉proprioceptive层面的而对齐的腕部图像专门留给策略学习。M.1 机器人电机乱动Motor babbling。机器人穿戴外骨骼执行结构化探索协议单关节扫掠、多速度耦合运动、若干自接触位形。记录机器人关节位置 q_t 与机侧编码器读数 e_t^®历史向量 h_t 拼接前 K 帧编码器读数、有限差分编码器速度以及每个关节的二值开/合方向指示。拟合初始映射​f θ 0 : ( e t , h t ) ↦ q t f_{\theta^0} : (\mathbf{e}_t, \mathbf{h}_t) \mapsto \mathbf{q}_tfθ0​:(et​,ht​)↦qt​​该自由空间模型捕捉基本运动学与历史效应但在接触下仍会漂移由此引出 M.2。M.2 配对回放与精调Paired replay and fine-tuning。人类操作员穿戴外骨骼执行代表性物体抓取动作记录富接触编码器轨迹 {e_t^(h), h_t^(h)}将每条示教经 f_θ⁰ 在机器人上回放并从机侧外骨骼记录 {e_t^®, h_t^®, q_t^®}构成配对映射数据集​D map { ( e t ( h ) , h t ( h ) , q t ( r ) , e t ( r ) , h t ( r ) ) } \mathcal{D}_{\text{map}} \{(e_t^{(h)}, h_t^{(h)}, q_t^{(r)}, e_t^{(r)}, h_t^{(r)})\}Dmap​{(et(h)​,ht(h)​,qt(r)​,et(r)​,ht(r)​)}​定义从机器人指令与编码器历史到机侧编码器读数的前向模型 g_φ将 f_θ 作为逆问题精调损失函数为论文公式 (1)​L map ∥ g ϕ ( f θ ( e t ( h ) , h t ( h ) ) , h t ( h ) ) − e t ( h ) ∥ 2 2 β ∥ f θ ( e t ( h ) , h t ( h ) ) − q t ( r ) ∥ 2 2 λ ∥ Δ f θ ∥ 2 2 \mathcal{L}_{\text{map}} \left\| g_{\phi}\big(f_{\theta}(\mathbf{e}_{t}^{(h)}, \mathbf{h}_{t}^{(h)}), \mathbf{h}_{t}^{(h)}\big) - \mathbf{e}_{t}^{(h)} \right\|_{2}^{2} \beta \left\| f_{\theta}(\mathbf{e}_{t}^{(h)}, \mathbf{h}_{t}^{(h)}) - \mathbf{q}_{t}^{(r)} \right\|_{2}^{2} \lambda \left\| \Delta f_{\theta} \right\|_{2}^{2}Lmap​​gϕ​(fθ​(et(h)​,ht(h)​),ht(h)​)−et(h)​​22​β​fθ​(et(h)​,ht(h)​)−qt(r)​​22​λ∥Δfθ​∥22​​三项的物理含义分别是(1)前向一致性项——通过可学习的前向模型 g_φ使“指令→预期编码器读数”与人类示教轨迹匹配(2)配对回放正则项——将指令向回放中实测的机器人指令 q_t^® 靠拢(3)时间平滑项——惩罚指令的跳变。整个回放—精化过程只需重复一次即可把自由空间乱动模型变为接触鲁棒的编码器—指令函数全程无需人工重新标定。值得强调的方法论要点配对回放阶段不假设初始回放能完美复现人类轨迹而是把“人侧编码器轨迹”与“机侧编码器响应”之间的差异作为指令映射的修正信号——这正是共享物理测量思想最精妙的体现。M.3 策略训练与回放。下游策略采用 ACT、Diffusion PolicyDP与 π₀.₅ 三种骨干输入为原始腕部观测 I_t 与编码器向量 e_t输出长度为 L 的动作块action chunk包含 6 自由度腕部动作与 20 自由度手部指令。所有策略训练只用人类采集的真实数据不涉及仿真、强化学习、手部分割或生成式图像修复。定性研究Figure 6以 AirPods 插入任务对比 SEED-UMI 与遥操作的回放质量图中蓝色为人类侧、橙色为机器人侧编码器轨迹。SEED-UMI 采集时操作员直接执行插入动作可凭借即时视觉与物理反馈调节精细接触遥操作则把操作员与物体接触隔离开回放容易“过驱动”、施加过大力可能损坏易碎物体。这解释了 SEED-UMI 在精确富接触示教上优于遥操作的原因。五、实验评估第 5 节5.1 实验设置硬件平台RealMan RX75 机械臂 无极Wuji灵巧手每指 4 个主动自由度共 20 个人侧与机侧穿戴第 3 节所述共享外骨骼背侧 T265 提供 6-DoF 腕部位姿掌腹侧 150° 鱼眼相机提供策略观测腕部轨迹采用固定的 T265-工具中心点TCP对齐不做轨迹修正。五个真实任务Figure 5 展示了策略回放场景覆盖工具稳定、食指—中指协调、抓放时序、持续接触与拇指参与的多指驱动螺丝刀拧紧Screw Driving抓起电动螺丝刀、对准螺丝头在拧紧过程中保持轴向压力与稳定抓握AirPods 充电盒插入捏起 AirPod 插入充电盒需要食指—中指协调盒内磁铁辅助最终对位抛球入篮Ball Basket Throwing从桌面抓球、抬起、释放入目标篮考验精确的抓—放时序桌面清理Table Cleaning抽取纸巾、在持续接触下擦拭桌面、丢弃纸巾空气清新剂喷雾Air Freshener Spray稳固抓握喷雾罐通过多指支撑与拇指动作发起向下按压。三种对比条件遥操作T操作员穿戴外骨骼编码器读数实时映射为机器人手电机指令策略在机侧记录的示教上训练P⁻无配对精调策略在人侧示教上训练部署时仅用乱动映射 f_θ⁰P⁺有配对精调策略在人侧示教上训练部署用 SEED-UMI 完整流水线精化后的映射 f_θ。训练与标定数据每策略每任务 100 条示教初始物体位置在任务特定范围内随机化配对精调用 250 条标定回合5 种尺寸、形状、刚度、抓取类型各异的物体各 50 条每条标定回合将同一物体刚性固定在桌面某一位姿人先抓握机器人随后经 f_θ⁰ 回放该动作。P⁻ 与 P⁺ 的策略学习仅使用人侧示教。评估协议三种骨干ACT、DP、π₀.₅× 三种条件 × 每任务组合进行 20 次自主机器人回放报告完成主动作序列的百分比。喷雾任务的成功定义为稳固抓握且明确发起向下按压因手部驱动力限制不要求按压到底或实际喷出。采集效率对比同一操作员在 30 分钟窗口内采集成功的 AirPods 示教条数且不计入一次性的配对回放与优化开销。5.2 主要结果Table 1论文核心表格如下成功率为 20 次自主回放的百分比T 机侧遥操作示教训练P⁻ SEED-UMI 无配对精调P⁺ SEED-UMI 有配对精调PolicyScrew TScrew P⁻Screw P⁺AirPods TAirPods P⁻AirPods P⁺Throw TThrow P⁻Throw P⁺Clean TClean P⁻Clean P⁺Spray TSpray P⁻Spray P⁺ACT80.055.070.065.065.075.060.060.070.075.050.065.090.070.085.0DP65.040.055.055.055.060.050.050.055.060.040.055.070.045.060.0π₀.₅90.060.080.075.075.085.070.070.080.085.060.075.085.065.080.05.3 关键发现F1SEED-UMI 在精细与动态任务上更优。所有任务与骨干平均遥操作 71.7%P⁺ 70.0%P⁻ 57.3%。配对精调几乎保留了机侧数据的全部质量同时把机器人从人类采集环节中完全移除。任务层面的模式更有信息量P⁺ 在 AirPods 插入73.3% vs 65.0%和抛球68.3% vs 60.0%上超过遥操作基线——而这正是实时遥操作最不自然的场景因为小的姿态修正和快速的抓—放时序很难通过带延迟的机器人控制回路完成。F2配对精调在接触负载下作用最大。P⁻→P⁺ 的平均提升为 12.7 个百分点且集中于接触负载主导的任务拧螺丝 16.7、桌面清理 15.0、喷雾 15.0。这与预期吻合仅乱动训练的 f_θ⁰ 在自由空间训练在手指柔顺受力下漂移配对回放损失公式 1恰好修正的正是这一失效区间。F3SEED-UMI 采集效率显著高于遥操作Figure 7 展示效率—质量权衡。在 30 分钟窗口内的 AirPods 任务上同一操作员经遥操作采集了 18 条成功示教经 SEED-UMI 采集了 52 条吞吐量约3.0 倍。由于 P⁺ 与遥操作的回放成功率几乎持平70.0% vs 71.7%按成功率归一化后每分钟有效训练数据的增益仍约2.9 倍。SEED-UMI 的实践价值不在于以牺牲数据质量换速度而在于把人类示教与实时机器人执行解耦同时由配对精调弥补几乎全部质量差距。六、结论、局限与评述6.1 结论论文提出了 SEED-UMI——以共享外骨骼为人—机示教接口的规模化高效数据采集与策略学习框架。通过让人与机器人穿戴同一机构SEED-UMI 借助配对编码器监督把自然的富接触人类动作迁移为机器人动作同时保持对齐的原始腕部观测。在具有挑战性的真实世界实验中达到 70.0% 平均成功率数据采集速度较遥操作快 3.0 倍确立了遥操作之外大规模采集真实灵巧手数据的新途径。6.2 局限性作者坦诚指出系统尚未对不同灵巧手完全自动化——适配不同的连杆布局、关节限位与驱动范围仍需在外骨骼几何、标定动作与配对回归目标上做工程决策操作员穿戴外骨骼会影响穿戴性、穿脱时间与长时程/精细操作的便利性。未来方向包括跨手型设计自动化、改善穿戴体验、引入触觉传感以更精确估计接触。6.3 评述个人分析从方法论看本文最重要的贡献是视角转换与其在“人手域→机器人域”之间堆叠更复杂的重定向模型不如让接口本身成为共享测量仪器把重定向转化为有监督逆问题。三点尤为出色E.3 M.2 的闭环两侧相同的接触几何使编码器差异“纯净地”反映负载效应成为可利用的监督信号而非需消除的噪声——这是把物理约束转化为学习信号的优秀范例视觉对齐“在硬件层解决”相比 DexUMI 的生成式修复刚性共装相机以零计算成本消除大部分外观域差还保留了接触像素工程上简洁有效实验设计严谨三种骨干 × 三条件 × 五任务的完整消融且效率对比剔除了一次性标定开销结论可信。局限方面单手型定制设计放弃跨平台性是其获得强性质的前提也是推广的主要成本此外前向模型 g_φ 与逆映射 f_θ 均为数据驱动极端负载工况下的泛化尚待检验。对从事储能电站运行控制与能量管理的研究者而言这种“通过共享物理接口将开环标定问题转化为配对监督学习”的思路与储能系统中数字孪生 实测偏差修正控制参数的范式有内在相通之处具有跨领域的启发价值。
返回列表