ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体

具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体 写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09RoboCat详解一个能用少量示范快速学会新任务和新机器人的自我改进智能体导读传统机器人学习通常为每个任务单独训练策略换一台机器人、换一组物体往往又要重新采集数据。RoboCat 把问题改写成一个多任务、多本体的序列建模问题它接收视觉观测、本体状态和一张表示目标任务的图像输出当前机器人需要执行的动作 token。训练数据可以来自不同自由度、不同观测和动作规格、不同控制频率的模拟与真实机械臂。RoboCat 的核心不只是一只“通用策略”而是一条自我改进循环。先用多任务数据训练 generalist再用 100–1000 条人工遥操作示范把它微调到新任务微调后的策略部署到真实机器人上自主采集更多轨迹经过 hindsight goal relabeling 后加入下一轮训练集。新任务因此从“人工示范”变成“示范引导的自动数据扩增”。论文在模拟环境和 36 台真实机器人上评估了这一思路覆盖 Sawyer、Panda 和训练时未见的 KUKA 14-DoF 机械臂。RoboCat 能适配未见物体、未见任务族、sim-to-real 场景和全新本体在真实 KUKA 上零样本成功率为 0%使用少量示范微调后可以达到约 69%–80% 的成功率区间。论文真正要验证的是通用策略的价值不仅在于一次性解决更多任务还在于降低下一项技能的获取成本。图 1RoboCat 从多任务训练集开始微调到新任务后自主生成更多数据再将数据回流训练下一代 generalist。来源论文 Figure 1。猫先生认为RoboCat 的关键贡献是把“策略学习”和“数据生产”接在了一起。模型不是训练完成就结束而是成为下一轮数据采集的工具这比单纯把模型做大更接近机器人基础模型真正需要的增长路径。论文标题RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation论文地址https://arxiv.org/abs/2306.11706论文 PDFhttps://arxiv.org/pdf/2306.11706论文版本arXiv v22023-12-22发表信息Transactions on Machine Learning Research2023原文脉络Introduction 说明异构机器人数据难以规模化利用Section 2 定义 RoboCat 的视觉目标条件策略、token 化方式和自我改进循环Section 3 介绍模拟/真实本体、物体集、任务族和数据来源Section 4 说明训练与评测协议Section 5 依次验证训练任务能力、少样本泛化与适配、自我生成数据的收益最后讨论语言条件、强化学习和更开放环境等后续问题。1. Introduction从单任务策略走向可持续扩展的通用智能体机器人数据的困难不只是规模小还在于数据之间差异很大相机视角不同动作维度不同机械臂自由度不同控制频率也不同。RoboCat 不要求这些数据先被严格映射到同一个动作空间而是依靠 Transformer 对可变长度 token 序列的处理能力将本体差异编码在上下文中。任务使用视觉目标条件来描述。给定一张表示“完成状态”的目标图像模型需要根据当前观测决定动作。目标图像不是要求机器人逐像素复现某个状态而是告诉它应该完成哪类任务例如“把苹果放进碗里”。一条轨迹末尾的图像天然可以作为 hindsight goal因此失败或次优轨迹也能被重新利用不需要额外为每个时间步标注任务。2. RoboCat视觉目标条件的自回归决策 Transformer2.1 输入、输出与任务定义模型策略写成π ( a t ∣ o t , g t ) P θ ( a t ∣ x t , I t , g t ) \pi(a_t\mid o_t,g_t)P_\theta(a_t\mid x_{t},I_{t},g_{t})π(at​∣ot​,gt​)Pθ​(at​∣xt​,It​,gt​)其中x t x_txt​是本体状态I t I_tIt​是当前图像g t g_tgt​是固定的目标图像a t a_tat​是动作。由于不同机器人需要的本体状态和动作维度不同序列中的 token 数量L LL、Q QQ可以随本体变化。模型不依赖一个强行统一的固定动作向量而是从当前上下文推断应该输出多少动作 token。2.2 VQ-GAN 图像 token 与辅助未来预测RoboCat 沿用 Gato 的自回归 Transformer 架构但图像使用预训练且冻结的 VQ-GAN 编码器离散化。每张图像被编码成8 × 8 8\times88×8网格的视觉 token编码器预训练数据混合了 ImageNet、Atari、MuJoCo 和机器人操作图像。冻结编码器并提前完成 token 化降低了大规模训练和迭代成本。模型除了预测动作还预测未来第k 5 k5k5个时间步的图像 token。相邻帧通常高度相似直接预测下一帧提供的信息有限预测更远的视觉状态迫使表示保留物体运动和任务进展。训练目标可以写成动作 token 与未来图像 token 的联合对数似然L E τ ^ [ ∑ t , q log ⁡ P θ ( a t q ∣ history ) ∑ t , m log ⁡ P θ ( I t k m ∣ history ) ] \mathcal{L}\mathbb{E}_{\hat\tau}\left[\sum_{t,q}\log P_\theta(a_t^q\mid\text{history})\sum_{t,m}\log P_\theta(I_{tk}^m\mid\text{history})\right]LEτ^​[t,q∑​logPθ​(atq​∣history)t,m∑​logPθ​(Itkm​∣history)]论文主实验使用约 1.18B 参数、24 层的 decoder-only Transformer另用 364M 版本进行部分消融。训练时实际使用 1024 个 token 的上下文约覆盖 3 个时间步历史。图 2模型在 Sawyer 7-DoF、Panda 7-DoF、真实 Sawyer 5-DoF、真实 Panda 7-DoF 以及训练时未见的 KUKA 14-DoF 上运行。来源论文 Figure 2。猫先生认为RoboCat 的“统一”不是把所有机器人改造成同一台机器人而是把观测、目标和动作都变成序列上下文的一部分。这样做保留了本体差异的表达能力但也把泛化压力交给了模型容量和训练数据覆盖。2.3 微调与自我改进对新任务y yy作者先收集 100–1000 条遥操作示范初始化自通用模型的权重进行行为克隆微调θ f t y arg ⁡ max ⁡ θ L ( θ ; D d e m o y ) \theta^y_{\mathrm{ft}}\arg\max_\theta\mathcal{L}(\theta;\mathcal{D}^y_{\mathrm{demo}})θfty​argθmax​L(θ;Ddemoy​)微调模型可以成为专用策略但可能损失原任务能力。于是作者将其部署到真实机器人自动采集新任务轨迹并用成功检测器做 hindsight goal relabeling。下一轮数据集为D n e x t D ∪ ⋃ y ∈ Y ( D d e m o y ∪ D i m p y ) \mathcal{D}_{\mathrm{next}}\mathcal{D}\cup\bigcup_{y\in\mathcal{Y}}(\mathcal{D}^y_{\mathrm{demo}}\cup\mathcal{D}^y_{\mathrm{imp}})Dnext​D∪y∈Y⋃​(Ddemoy​∪Dimpy​)其中D i m p y \mathcal{D}^y_{\mathrm{imp}}Dimpy​是微调策略自主生成的数据。训练下一代 RoboCat 后新的 generalist 再被用于更多任务形成“预训练—微调—自主采集—再训练”的循环。真实数据采集还有两个工程难点。第一作者训练视觉 reward model 判断任务是否完成以便 relabeling 和触发 reset第二使用 policy pool把一个任务的终止状态作为另一个任务的起始状态通过多个策略的组合自动重置环境减少人工复位。3. Tasks and Data从结构搭建到精细插入RoboCat 的训练任务包含 240 个任务另有 13 个专门用于微调的任务总计 253 个任务。数据覆盖 2 种模拟本体和 3 种真实本体包含 5 类模拟任务族、11 类真实任务族以及 123 个模拟物体和 134 个真实物体。物体和任务设计覆盖堆叠、精细插入、日常水果蔬菜、形状匹配等场景任务变体同时改变本体、任务族、物体集和感知外观用于测量物体泛化、行为泛化、sim-to-real 和本体泛化。真实部署使用 36 台机器人15 台 Panda、17 台 Sawyer 和 4 台 KUKA。KUKA 采用 14-DoF 机械臂和三指手并且在通用模型训练阶段未出现只在微调阶段加入。这使 KUKA 成为检验“少量示范能否接入新本体”的关键测试。4. Experimental Setup通用模型与单任务视觉基线的对比作者将 RoboCat 与单任务视觉基础模型进行比较。后者包括 CLIP 预训练的 NFNet-f6 和 Swin-L每个任务单独训练并使用与 RoboCat 相同的成功数据和行为克隆损失。另有 Gato 与 BC-IMP 作为部分堆叠任务的对照。评测区分 generalist 训练任务和通用训练中不可见的 fine-tuning 任务后者只使用 500 或 1000 条示范作者定期检查 checkpoint再用 100 个 episode 汇报最终结果。5. Experiments少样本适配和自我生成是否真的有效5.1 多任务训练能力在训练任务上单个 1.18B RoboCat 可以同时处理模拟和真实环境中的多种堆叠、搭塔、金字塔、搬运、插入和移除任务。与单任务 VFM 相比RoboCat 在绝大多数真实任务上更好在模拟中它在较难的塔构建和金字塔构建上优势更明显。364M 小模型在简单堆叠上接近大模型但在难任务上明显下降说明多任务 generalist 需要足够容量。图 3RoboCat 与单任务视觉基础模型在模拟、真实训练任务上的成功率对比。真实场景数据较少时多任务联合训练带来的共享经验更明显。来源论文 Figure 5。5.2 泛化与少样本微调作者训练了数据受限版本 RoboCat-lim并显式留出任务变体、物体和本体。它可以在 0-shot 下泛化到部分未见变体对于不能零样本解决的任务100–500 条示范通常就能完成有效适配。在真实 Sawyer 的 blue-on-green 堆叠上500 条示范微调达到 88%Gato 在同一数据上的成功率为 60%。对未见的真实 KUKA 14-DoF本体差异更大零样本成功率为 0%加入少量示范后达到约 69%–80% 的成功率说明模型需要通过微调重新学习新动作和观测接口但不必从零开始学习所有视觉与操作规律。图 4随着示范数量从 0 增加到 100、500、1000RoboCat-lim 能适配未见物体、任务变体、sim-to-real、任务族和新 KUKA 本体。来源论文 Figure 7。VFM 基线只看到某一任务的 1000 条数据无法利用 RoboCat 在其他机器人和任务中学到的先验因此在少样本新任务上普遍表现较差。这个对比说明微调效率来自通用模型已有的跨任务表征而不只是来自更强的单任务网络。5.3 Self-improvement让模型自己制造下一轮数据自我改进实验比较两种方案只把少量新任务示范加入通用训练集或者先微调策略、让策略自主生成更多成功和失败轨迹再把这些数据一起加入。364M 小模型实验中加入自生成数据的版本在四个任务上都超过只使用示范的版本。在更大规模实验中多个 RoboCat-lim 专家分别微调到水果搬运、堆叠、塔构建和插入/移除任务随后自动采集数据训练新的 generalist。新 RoboCat 在许多数据生成任务上的表现接近甚至超过生成数据的专用策略同时对更多下游任务拥有更好的泛化和微调能力。图 5比较只加入示范数据与同时加入策略自生成数据的结果自生成数据使下一代 generalist 在多个任务上获得更高表现。来源论文 Figure 9。猫先生认为自我改进循环最有价值的地方是把机器人数据采集从一次性成本变成了可复用资产。但它并没有消除人工监督新任务仍需要初始遥操作示范、成功检测和安全的 reset 机制。它降低的是“从 100 条示范走向足够训练数据”的成本而不是让机器人完全脱离人类定义任务。6. DiscussionRoboCat 的能力边界RoboCat 证明了三件事大 Transformer 可以在多种真实本体上完成视觉操作通用模型可以用 100–1000 条示范适配未见任务微调策略还能提供下一轮训练数据。覆盖范围包括未见物体、任务族、sim-to-real 和 KUKA 本体。但它仍不是开放世界机器人。任务主要是桌面物体操作目标由图像指定模型本身只使用行为克隆而非在线强化学习不同机器人虽然动作和观测规格不同却处于相对受控、视觉相似的实验环境。语言条件、多模态目标、开放场景和安全交互仍是后续工作。总结通用智能体的终点不是一次训练而是更便宜的下一次学习RoboCat 将视觉目标条件、可变长度序列建模、少样本微调和自主数据采集组合成一条自我改进路线。它的模型设计让不同本体可以在同一个 Transformer 中共存hindsight goal 让轨迹更容易复用policy pool 和 reward model 则把真实数据采集变成可持续工程流程。猫先生认为RoboCat 最值得记住的不是某个成功率而是一个学习闭环**通用模型用已有经验帮助新任务新任务再用少量人工示范和自主数据反哺通用模型。**如果未来的机器人基础模型能够把这个闭环扩展到语言、长时程任务和开放环境模型规模才会真正转化为持续增长的机器人能力。参考资料Bousmalis et al., RoboCat arXiv 页面Google DeepMind / RoboCat论文 PDF推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
返回列表