ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Mobile-Agent GUI 智能体家族全景指南:从单机手机助手到多平台基础 GUI 智能体的技术演进与实战部署

Mobile-Agent GUI 智能体家族全景指南:从单机手机助手到多平台基础 GUI 智能体的技术演进与实战部署 Mobile-Agent GUI 智能体家族全景指南从单机手机助手到多平台基础 GUI 智能体的技术演进与实战部署【免费下载链接】MobileAgentMobile-Agent: The Powerful GUI Agent Family项目地址: https://gitcode.com/GitHub_Trending/mo/MobileAgentMobile-Agent 是通义实验室Tongyi Lab阿里巴巴集团开源的 GUI 智能体家族覆盖手机、PC、浏览器等多端 GUI 自动化场景。本篇技术指南以仓库根目录 README.md 为骨架结合 Mobile-Agent-v1、Mobile-Agent-v2、Mobile-Agent-v3、Mobile-Agent-v3.5、Mobile-Agent-E、PC-Agent、GUI-Critic-R1、UI-S1 等系列工作的文档与源码完整梳理家族演进脉络、核心能力、评测表现与真实设备部署方法。读完你将掌握如何为 Android 手机、PC 桌面、浏览器配置并运行 Mobile-Agent如何理解 GUI-Owl 系列模型的定位与坐标输出约定以及如何在自己的研究中引用这套开源体系。项目定位一套覆盖手机 / PC / 浏览器的 GUI 智能体家族Mobile-Agent 并非单一模型或单一框架而是一个持续演进的GUI 智能体家族GUI Agent Family由阿里巴巴通义实验室Tongyi Lab, Alibaba Group开源维护。家族以纯视觉感知 自主操作为核心设计哲学智能体通过截图理解界面状态直接输出点击、滑动、输入等操作指令从而完成跨 App、跨平台的自动化任务。从根目录 README 的架构总览见 assets/framework.png可以直观看到家族的技术栈自底向上分为三层基础模型层从早期的 GPT-4V / Qwen-VL 等通用多模态大模型调用演进到自研的 GUI 原生基础模型GUI-Owl与GUI-Owl-1.5基于 Qwen3-VL 构建智能体框架层在模型之上封装规划、执行、记忆、反思、错误诊断等多智能体协作能力形成 Mobile-Agent-v3 / v3.5 等跨平台框架评测与训练层配套 OSWorld、AndroidWorld、ScreenSpot 等公开基准评测以及 UI-S1 半在线强化学习、GUI-Critic-R1 事前错误诊断等训练与质量保障工作。整个家族在 README_zh.md 中被定位为强大的 GUI 智能体家族其 GitHub 仓库地址为https://github.com/X-PLUG/MobileAgent当前镜像仓库即为其本地副本可通过git clone获取。系列工作图谱八个子项目的演进脉络根目录 README 的Series of Work章节按时间线列出了家族的全部核心工作本仓库中每个子项目均保留了完整独立的代码与文档。下面按演进顺序逐一展开。Mobile-Agent-v1单智能体纯视觉手机操作ICLR 2024 Workshopv1 项目文档 是家族的起点对应论文Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual PerceptionarXiv:2401.16158。其核心特性包括纯视觉方案完全依赖视觉感知不依赖 XML 与系统元数据操作范围不受限支持跨 App 的多应用连续操作多视觉感知工具通过 icon 定位、文本定位等模块完成操作坐标定位即插即用无需探索与训练开箱即用。仓库中保留了完整的实现代码Mobile-Agent-v1/MobileAgent 目录下的api.py、controller.py、icon_localization.py、text_localization.py、prompt.py等模块以及基于免费多模态模型 Qwen-vl-max 的 Mobile-Agent-qwen 版本。v1 时代的运行方式分为两种# 方式一使用在线 API无需自己的 OpenAI Key python run_api.py --adb_path /path/to/adb --url The url you got --token The token you got --instruction your instruction # 方式二使用自己的 API Key需有权访问 gpt-4-vision-preview python run.py --grounding_ckpt /path/to/GroundingDION --adb_path /path/to/adb --api your API_TOKEN --instruction your instructionv1 还配套发布了Mobile-Eval基准包含 10 个主流单 App 场景与 1 个多 App 场景每个场景设计 3 档难度的指令基础任务、叠加附加要求、无明确任务指示的用户需求用于评估手机端智能体的真实操作能力。Mobile-Agent-v2多智能体协作解决长上下文导航NeurIPS 2024v2 项目文档 针对单智能体在长对话上下文中导航能力衰减的问题提出了多智能体协作架构由不同的子智能体分别承担感知与操作职责配合增强的视觉感知模块显著提升操作精度并在 GPT-4o 的支持下兼顾性能与速度。v2 的运行方式在 run.py 中进行配置约第 22 行起为 Edit your Setting 配置区可填写 ADB 路径、指令、GPT-4 API URL 与 Token并支持两种 icon caption 模型调用方式local 模式在本机部署 icon caption 模型适合配备高性能 GPU 的设备效率更高api 模式通过 API 并行调用适合无法本地运行 7B 级模型的设备。Mobile-Agent-E自进化式复杂任务手机助手PreprintMobile-Agent-E 文档 对应论文Self-Evolving Mobile Assistant for Complex TasksarXiv:2501.11733由 UIUC 与阿里巴巴合作完成。其核心思路是通过经验库与反思机制让智能体在执行复杂任务时不断积累可复用的操作经验。仓库提供了 Mobile-Eval-E 数据集data/Mobile-Eval-E 下的 5 个场景 JSON 文件与scripts/run_task.sh、run_tasks_evolution.sh等运行脚本官方注明所有实验在 Samsung Galaxy A15 上完成并鼓励用户针对自己的设备与任务自定义初始提示custom tips示例见 custom_tips_example_for_cn_apps.txt。PC-AgentPC 端层次化多智能体协作框架ICLR 2025 WorkshopPC-Agent 文档 将家族能力拓展到 PC 平台支持 Chrome、Word、微信等生产力场景的自动化控制。其技术要点是面向 PC 平台密集多样的可交互元素设计主动感知模块采用层次化多智能体协作结构提升复杂任务序列的成功率。仓库同时支持 Windows 与 Mac安装依赖分别为 requirements.txt 与 requirements_mac.txt并提供两套实现PCAgent当前版本与 PCAgent_v1含 Chrome 下载论文、搜索 NBA FMVP 并发给好友、在 Word 中撰写阿里简介等演示视频。配置通过 config.json 完成可设置vl_model_name、llm_model_name、token、url等 API 参数。GUI-Critic-R1执行前的 GUI 错误诊断NeurIPS 2025GUI-Critic-R1 文档 对应论文Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI AutomationarXiv:2506.04614。其出发点非常务实GUI 自动化是在线交互式任务每步决策容错率低一次误操作可能造成删除、支付等不可逆后果。为此该工作提出术前批评模型pre-operative critic model在实际执行前推理当前动作的潜在后果与正确性并给出反馈S-GRPO 训练策略在 GRPO 基础上引入 suggestion reward提升反馈可靠性基于推理引导的数据构建管线产出 GUI-Critic-Train 与 GUI-Critic-Test 数据集。仓库中的 test.py 为主评测脚本statistic.py 提供评估函数与指标计算测试数据位于 test_filesgui_i.jsonl、gui_s.jsonl、gui_web.jsonl分别对应 GUI-I、GUI-S、GUI-W 三个数据集。UI-S1半在线强化学习推进 GUI 自动化ACL 2026UI-S1 文档 对应论文Advancing GUI Automation via Semi-online Reinforcement LearningarXiv:2509.11543提出**半在线强化学习Semi-online RL**范式用离线轨迹模拟在线强化学习从而高效训练具备多轮交互能力的 MLLM 基 GUI 智能体。其 7B 模型在 AndroidWorld 在线评测与 SOP 半在线指标上均取得突出表现。仓库的安装与训练方式为conda create -n ui-s1 python3.11 conda activate ui-s1 cd UI-S1 pip install -e . pip install vllm0.8.2 pip install flash-attn2.7.4.post1 --no-build-isolation训练数据源自 AndroidControl示例见 datasets/android_control_train_example.jsonl训练框架深度定制了 verl位于 UI-S1/verl覆盖从模型加载Qwen2.5-VL 等、分布式训练到 vLLM / sglang 推理加速的全链路同时附带多个现成训练脚本如 run_qwen2_5_vl-7b.sh。Mobile-Agent-v3基于 GUI-Owl 的跨平台多智能体框架v3 项目文档 于 2025 年 8 月发布同时开源了GUI-Owl模型系列GUI-Owl-7B / 32B与 Mobile-Agent-v3 框架本身。GUI-Owl 是跨平台 GUI VLM具备 GUI 感知、接地grounding与端到端操作能力Mobile-Agent-v3 则基于 GUI-Owl 提供规划、进度管理、反思与记忆能力并可将模型实例化为框架中的多种专职智能体。从 run_mobileagentv3.py 的源码结构看v3 的移动端运行核心是一个多智能体协作循环InfoPool全局信息池承载用户指令、附加知识与错误计数err_to_manager_thresh2连续出错阈值触发返回管理器Manager / Executor / Notetaker / ActionReflector分别承担任务规划、动作执行、要点记录、动作反思四个角色GUIOwlWrapper封装 vLLM 服务的api_key / base_url / model调用主循环默认max_step25每步截图失败自动重试至多 5 次、生成操作、执行并记录日志到logs/{时间戳}_{指令前缀}目录。v3 的移动端运行命令Android 与 HarmonyOS 二选一cd Mobile-Agent-v3/mobile_v3 # Android 使用 adb python run_mobileagentv3.py \ --adb_path Your ADB path \ --api_key Your api key of vllm service \ --base_url Your base url of vllm service \ --model Your model name of vllm service \ --instruction The instruction you want Mobile-Agent-v3 to complete \ --add_info Some supplementary knowledge, can also be empty # HarmonyOS 使用 hdc将 --adb_path 换成 --hdc_path python run_mobileagentv3.py --hdc_path Your HDC path ... 其余参数相同需要注意两个关键参数约定坐标类型若模型输出 0–1000 的相对坐标如 Seed-VL、Qwen-VL-2 / Qwen-VL-3需追加--coor_type qwen-vl将相对坐标映射到真实设备分辨率若模型输出绝对坐标如 Qwen-VL-2.5 或 GUI-Owl则无需设置坐标映射记忆开关若指令需要记住中间内容追加--notetaker True启用记录员智能体。v3 同时开源了在 OSWorldos_world_v3、AndroidWorldandroid_world_v3以及真实移动场景mobile_v3上的评测代码并提供run_guiowl.sh/run_ma3.sh一键评测脚本。此外还提供了 cookbook 形式的端到端使用示例end2end_usage.ipynb与 docker_setup 环境脚本。Mobile-Agent-v3.5GUI-Owl-1.5 多平台基础 GUI 智能体Preprintv3.5 项目文档 是家族目前最新的重大发布对应论文Multi-platform Fundamental GUI AgentsarXiv:2602.16855核心成果是GUI-Owl-1.5原生多平台 GUI 智能体基础模型系列模型定位GUI-Owl-1.5-2B/4B/8B-Instruct小尺寸指令模型适合快速推理与边缘部署GUI-Owl-1.5-8B/32B-Thinking推理型模型面向需要规划与反思的复杂任务GUI-Owl-1.5-32B/235B家族全谱系更大参数规模的指令与思考版本GUI-Owl-1.5 建立在 Qwen3-VL 之上通过**可扩展的混合数据飞轮、统一智能体能力增强、多平台环境强化学习MRPO**三项技术训练而成关键能力包括工具与 MCP 调用原生支持外部工具调用与 MCP 服务器协同对应 OSWorld-MCP 等评测长时域记忆long-horizon memory内置记忆能力无需外部工作流编排多智能体就绪既可作为独立端到端智能体也可在 Mobile-Agent-v3.5 框架中充当 planner、executor、verifier、notetaker 等专职角色。v3.5 的模型加载可直接基于 Transformers 完成见 Mobile-Agent-v3.5/README.md 的 Quick Startfrom transformers import Qwen3VLForConditionalGeneration, AutoProcessor model_name mPLUG/GUI-Owl-1.5-8B-Instruct model Qwen3VLForConditionalGeneration.from_pretrained( model_name, torch_dtypeauto, device_mapauto ) processor AutoProcessor.from_pretrained(model_name) messages [ { role: user, content: [ {type: image, image: screenshot.png}, {type: text, text: Click on the search bar.}, ], } ] inputs processor.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, return_dictTrue, return_tensorspt ) inputs inputs.to(model.device) generated_ids model.generate(**inputs, max_new_tokens128) generated_ids_trimmed [ out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids) ] output_text processor.batch_decode( generated_ids_trimmed, skip_special_tokensTrue, clean_up_tokenization_spacesFalse ) print(output_text)多平台部署实战手机、PC 与浏览器的完整配置v3 与 v3.5 提供了几乎一致的设备接入流程详见各自 README核心步骤可归纳为一条通用的设备接入流水线。第一步安装依赖pip install qwen_agent pip install qwen_vl_utils pip install numpy其中qwen_agent提供智能体框架底座qwen_vl_utils提供视觉输入的编解码工具。PC 端部署需额外安装pyautogui屏幕控制与pyperclip剪贴板浏览器端则建议创建独立虚拟环境并安装 Playwrightpython -m venv .venv source .venv/bin/activate pip install -r requirements.txt playwright install chromium第二步通过 ADB 连接 Android 真机下载 Android Debug Bridgeplatform-tools在 Android 手机上开启开发者选项并打开USB 调试若为 HyperOS小米澎湃 OS系统还需同时开启USB 调试安全设置用数据线连接手机并选择传输文件模式验证环境执行/path/to/adb devices能列出已连接设备即准备就绪Mac / Linux 下为 adb 添加执行权限sudo chmod x /path/to/adbWindows 下路径形如xx/xx/adb.exe安装 ADB Keyboard APK 并在系统设置中把默认输入法切换为 ADB Keyboard这是智能体注入文本的必要通道。第三步启动移动端任务cd Mobile-Agent-v3.5/mobile_use python run_gui_owl_1_5_for_mobile.py \ --adb_path Your ADB path \ --api_key Your api key of vllm service \ --base_url Your base url of vllm service \ --model Your model name of vllm service \ --instruction The instruction you want Mobile-Agent-v3.5 to complete \ --add_info Some supplementary knowledge, can also be emptyPC 端与浏览器端的命令结构类似PC 端运行 run_gui_owl_1_5_for_pc.py无需 adb 参数浏览器端运行 run_gui_owl_1_5_for_web.py支持--web起始网址、--headless无头模式、--use_css_somCSS SOM 标记、--image_type base64/file等参数并需配置API_KEY、EVAL_API_KEY等环境变量。坐标输出约定重要v3.5 文档特别强调GUI-Owl 1.5 默认输出 0–1000 的相对坐标框架会在执行层将相对坐标映射到设备真实分辨率。这与 v3 中--coor_type qwen-vl的映射逻辑一致——理解这一约定是正确解析模型输出、避免点击错位的关键。在线体验与云端 API如果不想本地部署根目录 README 提供了多条零门槛体验路径Mobile-Agent-v3 在线 Demo基于无影云桌面与云手机构建无需本地部署模型或准备设备输入指令即可体验同时提供限时免费的 Mobile-Agent-v3 API对应阿里云 Model Studio 的 UI-Agent APIMobile-Agent-v3.5 在线 Demo 与 API提供 Computer Use 场景的在线演示以及基于百炼平台Bailian的 GUI 系列 APIGUI-Owl 系列在线推理GUI-Owl 与 GUI-Owl-1.5 系列模型已上线百炼与魔搭 API-Inference可直接调用 7B / 32B / 1.5-8B-Think 等模型做在线推理无影云手机Mobile-Agent-v3.5 已在阿里云无影云手机上架提供基于云端的 Android 环境实现开箱即用的 Mobile Use 体验。评测体系与代表性成绩v3.5 在 Mobile-Agent-v3.5/README.md 中给出了 GUI-Owl-1.5 系列在 9 个端到端在线基准上的成绩下表为原文档数据的完整整理模型OSWorld-VerifiedAndroidWorldOSWorld-MCPMobile-WorldWindowsAAWebArenaVisualWebArenaWebVoyagerOnline-Mind2WebGUI-Owl-1.5-2B-Instruct43.567.933.031.325.8----GUI-Owl-1.5-4B-Instruct48.269.831.732.329.4----GUI-Owl-1.5-8B-Instruct52.369.041.841.831.745.739.469.941.7GUI-Owl-1.5-8B-Thinking52.971.638.833.335.146.740.878.148.6GUI-Owl-1.5-32B-Instruct56.569.447.646.844.8----GUI-Owl-1.5-32B-Thinking56.068.243.842.844.148.446.682.1-此外家族在grounding 基准ScreenSpot-v2、ScreenSpot-Pro、OSWorld-G、MMBench-GUI 等与GUI 知识基准上的详细结果收录于技术报告grounding_and_kb 目录提供了这两类基准的评测脚本run_grounding.sh、run_gui_kb.sh需填写MODEL_PATH / DS_PATH / SAVE_PATH / EVAL_TYPE。工具调用类评测OSWorld-MCP、MobileWorld与 Web 类评测WebArena / VisualWebArena / WebVoyager / Mind2Web脚本见 web_benchmark/main_for_eval.py也均有对应代码可复现。演进时间线与学术成果根目录 README 的 News 章节完整记录了家族的发布轨迹可作为检索与引用的时间轴2024.3Mobile-Agentv1被 ICLR 2024 Workshop 录用2024.7Mobile-Agent 获 CCL 2024 最佳演示奖2024.9Mobile-Agent-v2 被 NeurIPS 2024 录用2025.3PC-Agent 被 ICLR 2025 Workshop 录用2025.8Mobile-Agent-v3 获 CCL 2025 最佳演示奖同时发布 GUI-Owl 与 Mobile-Agent-v32025.9发布 UI-S1半在线强化学习GUI-Critic-R1 被 NeurIPS 2025 录用2025.10发布 OSWorld-MCP 工具调用基准2025.11GUI-Owl 系列模型上线百炼在线推理2026.2发布 GUI-Owl-1.5 模型家族基于 Qwen3-VL支持桌面 / 移动 / 浏览器自动化2026.3Mobile-Agent-v3.5 上线无影云手机2026.5发布 ToolCUA——面向 GUI 与工具最优路径编排的端到端计算机使用智能体通过基于轨迹的工具合成 → 在线智能体强化学习两阶段训练学习何时使用 GUI 操作、何时调用工具及何时切换。引用方式如果 Mobile-Agent 家族对你的研究与应用有帮助根目录 README 提供了完整的 BibTeX 引用列表覆盖 v3.5、v3、UI-S1、GUI-Critic-R1、PC-Agent、Mobile-Agent-E、v2、v1 八篇论文此处摘录家族最新两篇article{xu2026mobile, title{Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents}, author{Xu, Haiyang and Zhang, Xi and Liu, Haowei and Wang, Junyang and Zhu, Zhaozai and Zhou, Shengjie and Hu, Xuhao and Gao, Feiyu and Cao, Junjie and Wang, Zihua and others}, journal{arXiv preprint arXiv:2602.16855}, year{2026} } article{ye2025mobile, title{Mobile-Agent-v3: Foundamental Agents for GUI Automation}, author{Ye, Jiabo and Zhang, Xi and Xu, Haiyang and Liu, Haowei and Wang, Junyang and Zhu, Zhaoqing and Zheng, Ziwei and Gao, Feiyu and Cao, Junjie and Lu, Zhengxi and others}, journal{arXiv preprint arXiv:2508.15144}, year{2025} }完整列表见 README.md 的 Citation 章节中文版 内容一致可直接复制使用。【免费下载链接】MobileAgentMobile-Agent: The Powerful GUI Agent Family项目地址: https://gitcode.com/GitHub_Trending/mo/MobileAgent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表