ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Clawdbot实测:用大模型Agent在手机上自动执行任务,部署指南与踩坑记录

Clawdbot实测:用大模型Agent在手机上自动执行任务,部署指南与踩坑记录 最近圈子里有个项目特别火叫 Clawdbot。这个名字乍一看像 Claw Bot字面意思是“长着爪子的机器人”。但等你真正把它跑起来你会发现这玩意儿跟传统意义上的语音助手压根不是一回事——它更像一个住在手机里的“AI 打工人”你说一句话它自己拆解、规划、调工具、执行把事情办完给你汇报。我第一时间在备用机上完整部署了一遍实测下来的感受是Siri 确实是该被淘汰的形态了。Clawdbot 拿大模型的推理能力直接指挥手机上的各种操作不是“帮你查天气”而是“帮我把相册里模糊的照片全挑出来建个新相册放进去再给朋友圈写条文案”。这个方向我认为才是手机语音助手真正该有的样子。这篇文章我会从项目定位、核心设计、部署流程、实战案例到踩坑记录完整讲一遍。不管你是想把它当工具用还是想学这套 AI Agent 的架构思路这篇都能给你一个可以直接上手复现的参考。1. Clawdbot 到底是个什么项目1.1 传统语音助手卡在哪儿用过 Siri、小爱同学这类助手的朋友应该都有过这种体验问天气、设闹钟、打电话这些固定指令确实没问题。但只要你稍微提一个“帮我看看明天下午有没有空档有的话帮我订个会议室再约一下张工”它就彻底听不懂了。问题出在底层设计上。传统语音助手走的是“语音识别 → 意图分类 → 槽位填充 → 执行固定技能”这条路。开发者提前把“查天气”“设闹钟”这些技能写死用户只能在预设的选项里打转。一旦指令超出预设范围系统就只能回一句“对不起我没听懂”。说白了它们是个遥控器不是个管家。遥控器只能按它上面有的按钮管家才能听你说“家里来客人了看着办”。1.2 Clawdbot 的设计思路Clawdbot 走了完全不同的路线。它的核心不是人类的规则而是大模型的推理能力。结构上可以拆成三块第一块是意图理解引擎。它先把你的自然语言指令转成一个包含目标、约束、步骤的任务描述。比如你说“帮我找找上周同事发的那个项目排期表”它会理解成“在聊天记录里搜索上周相关的排期表文件确认发送者与时间范围然后打开或导出”。第二块是工具调度层。这是 Clawdbot 最有意思的部分。它内置了一批“技能”不是死的而是类似函数接口的抽象操作比如发送消息、打开应用、滚动页面、截屏、读取通知、OCR 识别、文件管理等。大模型根据任务描述自动选择需要调用的函数并按顺序拼接成执行计划。第三块是系统桥接层。这是把大模型的“想法”落到手机屏幕上的关键。Clawdbot 通过无障碍服务和自动化脚本框架真实地操控手机界面。它能看到当前屏幕内容模拟点击、滑动、输入甚至能等待页面加载完成后再进行下一步。我试过几次之后最大的感触是它执行任务的过程跟人自己操作手机几乎一模一样。你看它一步步在屏幕上点来点去就知道这真的是“Agent”在替你办事而不是后台偷偷跑一个固定接口。1.3 它和 ChatGPT App 有什么本质区别可能有人会说ChatGPT 的语音模式不也能帮你写邮件、给建议吗这里有个关键区别ChatGPT 只能“说”不能“做”。它给你一段文案然后你需要自己复制、打开微信、粘贴、点击发送。Clawdbot 是直接把“说”和“做”连起来。我给 Clawdbot 下的指令是“在微信里给小王发一条消息说我十分钟后到”。它真的自己打开微信找到小王输入文字点击发送然后把“已发送”的截屏发给我确认。这种“闭环执行”的能力才是 AI Agent 和普通 AI 聊天助手的本质分界线。2. 为什么说“手机里指挥 AI 干活”是分水岭2.1 从“问答案”到“给结果”的跨越所有 AI 产品都在往“更主动、更能干”的方向走。但“能干”分两种一种是懂很多知识能给你高质量的建议这属于认知层另一种是能直接操作工具、操作系统、完成真实世界的任务这属于行动层。Llama、Qwen 这类模型已经做到了前一种。Clawdbot 这类 Agent 项目走的是第二种。它的价值不在于“模型多聪明”而在于它把模型的聪明转化成了对真实设备和应用的操控能力。用个通俗的类比以前你问 AI “怎么清理手机存储空间”它给你一条一条列步骤。现在你直接说“清理一下手机存储空间”Clawdbot 自己跳到设置里看存储占用识别哪个应用占空间最大截图给你看再问你要不要卸载或者清缓存。同样是解决存储问题前者是给参考答案后者是直接动手做。这个变化看起来不大但实际体验上的差距是巨大的。语言模型再强终究是个“顾问”Agent 框架加持之后才真正变成“员工”。2.2 工具调用的精髓在于意图拆分Clawdbot 能干活核心前提是它具备工具调用的能力也就是 Function Calling。我在实际使用中发现它执行复杂任务时并不是拿着整个指令一次性胡乱操作而是先把指令拆成多个原子操作。比如“帮我把这篇文章存下来再提炼三条要点发给老李”它会先拆成读取当前应用中的文章全文将全文保存为 markdown 文件放到指定目录调用大模型提炼三个核心要点打开微信找到老李粘贴要点点击发送每一个原子操作对应一个或多个函数调用。模型在每一步之间都会停下来观察当前状态确认上一步成功了再继续下一步。这个设计解决了一个很实际的问题真实手机环境是不可控的。可能弹窗挡住了按钮、某个应用需要登录、页面还在加载。Clawdbot 的每一步操作都是“先观察、后决策”而不是像脚本一样无脑执行。这也是我为什么说它比传统自动点击器高级——自动点击器是“按背好的剧本演戏”Clawdbot 是“看着现场随机应变”。2.3 开源意味着你可以把它变成自己的Clawdbot 最让我兴奋的还不是它能干活而是它开源了。这意味着你可以改它的工具集、换掉默认的模型、调整它的执行策略甚至把它接入你自己的其他设备。我把它跑在手机上之后同时给家里电脑也部署了一份。手机端拍的照片、录音它能自动整理电脑端它能处理下载的文档、跑脚本、定时刷新数据。本地的和跨设备的任务现在都能通过一个统一的 Agent 接口来调度。开源社区的价值就是人多力量大。我自己只是给它加了一个“识别图片中表格并转成 CSV”的技能就已经觉得很好用了。你想想如果几百个开发者都给这个项目贡献技能那它查快递、订票、管理日历、控制智能家居这些能力会迅速覆盖生活工作的方方面面。而且因为没有大厂的“安全边界焦虑”可玩性和开放度都高很多。3. 上手实操把 Clawdbot 部署到你的手机3.1 准备阶段先说一下运行环境。Clawdbot 目前的实现是通过一个本地运行的服务进程来控制手机所以理论上 Android 和 iOS 都能跑但 Android 因为权限更开放部署起来更容易我用的是 Android 备用机。你需要准备的东西一台 Android 手机建议 Android 10 以上需要能开开发者选项一个本地运行环境可以用 Termux 或直接在电脑上跑服务端通过 USB 或 Wi-Fi 连接一个大模型 APIOpenAI 兼容接口最好本地跑 Ollama 也可以Clawdbot 本体从 GitHub 仓库克隆最新代码3.2 部署流程整个部署流程不长但有几个细节容易踩坑。我按自己的实际操作顺序写一下。首先在手机上开启开发者选项打开 USB 调试。然后把手机通过数据线连到电脑或者用无线调试端口配好。接下来在电脑上安装依赖。Clawdbot 的服务端是基于 Python 写的我建议用 Python 3.11 以上的版本避免碰到一些老版本兼容问题。git clone https://github.com/your-username/clawdbot.git cd clawdbot python3 -m venv .venv source .venv/bin/activate pip install -r requirements.txt依赖装好后配置连接参数。Clawdbot 使用的是手机自动化框架的远程调试协议所以你需要把手机的调试端口映射到电脑上。adb devices adb tcpip 5555 adb connect 手机IP:5555这一步做完可以用adb shell测一下。如果能看到手机的命令行就说明连接正常。我一开始就卡在这里连接一直失败后来发现是手机和电脑没有在同一局域网内换了个 Wi-Fi 就好。3.3 配置模型与桥接服务连接完成后进入核心配置环节。Clawdbot 目录下有一个配置文件需要你写入模型接口信息。model: provider: openai-compatible base_url: http://你的本地模型地址/v1 api_key: sk-本地key model_name: 你的模型名称配置好模型之后拉起 Clawdbot 服务python3 main.py --config config.yaml正常情况下日志里会出现Agent server started字样同时手机上会弹出无障碍服务授权弹窗。这个授权很关键它是 Clawdbot 能操控界面的凭据需要允许。授权完成之后你可以在手机上装一个配套的快捷面板应用用来输入语音或文字指令。也可以直接用电脑命令行和它对话。实际跑下来我觉得整套部署差不多 30 分钟能完成对新手来说最大的门槛反而不是代码而是权限配置。Android 不同版本的无障碍权限位置不一样有的藏在“辅助功能”里有的叫“已安装的服务”。找起来有点绕但耐心一点都能搞定。4. 实战演示在手机里指挥 AI 干活4.1 场景一一句话完成消息发送装好 Clawdbot 后我第一个测试的任务是发消息。语音输入了一句“帮我在微信里给项目群发一条消息说今晚八点同步一下进度”。Clawdbot 的执行流程是这样的打开微信应用等待微信启动读取屏幕内容认准当前界面识别底部导航栏点击“通讯录”或“聊天”在搜索框输入“项目群”找到对应的群聊并进入在输入框键入“今晚八点同步一下进度”点击发送按钮它每一步都会截图把截图传给大模型做判断确认执行无误后再继续。这个过程中我全程没有碰手机但它每一步的决策逻辑都清清楚楚这一点让人非常放心。我用的是文字输入但也支持语音。语音会先经过本地或者远程的语音识别转成文本再走同样的 Agent 流程。整个过程大概 20 秒比我手动操作还快一点。4.2 场景二多步骤整理任务真正体现 Agent 实力的是一个多步骤整理任务。我试着对它说“把相册里拍糊了的照片选出来移到新建的‘待清理’相册里。”这个任务表面看很简单但实际执行难度不低。手机相册通常没有“是否模糊”的筛选维度只能人工一张张看。Clawdbot 的处理方式是进入相册“所有照片”视图截屏将截屏传给视觉模型让模型标记哪些区域可能是模糊照片逐个放大候选照片再次用视觉模型确认是否模糊对确认的模糊照片调起“选择”模式勾选对应位置选择“移动到相册”新建“待清理”相册完成移动我实测下来几百张照片的处理大概花了十几分钟准确率相当高。有几张轻微的手抖照都被识别出来了比我人眼扫一遍还仔细。这个场景让我真正感受到“在你手机里指挥 AI 干活”不是一句空话而是真实可用的能力。4.3 场景三定时任务与后台值守Clawdbot 还能配合系统能力做一些定时和值守类的任务。我设置了一个每天早上九点的任务打开天气应用查看今天是否降雨如果有雨就自动在微信家庭群发一句“今天有雨记得带伞”。这种任务听起来简单但传统语音助手是做不到的因为传统方案只支持预设的技能触发没有办法动态决策“今天有雨才发消息”。Clawdbot 的好处是大模型能理解“有雨”这个条件然后自主决定是否执行后续动作。我还试过一个晚间任务让它每天十一点检查短信里有没有“快递已签收”的通知如果有就汇总成一条摘要推送到我的电脑端。这套流程跑通之后手机算真正变成了我的私人助理不是我主动问它才干活而是它自己定时起来干活。5. 常见问题排查与避坑指南5.1 任务执行到一半就停了这个是我使用中遇到最多的问题。Clawdbot 在任务流程较长的时候偶尔会在某一步卡住表现为日志停留在某条操作上不再继续。排查思路分两步。第一步检查是否是界面状态变化导致的。比如微信突然弹了一个“漂流瓶下架通知”之类的窗口模型在当前界面找不到预期元素就会停滞。这时需要在提示词中增加“异常状态识别并关闭弹窗”的说明。第二步检查是不是等待时间不够。Clawdbot 的默认页面加载等待时间是 15 秒但碰到网络慢的老应用15 秒根本不够。我直接把超时时间调到了 30 秒agent: wait_timeout: 30 max_steps_per_task: 505.2 权限授权失败或无障碍服务失效Android 系统有一个“恶习”就是在后台自动回收久未使用的无障碍服务权限。如果你是长时间运行 Clawdbot时不时就会遇到“看不到屏幕内容”的情况。解决办法是在系统设置里找到电池优化把 Clawdbot 相关的包名设置为“不优化”。另外如果使用的是 MIUI、ColorOS 这类定制系统还要注意把“后台弹出界面”“自启动”“锁屏清理”等权限全部打开否则手机一锁屏Agent 就趴窝了。5.3 模型返回结果不稳定同样的指令有时模型调度得很好有时调度得稀烂这个跟所接模型的能力差异有很大关系。我测试过几个模型结论是推理能力越强的模型Agent 任务成功率越高。如果你发现任务频繁失败首先考虑换一个更强的模型试试而不是继续调提示词。另外Clawdbot 支持对单个工具前缀预置提示词比如让“打开微信”这个动作总是优先走“最近聊天”入口而不是搜索。把这类常见路径固化下来会明显提升稳定性。5.4 性能与耗电Clawdbot 持续运行确实会比平时更耗电一些毕竟它要不停截屏、分析界面。不过日常使用下来一夜待机耗电增量在 10% 左右还能接受。如果你的手机内存比较小建议把截屏分辨率调低一点减少视觉模型的输入负载vision: screenshot_resolution: 720 use_compression: true实际体验中的几句真心话Clawdbot 用了一周之后我最大的体会是这类 Agent 项目代表了手机助手的一个明确发展方向——从“单项命令执行器”进化成“目标导向的执行者”。它的价值不在于每次调用多流畅而在于它把“人的意图”和“手机的物理操作”真正打通了。目前这个项目还在快速迭代中很多地方谈不上成熟。但开源的魅力就在这里你可以自己动手修修补补把它变成顺手的样子。如果你对 AI Agent 有兴趣或者手头有一台闲置的 Android 手机我强烈建议你装一个试一下。等你第一次看着它自己打开微信、发消息、截图确认的时候你就会明白Siri 确实该退休了。
返回列表