手机版openclawd来了,无需Root,让 AI 像人类一样使用你的手机
手机AI助手Andclaw来了!无需Root和电脑,动动嘴就能让AI帮你操作手机,真正解放双手。
核心内容:
1. Andclaw的核心功能:AI驱动+自然语言交互
2. 四大技术亮点:无需Root/独立运行/屏幕感知/拟人操作
3. 典型应用场景:视频搜索播放等自动化任务

之前分享过不少手机自动化工具,最近又挖到一个有点意思的——
Andclaw
一句话说清楚:它能让AI像人一样操作你的手机,做完任务还知道停下来。
不用Root,不用连电脑,手机上装个App就能用。
项目简介
Andclaw
它完全在设备上运行,既不需要Root权限,也无需连接电脑。底层通过无障碍服务(Accessibility Service)读取屏幕内容,然后交由AI分析界面、决定操作步骤并自动执行。整个过程几乎是“端到端”的,用户只需要给出指令就行。
让 AI 像人类一样使用你的手机
能做什么?
举几个官方文档里的例子:
- “打开bilibili,搜索AI学习相关的视频,并播放” → AI会自动识别B站图标 → 点击 → 进入搜索页 → 输入“AI学习” → 点击搜索 → 选择视频 → 播放
动静之间,你要做的就是动动嘴,或者打打字,剩下的事AI就帮你办了。
跟其他工具对比
| 方案 | 需要Root | 需要电脑 | 独立运行 | AI驱动 |
|---|---|---|---|---|
| Andclaw | ❌ | ❌ | ✅ | ✅ |
| Auto.js | ❌ | ❌ | ✅ | ❌ |
| ADB+Python | ❌ | ❌ | ❌ | 可选 |
| Frida+脚本 | ❌ | ❌ | ❌ | ❌ |
| Appium | ❌ | ❌ | ❌ | 可选 |
| UI Automator | ❌ | ❌ | ❌ | ❌ |
Andclaw的核心优势十分清晰:完全在设备上运行 + 大模型决策 + 自然语言交互。从现有工具来看,这种“端上AI独立决策”的能力,暂时还不太常见。
主要功能
1. 无需Root
纯无障碍服务(Accessibility Service)实现,不需要任何系统级权限。换句话说,你不用再折腾什么Magisk、KernelSU那一套。
2. 独立运行
任务执行全过程都在手机上独立完成,无需ADB或PC端配合。哪怕你躺在沙发上玩手机,也能随时指挥它干活。
3. AI驱动
支持Kimi(月之暗面,国内可直接访问)和任意兼容OpenAI的API。AI会自动分析当前屏幕内容,并据此决策下一步该做什么。
4. 屏幕感知
- 实时读取UI层次结构(通过无障碍服务)
- 浏览器/WebView场景下自动截图,辅助视觉分析
这一点相当实用——因为有些App的界面无障碍服务读不出来,AI就会自动截图,用“看”的方式来弥补信息缺失。
5. 拟人操作
官方文档里列出的操作类型包括:
click- 点击屏幕坐标(x,y)swipe- 滑动(滚动、翻页),支持自定义时长long_press- 长按,支持自定义时长text_input- 向输入框注入文本(先尝试SET_TEXT,失败则用剪贴板粘贴)intent- 启动应用、打开网页、拨号、发信息、设闹钟等系统Intentglobal_action- 系统级操作:返回、Home、最近任务、通知栏、快捷设置screenshot- 截图,保存到Pictures/Andclaw/download- 通过DownloadManager直接下载文件(不用先打开浏览器)wait- 等待页面加载,最长10秒camera- 拍照、开始录像、停止录像screen_record- 录屏,保存到Movies/Andclaw/volume- 音量控制:设置、调高/调低、静音/取消静音、查询当前音量dpm- Device Owner模式专用:应用管理、设备控制等finish- 任务完成,停止Agent
其中值得特别注意的是
循环检测
6. Telegram远程控制
人在外面也能遥控手机。通过Telegram Bot远程下发指令,截图、拍照、录像完成后,会自动回传到Telegram。
常用操作:
- 直接发送文字 → 作为指令下发给Agent执行
/status→ 查询Agent状态(运行中/空闲、当前任务、Chat ID)/stop→ 停止当前正在执行的任务
7. 企业级管控(可选)
如果你愿意折腾,启用
Device Owner
恢复出厂设置
如果不启用,AI操作手机的权限会大幅受限。
启用后的能力:
- :静默安装/卸载应用、隐藏/显示/挂起应用、阻止卸载、自动授予权限、查询已安装应用列表
应用管理
- :远程锁屏、重启、恢复出厂设置、禁用摄像头/状态栏/锁屏、USB数据传输控制、定位开关
设备控制
- :单应用锁定(Lock Task)、替换默认桌面、禁止安全模式/恢复出厂
Kiosk模式
详细能力清单可以参考GitHub上的 ACTIONS.md。
AI是怎么干活的?
下面这张流程图能说清楚整个闭环逻辑:
用户指令
↓
[1.5s] → 捕获屏幕 UI 树(无障碍服务)
↓
浏览器/WebView?──是──→ 自动截图(视觉分析辅助)
↓
发送给 LLM(系统提示 + 最近 12 条历史 + 屏幕数据 [+ 截图])
↓
AI 返回 JSON 操作决策
↓
解析失败?──是──→ 纠正提示重试(1 次)
↓
执行操作(点击/滑动/输入/Intent/DPM/拍照/录屏/...)
↓
[2.5s] → 重新捕获屏幕 ←──────────────┐
↓ │
循环检测(同一操作连续 5 次?) │
↓是→ 截图 + 视觉重试(最多 3 轮,15 次后停止)
↓否
任务完成?──否→ 继续循环
↓
是 → 结束
简单来说就是:AI看屏幕 → 思考下一步 → 执行操作 → 观察效果 → 继续或停下。整个过程形成一个闭环,完全不需要你一直盯着屏幕。
支持的AI模型
官方文档里列出了两种接入方式:
| 提供商 | API格式 | 配置示例 |
|---|---|---|
Kimi |
Anthropic Messages | Base URL: https://www.kimi.com/code/console,Model: kimi-k2.5 |
OpenAI兼容 |
OpenAI Chat Completions | Base URL: https://api.openai.com/v1,Model: gpt-4o |
两者都支持多模态输入(文本 + 截图base64),可以携带图片进行分析。
环境要求
- Android 12 (API 31) 或更高版本
- 需要手动在系统设置里启用无障碍服务
- 需要悬浮窗权限(显示紧急停止按钮)
- 需要自己准备API Key(Kimi或OpenAI兼容)
安装方式
最简单的方式(推荐)
如果你想自己编译
git clone https://github.com/andforce/Andclaw.git- 创建
local.properties,配置kimi_key和tg_token(可选) ./gradlew :app:installDebug- 打开App,按提示开启无障碍服务和悬浮窗权限
- 可选:通过ADB激活Device Owner(
adb shell dpm set-device-owner com.andforce.andclaw/.DeviceAdminReceiver)
其他一些信息
- :MIT(开源)
许可证
- :Ja va 89.4%、Kotlin 7.8%、TypeScript 2.2%
技术栈
- :TestDPC(Device Owner功能参考)、Kimi API
致谢
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名