小白也能懂:Open-AutoGLM工作原理揭秘,截图-分析-执行三步走
小白也能懂:Open-AutoGLM工作原理揭秘,截图-分析-执行三步走
你有没有想过,如果手机能听懂你的话,并且自己动手帮你完成所有操作,那该多省事?比如你说“帮我订一张明天去上海的机票”,它就能自己打开App、搜索、比价、下单。这听起来像是科幻电影里的场景,但现在,一个叫Open-AutoGLM的开源项目,让这个想法变成了现实。
它不是一个简单的“语音助手”,而是一个真正能“看”懂手机屏幕、“想”明白你要做什么,然后“动手”帮你完成的AI智能体。今天,我们就来彻底搞懂它到底是怎么工作的,并且手把手带你体验一下,让AI帮你玩手机。
1. 它到底是什么?一个能“看”会“动”的手机AI
在深入技术细节之前,我们先用人话理解一下 Open-AutoGLM 到底是什么。
你可以把它想象成一个装在电脑里的“虚拟手指”和“虚拟眼睛”。这个“虚拟眼睛”会不停地给你的手机屏幕拍照(截图),然后把照片发给一个非常聪明的大脑(AI大模型)。大脑看完照片,分析出屏幕上哪个按钮可以点、哪个输入框可以打字,然后指挥“虚拟手指”(通过ADB工具)去点击或输入。
整个过程就像这样:
- 你下指令:用最自然的话说,比如“打开小红书,搜索宠物猫视频”。
- AI看屏幕:AI模型分析当前手机屏幕,理解界面元素(图标、文字、按钮)。
- AI做计划:AI决定第一步要点“小红书”图标,第二步要在搜索框输入“宠物猫”...
- AI执行:通过电脑控制手机,自动完成这一系列点击和输入操作。
和Siri、小爱同学有什么区别?最大的区别是能力边界。Siri们通常只能操作手机系统自带的功能,比如设闹钟、打电话。但 Open-AutoGLM 借助“视觉”能力,可以操作任何App的界面,无论是微信、淘宝还是游戏,只要你能看到的,它就能尝试去操作。这相当于给AI装上了一双“眼睛”和一双“手”。
2. 核心三步走:截图、分析、执行
理解了它是什么,我们再来拆解它最核心的工作流程。整个过程可以精炼为三个步骤,这也是它强大能力的基石。
2.1 第一步:截图——AI的“眼睛”
一切始于“看见”。Open-AutoGLM 通过ADB这个安卓调试工具,向手机发送截屏指令。
# 一个简单的ADB截屏命令示例 adb exec-out screencap -p > screen.png这条命令会让手机立刻截取当前屏幕,并将图片数据传回电脑保存为screen.png。这张图片就是AI观察世界的窗口。这个过程非常快,几乎实时,确保了AI能感知到屏幕的最新状态。
2.2 第二步:分析——AI隐含的“思维链”
这是最神奇的一步。截取的屏幕图片会被发送给一个强大的视觉语言模型。这个模型不仅要“看懂”图片里有什么(图标、文字、布局),还要“理解”你的指令,并规划出下一步该做什么。
这个过程在模型内部,可能经历了一场复杂的“思考”:
- 视觉感知:模型识别出屏幕中央有一个“小红书”的红色图标,底部有一个搜索框,搜索框里有闪烁的光标。
- 意图解析:结合你的指令“打开小红书搜索宠物猫视频”,模型理解最终目标是“搜索宠物猫视频”,但前提是“打开小红书”。
- 规划决策:模型推理出行动序列:
点击“小红书”图标->等待App加载->点击底部搜索框->输入文字“宠物猫视频”->点击键盘上的“搜索”按钮。 - 坐标定位:模型不仅知道要“点击搜索框”,还能精确计算出搜索框在屏幕图片上的像素坐标
(x, y)。
这个“思考”过程,专业上被称为思维链。模型会把它的推理过程用文字描述出来,比如:“用户想搜索宠物猫视频。当前屏幕是桌面,我需要先找到并打开小红书App。识别到小红书图标位于坐标(240, 520),点击它。”
2.3 第三步:执行——AI的“手指”
规划好了,坐标也拿到了,接下来就是动手。Open-AutoGLM 再次通过ADB,将具体的操作指令发送给手机。
# 模拟点击屏幕坐标 (240, 520) adb shell input tap 240 520 # 模拟在焦点输入框输入文本 adb shell input text "pet%scat" # 注意:ADB的input text命令有空格限制,通常需要特殊处理或使用其他输入法。这就是为什么需要安装ADB Keyboard的原因。它是一个特殊的输入法,可以让电脑通过ADB直接向手机注入文本,完美解决在搜索框、聊天框输入文字的问题。
三步循环:点击“搜索”后,屏幕内容变了。于是,流程回到第一步:重新截图->分析新屏幕->执行下一步(比如点开第一个视频)。如此循环,直到任务完成。
3. 手把手实战:让AI帮你规划一次旅行
理论讲完了,我们来点实际的。我将带你完整走一遍流程,让 Open-AutoGLM 操控手机,在小红书上为我们搜索“南京两天一夜旅游攻略”。
3.1 准备工作:给你的手机“装上”数据线
要让电脑控制手机,需要先建立连接通道。
在手机上开启“开发者模式”:
- 打开手机设置->关于手机,找到版本号。
- 连续快速点击“版本号”7次左右,直到出现“您已处于开发者模式”的提示。
开启“USB调试”:
- 返回设置,现在你会看到多了一个开发者选项。
- 进入后,找到并开启USB调试。
连接电脑并安装ADB工具:
- 用USB数据线连接手机和电脑。
- 在电脑上下载 Android Platform Tools,解压。
- (Windows)将解压后的文件夹路径(如
C:\platform-tools)添加到系统的环境变量Path中。 - 打开电脑命令行,输入
adb devices。如果看到一串设备号,后面显示device,恭喜你,连接成功!
安装ADB Keyboard:
- 在手机上下载并安装 ADB Keyboard。
- 安装后,进入手机设置->系统管理/语言与输入法->虚拟键盘,将ADB Keyboard设为默认输入法。
3.2 部署控制端:把AI大脑请到电脑上
现在,我们在电脑上部署 Open-AutoGLM 的控制程序。
# 1. 克隆项目代码仓库 git clone https://github.com/zai-org/Open-AutoGLM.git cd Open-AutoGLM # 2. 安装项目所需的Python库 pip install -r requirements.txt3.3 获取AI能力:申请一个“云大脑”
我们不需要在本地电脑上运行庞大的AI模型,那样对显卡要求太高。我们可以直接使用智谱AI提供的云端模型服务,按需调用,非常方便。
- 访问 智谱AI开放平台 并注册账号。
- 在控制台创建API Key,并复制保存好。
3.4 启动任务:向AI下达指令
万事俱备,现在可以给你的新“助理”派发第一个任务了!
在项目目录下打开命令行,运行以下命令(请替换你的_API_KEY):
python main.py \ --base-url https://open.bigmodel.cn/api/paas/v4 \ --model "autoglm-phone" \ --apikey "你的_API_KEY" \ "打开小红书,搜索‘南京两天一夜旅游攻略’,并点开第一篇笔记详细看看"运行后,你会看到电脑命令行开始滚动日志,同时你的手机屏幕会像被“幽灵”操控一样自动亮屏、解锁(如果设置了)、找到小红书图标、点击、进入搜索页、输入文字、点击搜索、浏览结果……
你将会看到类似这样的过程:
[截图]->[分析] 当前是桌面,找到小红书图标位于(300, 600),点击。[执行] 点击 (300, 600)。[截图]->[分析] 已进入小红书首页,发现底部导航栏有搜索按钮,点击。[执行] 点击搜索按钮。[截图]->[分析] 已进入搜索页,识别到搜索输入框,输入文本“南京两天一夜旅游攻略”。- ... (依次执行)
最终,AI会成功地找到相关笔记并打开它,甚至可能进行滑动浏览。你可以在命令行最后的输出中,看到它搜索到的攻略文本内容。
4. 它能做什么?不止是“玩手机”
通过上面的例子,你可能已经感受到了它的潜力。它的应用场景远不止于此:
- 自动化测试:自动遍历App,点击各种按钮,发现崩溃或UI错误。
- 个人效率助手:
- 定时任务:每天早上自动打开天气App并截图发给你。
- 信息收集:自动在多个电商平台比价,并整理成表格。
- 社交管理:自动给新粉丝回关,或给朋友圈点赞。
- 无障碍辅助:为视障或行动不便的用户提供语音控制手机所有功能的能力。
- 游戏自动化:执行一些重复性的游戏操作(需注意游戏规则)。
- 工作流自动化:跨App完成复杂任务,如“将微信收到的文件保存到网盘,并分享链接到钉钉群”。
5. 总结与展望:人人可用的AI智能体
Open-AutoGLM 为我们清晰地展示了一条路径:大模型 + 视觉感知 + 环境控制 = 真正能行动的AI智能体。它将原本只存在于对话中的AI,赋予了“眼睛”和“手”,使其能进入真实的数字世界并完成任务。
对于开发者来说,它是一个绝佳的研究和实验平台。对于普通用户,通过本文的教程,你完全可以在半小时内搭建一个属于自己的手机AI助手,体验前沿AI技术的魅力。
当然,它目前仍处于发展阶段,可能会遇到复杂界面识别不准、操作逻辑偶尔“卡壳”的情况。但这正是开源项目的魅力所在,每个人都有机会去改进它、优化它,甚至基于它开发出更强大的应用。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
