首页 > 教程攻略 > ai教程 >AI让手机任务自动“跑”起来,我国高校最新研究,简化移动设备操作

AI让手机任务自动“跑”起来,我国高校最新研究,简化移动设备操作

来源:互联网 时间:2026-07-28 07:24:57

AI正在把人类从重复的屏幕操作中解放出来——甚至可以让你的手机自己帮你在App之间东点西划。没错,这并不是科幻电影,而是正在快速落地的“移动任务自动化”技术。

这个方向如今已经成为AI领域一个炙手可热的研究点。简单来说,移动任务自动化就是让AI理解人的意图,然后在移动设备(手机、平板、车机)上代替你执行一系列操作。对于视障人群、老年人、以及正在开车的用户来说,这种技术带来的价值不言而喻:

帮助视障用户完成导航、阅读或网购;
辅助老年人跨越数字鸿沟,轻松使用手机;
帮助车主在驾车过程中安全地发送信息或调节车内环境;
替所有人完成那些高频又重复的日常任务……

比如,再也不用为人手设置多个日历提醒而心烦了。

最近,来自西安交通大学智能网络与网络安全教育部重点实验室 (MOE KLINNS Lab)的蔡忠闽教授、宋云鹏副教授团队,基于最新的AI研究成果,提出了一套基于视觉的移动设备任务自动化方案——

VisionTasker

这项研究不但让普通用户的智能设备体验更上一层楼,更展现出对特殊需求群体实实在在的关怀与赋能。

基于视觉的移动设备任务自动化方案

团队提出的VisionTasker,是一个将“基于视觉的UI理解”与“大语言模型任务规划”相结合的两阶段框架。它的目标只有一个:逐步实现移动任务的自动化。

这套方案最关键的价值在于,它摆脱了对传统视图层级结构(View Hierarchy)的依赖,对各种App界面的适应性因此大幅提升。而且,它的另一个亮点是:不需要海量数据去专门训练大模型。

VisionTasker的工作流程,从用户用自然语言提出任务需求开始。具体来说是这样运作的:

第一步:用户界面理解

VisionTasker通过纯视觉的方式来解析界面。Agent首先识别并分析屏幕上的UI元素及其布局——按钮、文本框、文字标签都逃不过它的“眼睛”。随后,这些视觉信息会被转换成自然语言描述,让系统真正“理解”当前界面上有什么。

第二步:任务规划与执行

接下来,Agent借助大语言模型进行“导航”。它根据用户的指令和刚才生成的界面描述,把用户的任务拆解成一系列可执行的操作步骤,比如“点击这个按钮”或者“滑动那个列表”,然后自动推进执行。

第三步:持续迭代,步步为营

每完成一步,Agent都会根据最新的界面截图和历史动作更新对话与规划。这保证了每一步决策都基于当前的上下文,而不是死板地按预设脚本走。整个过程会一直迭代,直到任务完成或达到预设的限制。

用户不仅可以从交互中解放双手,还能通过可见的提示监控任务进度,并在需要时随时中断——控制权始终在手。

具体到UI理解环节,系统会先识别界面中的小部件和文本,检测按钮、文本框等元素及其位置。对于没有文字标签的图标按钮,利用CLIP模型基于视觉设计来推断其可能的功能。随后,系统根据UI布局的视觉信息进行区块划分,将界面分割成具有不同功能属性的区域,并对每个区域生成自然语言描述。最后,文本与小部件会被一一匹配,确保系统正确理解每个元素的功能。这些信息最终会被整合成一份语义丰富的界面“说明书”,交给大模型去完成后续的任务规划。

实验评估

在实验评估部分,团队对三种不同的UI理解方式做了横向对比:GPT-4V、传统的视图层级(VH)方法,以及VisionTasker的方法。

△ 对比显示,VisionTasker在多个维度上相比其他方法有显著优势。

此外,它在处理跨语言应用时也表现出不俗的泛化能力。

△ 结果表明,以视觉为基础的UI理解在理解和解释复杂多样的界面时,优势非常明显。

△ 在单步预测实验(即根据当前状态预测下一步操作)中,VisionTasker在所有数据集上的平均准确率达到了67%,比基线方法提升了15%以上。

真实世界任务:VisionTasker vs 人类

为了检验实际能力,研究人员设计了147个真实的多步骤任务,覆盖了国内常用的42个应用程序。他们还请来了12名人类评估者手动执行同样的任务作为对照组。

结果显示,VisionTasker在大多数任务中能达到与人类相当的完成率。更令人印象深刻的是,在处理某些用户不太熟悉的App任务时,它的表现甚至超过了人类。

△ 实际任务自动化实验的结果。“Ours-qwen”指使用开源Qwen实现VisionTasker,“Ours”表示使用文心一言作为大模型。

团队还评估了VisionTasker在不同条件下的表现,包括更换不同的大语言模型(LLM)以及集成编程演示(PBD)机制。结果再次印证:VisionTasker在大多数直观任务上与人类水平持平,在熟悉任务中略低于人类,但在不熟悉的任务中优于人类。

结论

作为一个基于视觉和大模型的移动任务自动化框架,VisionTasker成功绕开了传统方案对视图层级结构的依赖。通过一系列对比实验,它在UI表现上明显优于传统的编程演示和视图层级方法。

它在4个不同数据集上都展现出高效的UI表示能力与应用广度;在Android手机上的147个真实任务测试中,尤其是在复杂任务处理上,甚至表现出超越人类的完成能力。此外,集成编程演示(PBD)机制后,任务自动化的性能得到了进一步提升。

目前,这项研究工作已经以正式论文的形式,发表于2024年10月13日至16日在美国匹兹堡举行的人机交互顶级会议——UIST(The ACM Symposium on User Interface Software and Technology)。UIST是人机交互领域专注于人机界面软件与技术创新的CCF A类顶级学术会议。