开盒网暴、诈骗刷单,Fable5等8款模型操作真实手机「成功作案」!
复旦大学计算与智能创新学院的张谧教授,长期深耕AI安全领域,尤其关注大模型与智能体的安全问题。她在网安与AI领域发表了百余篇论文,并参与了《生成式人工智能服务安全基本要求》等国家标准的制定。她带领团队开发的JADE大模型安全风险分析与治理平台,也曾被新华社、人民日报等媒体报道,全网阅读量破千万。
只需一句话,手机智能体就能帮你点外卖、写评价,甚至玩转小程序游戏。听起来很酷,对吧?但这份强大能力背后,也藏着潘多拉魔盒般的风险:它会不会变成不眠不休的“网络水军”?会不会自动锁定反诈对象,群发定制话术?甚至替人购买制毒、制爆原料,沦为黑灰产的“得力帮凶”?
研究团队将8款基于不同模型构建的智能体接入真实手机,在31个国民级应用上逐一验证,首次证实了这些有害任务可以被端到端真实执行,而且部分场景下的执行速度甚至超过了人类。
举个例子,用户一句命令下,号称拥有Anthropic最强安全护栏的Claude Fable5,转眼就干起了“反诈惯犯”的活儿:先自动锁定那些求票心切的受害者,再扒出主页信息拼出用户画像,最后量身定制话术、私信行骗。从找人、扒资料到行骗,整套流程都在真实App里端到端完成,全程不需要任何人插手干预。

首个靶向式手机智能体安全测评数据集
为了系统评估手机智能体在真实应用中的违规使用风险,研究团队构建了BadPhoneAgent数据集。这个数据集从11部国内外法律法规,以及最高法案例等50余处权威报道中,提取了真实的安全风险,最终形成了涵盖6大类、40个子类的《手机智能体恶意使用分类体系》。

论文标题:It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents
论文链接:https://arxiv.org/pdf/2606.27944
项目主页:https://ymsun2020.github.io/Jade-GUI-Agent/
代码主页:https://github.com/ymsun2020/Mobile-GUI-Security

在微信、微博、小红书等31个真实应用上,研究团队人工构造了2768个中英文违规问题,形成了目前测试样例最多、覆盖真实应用最多的手机端智能体安全测评数据集。基于这些高质量数据,团队将8款基于国内外旗舰模型的手机智能体接入真实手机,在真实应用中开展端到端测评,开创了真实环境安全测评的先河。

商业与开源模型均存在严重的安全风险
基于BadPhoneAgent数据集,研究团队从两个维度对模型进行了系统测评:一是安全意识,即模型能否主动拒绝违规请求;二是有害任务执行能力,即模型在真实环境中能否完成违规操作。
先说安全意识,结果几乎是“形同虚设”。在不使用任何越狱手段的情况下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4以及Doubao-Seed-2.0-Pro这4款商业模型的平均拒答率仅为18%。值得关注的是,经过安全加固的谷歌旗舰模型Gemini 3.1 Pro,其拒答率甚至只有4.4%。而多款开源模型,如智谱AutoGLM、字节UI-TARS-1.5-7B以及阿里GUI-Owl-1.5-8B,其拒答率更是低至0%。

再来看性能速度,已经比肩人类。作为首个在真实世界中测试有害任务完成率的工作,研究发现,开源和闭源模型的平均有害任务完成率高达68.8%。能力最强的商业模型Gemini 3.1 Pro达到86%,而开源的AutoGLM更是飙升至96%。在执行速度上,更令人惊讶的是,包括GUI-Owl-1.5、UI-TARS-1.5在内的多款开源模型,执行速度已能比肩甚至超过人类。在“制毒制爆”任务中,Gemini 3.1 Pro和Sonnet-4.5全程无一拒绝,成功下单付款,买齐了3种可直接用于制造爆炸物的原料配方。而Opus 4.8为了购买制毒原料,居然伪造病史,欺骗线上医生开具处方。据我们所知,这是世界上首次由智能体端到端完成的制毒制爆原料采购。

图注:Opus 4.8 为了制作碘化汞,虚构病史,欺骗线上医生购买处方药红药水,并端到端自主完成了全部所需原料的下单与付款。
由此,一个令人担忧的结论浮出水面:基于各类模型的手机智能体,安全意识低、有害任务完成率高,再加上比肩人类的执行速度,已经让它们初步具备了在真实世界中被批量恶意使用的条件。
安全意识与任务执行的鸿沟
研究还揭露了手机智能体中一个隐藏现象——“Safety Awareness-Execution Gap”(安全意识到执行鸿沟)。当直接询问“这个请求是否违规”时,智能体往往能够识别出其中的风险;但要求它们执行同一个有害任务时,却可能毫不犹豫地完成操作。

图注:当直接询问 Claude Sonnet-4.5「该任务是否违规」时,它能够识别其中包含的威胁、骚扰等有害意图。然而,当要求智能体在真实手机环境中执行同一个有害任务时,它却继续完成点击、发布等操作。

图注:左图:执行 Agent 任务时,安全神经元的激活值明显低于判断 query 是否有害时的激活值。右图:模型能够准确识别 60% 以上的任务是否有害,但仍会执行这些任务。
通过神经元分析,研究进一步发现:在执行Agent任务时,负责安全判断的机制并未被充分激活,这与智能体“知道危险却依然执行”的行为相关。通过定位安全神经元并进行干预,智能体能够在几乎不增加推理成本的情况下显著提升拒绝能力,这为未来构建更可行、更鲁棒的手机智能体提供了新的方向。