AREX Feed Article
阿里 Qwen 发布 Qwen Intelligence:三个手机智能体与四套开放评测基准
北京时间 9 月 23 日晚,阿里 Qwen 官方 X 账号 ,推出手机智能体体系 Qwen Intelligence,首批包含三个智能体:负责任务规划与分解的 Mobile Planner、以「API 优先、GUI 兜底」(优先调用接口,必要时再操作图形界面)执行手机操作的 Mobile-Use,以及一句话直出成品的 Mobile Creative。公告同时宣布开放四套评测基准:MobilePA-Bench、MobileWorld、MobileWorld-Real 与 MobileWorld-Safety,覆盖规划、跨应用执行、真机表现与安全。
9 月 22 日,Qwen 官方知乎机构号「千问大模型」发布的中文长文给出了更完整的内容:Qwen Intelligence 定位为面向手机厂商的全栈方案,三个智能体「均达到行业 SOTA 水平」(SOTA 指业界最佳水平),主视觉打出的字样是「正式开启公测」。两处发布材料中的名次与性能数字都出自 Qwen 自己或其维护的评测设施,应视为厂商口径;文中会标出可以独立核查的部分。
Mobile Planner:先判断,再行动的「手机大脑」
官方把 Mobile Planner 比作「手机的大脑」:理解用户意图、把复杂任务拆解成步骤、编排工具调用,并在执行中动态调整。发布文介绍了它的两项核心技术:一是「模型 × Harness 协同演进」,模型负责理解、规划与决策,Harness(运行时层)负责状态、记忆与技能,两者在真实环境中执行、反馈、闭环;二是「双层记忆」,工作记忆随任务演化,长期记忆把短期经验沉淀为用户画像和认知。
数字上,Qwen 称 Mobile Planner 在 MobilePA-Bench Business、MobilePA-Bench 与记忆能力评测 Memory 三项中均列第一;配套的 给出的具体成绩是:Qwen-Planner-Agent 27B 在 MobilePA-Bench 上的 Overall(总体分)为 77.05%,比基线高 9.83 个百分点,估算千次任务输出成本约 2.41 美元,在受评系统中排名第一。发布材料的对比图中,Business 一项为 90.8,图上标注「真实业务场景成功率超过 90%」。
Mobile-Use:接口优先,GUI 覆盖长尾,安全线划三层
发布文把 Mobile-Use 描述为「API 优先+GUI 兜底」的混合操作模式:当存在可调用的接口时,通过 MCP(模型上下文协议)、API(应用接口)、DeepLink(深度链接)、CLI(命令行)等方式直接调用;没有接口时,用视觉理解和 GUI 操作覆盖长尾场景。安全上划了三条线:违法或高风险请求直接拒绝;涉及资金、数据删除等关键决策交还用户确认;平台规则不让代劳的动作,只做到交给用户前的最后一步。发布材料用 8 个真机示例展示这三条线:2 例直接拒绝、4 例交还确认、2 例交接给用户完成。
数字方面,发布文给出的成绩是 MobileWorld 82.1、MobileWorld-Real 92.2、AndroidDaily 97.2,端到端实测任务成功率 90%(高于其对比的「头部方案」3 个百分点),单步时延下降 16%,单次任务耗时从 83.6 秒压缩到 59.5 秒,任务费用降低 20%,安全评分高出 23 个百分点。
这些数字有一部分能在公开渠道对上:里,Qwen-UI-Agent 的条目日期为 2026 年 7 月 30 日,GUI-Only(纯图形界面任务)成绩 82.1,并附有轨迹文件;按该榜现有条目,82.1 是 GUI-Only 一列的最高值,其后是 Kimi-K3 的 74.4 与 Wuying-Mobile-27B 的 73.5(该榜与评测代码由 Qwen 团队维护)。另一项基准 AndroidDaily 不在四套之列:今年 5 月公开,含 350 个任务、94 个高频闭源应用,用过程评估器 GRADE 做自动核验,Qwen 报出的 97.2 属于自测成绩。
Mobile Creative:把生成从 100 步压到 8 步
Mobile Creative 面向影像创作,发布文称其在轻量模型基础上针对手机场景做了优化。Agent 侧的规划模型把口语化需求转成清晰指令、编排任务,用户不用写提示词,一句话可以生成排版清晰的「复古日记」;模型侧通过蒸馏和强化学习提速,生成过程从 100 步压缩到 8 步。发布文给出的速度是首图生成 3 秒、平均比头部竞品快 2 倍。推文为它附的「了解更多」链接是一篇 8 月 17 日提交的 arXiv ,研究像素空间文生图扩散模型的训练,摘要称其配方在端到端推理上比潜空间对照快 3.18~4.75 倍;这两个倍数口径不同:3.18~4.75 倍来自论文的对照实验,2 倍来自发布材料对竞品的比较。
四套评测:从「会不会规划」到「能不能安全做成事」
发布文按四个问题介绍这套评测集:MobilePA-Bench 测「会不会规划」,MobileWorld 测云手机里的跨应用任务「能不能把事做成」,MobileWorld-Real 回答真机上「到底行不行」,MobileWorld-Safety 检查「能不能安全地做成事」。四套的公开程度并不相同。
- MobilePA-Bench():1,705 个评测任务、212 个真实工具、13 个功能领域,按工具调用(权重 50%)、记忆(20%)、技能(20%)与子智能体协作(10%)四个维度加权打分。评测任务与标准答案不公开,外部模型提交一个 OpenAI 兼容的 HTTPS 端点参与评测,3 个工作日内拿到评审报告;配套 8 月 24 日提交至 arXiv。
- MobileWorld():201 个任务、20 个应用,强调长链路与跨应用。给出的难度参照是平均完成步数 27.8 步(AndroidWorld 为 14.3 步)、跨应用任务占比 62.2%(AndroidWorld 为 9.5%)。评测环境跑在 Docker 里的安卓虚拟机上,应用后端用 Mattermost、Mastodon 等开源项目自托管,支持快照复现,也能通过 ADB(安卓调试桥)连接真实手机;榜单接受社区提交。它并非本次才出现:论文 2025 年 12 月已挂上 arXiv,仓库页标注该论文为「ACL 2026」。
- MobileWorld-Real():409 个任务、104 个应用、7 个日常场景域,在真实安卓设备上执行人工撰写的请求,评测会经历验证码、弹窗和网络变化;判定由 AutoJudge(自动评判系统)在轨迹层面给出通过、失败或环境错误。
- MobileWorld-Safety:发布材料给出的规模是 108 个真实任务、按 7 类互斥风险场景归类;发布文称该安全能力体系由 Qwen Intelligence 团队与复旦大学白泽安全团队联合共建,后者由复旦大学计算机科学技术学院院长杨珉教授领衔。
不参与硬件生产:面向手机厂商的三层能力与荣耀案例
发布文写明,Qwen Intelligence 不参与硬件生产,为手机厂商提供三层能力:基于千问大模型、为手机场景深度优化的模型;模块化、可按需组合的全栈平台(支持模型独立部署与 Harness 定制,提供工具与 Skill 的统一治理、运维平台和自动化评测);以及把能力封装成面向真实场景的解决方案。
发布文给出的落地案例是荣耀:阿里与荣耀以 Qwen Intelligence 和荣耀 Magic OS 为基础共建面向下一代 AI 手机的方案,综合任务准确率 91.8%,GUI 操作速度 3.6 秒,复杂长程任务支持 100+ 操作步数,端到端服务闭环率 90%。这些都是发布方口径。
已挂出两档订阅:标准版折后 78 元/月(原价 98 元)、专属版折后 158 元/月(原价 198 元),均为连续包月价,含每月 2,000 或 4,000 积分与云盘等权益;上也有该方案的页面。
可独立核查的产物与一处 0.3 个百分点的出入
本文涉及的成绩目前都出自 Qwen 一侧:MobilePA-Bench 的隐藏任务不对外开放;MobileWorld 条目虽然附有轨迹文件,成绩仍是自报;AndroidDaily 上的分数也是自测。可供核查的公开产物包括 MobileWorld 的仓库、榜单与轨迹文件,MobilePA-Bench 的评测服务入口,以及四篇公开论文。刚建立不久的 Qwen-Planner-Agent 仓库也说明,自己只是博文与技术报告站,「不是模型权重、训练代码或智能体实现的发布仓库」。
一处具体出入:同一个 AndroidDaily 成绩,7 月 30 日提交的 摘要写的是 97.5,本次推文与发布长文写的是 97.2,相差 0.3 个百分点。两个数字都出自 Qwen 自己,间隔不足两个月。
参考链接
- Qwen 官方公告(X):
- Qwen 官方知乎长文:
- Qwen-Planner-Agent 仓库:
- MobileWorld 排行榜:
- AndroidDaily 论文:
- 像素空间文生图论文:
- MobilePA-Bench 网站:
- MobilePA-Bench 论文:
- MobileWorld 仓库:
- MobileWorld 论文:
- MobileWorld-Real 页面:
- Qwen Intelligence 官网:
- 千问 AI 平台 Qwen Intelligence 页面:
- Qwen-UI-Agent 技术报告: