技术

阿里巴巴的读屏AI在真实手机上达到92%,还能在你的硬件上运行

Susan Hill

阿里巴巴的Qwen-UI-Agent无需特殊权限即可访问你的应用。它通过视觉感知读取屏幕、识别内容并执行点击操作,从消息发送到文档编辑,全凭视觉完成。模型权重——MAI-UI-2B和MAI-UI-8B——本周已上传至Hugging Face,任何拥有GPU的开发者都能使用这套系统。

基准测试数据很具体。在移动端智能体标准评估MobileWorld上,Qwen-UI-Agent得分82.1%,比GPT-5.6高出12个百分点,比Claude Opus 4.8高出14.6个百分点。差距并非微不足道——可比的西方系统在同一测试中已数月徘徊在70%中低段。在真实设备测试(在真实Android手机上而非模拟器上执行任务)中,得分攀升至92.2%。在更广泛的真实手机评估AndroidDaily上,模型达到97.5%。在桌面端,通过OSWorld-Verified衡量,得分为79.5%,领先于GPT-5.5和Gemini 3.1 Pro。

阿里巴巴使用来自100多台真实移动设备、运行150个不同应用的数据训练模型,随后构建了自己的基准测试MobileWorld-Real,包含400多项任务以验证实验室外的性能。约40%的桌面任务涉及批量命令行操作与视觉点击相结合,这一设计选择反映了真实计算场景,而非演示的编排方式。

安全层已内置于工作流程中。模型会拒绝其标记为非法或高风险的任务,并在敏感操作(支付、数据删除、隐私授权)前暂停,要求用户明确确认后才继续。系统通过强化学习处理超过100步的长序列,该强化学习在约10,000个并行模拟环境中训练。

基准测试分数留下了更棘手的问题。Qwen-UI-Agent是在结构化任务上评估的;真实的手机使用场景充满中断、通知杂乱,且应用会无预警更新界面。屏幕阅读AI还引发了一个阿里巴巴技术报告未提及的隐私问题:一个处理你屏幕每一像素的模型,能够访问银行信息、私人消息以及大多数用户从未考虑过交给第三方系统的数据。第三方部署中如何处理这些数据的指南尚付阙如。

该项目托管在GitHub的Tongyi-MAI/MAI-UI仓库;模型权重现已上传至Hugging Face。尚未公布商业API或部署定价。Qwen-UI-Agent的下一个测试并非基准——而是基于开放权重进行开发的开发者,能否在生产环境中复现阿里巴巴在实验室中记录的成绩。

标签: , , , , ,

讨论

有 0 条评论。