该模型覆盖移动与桌面端真实设备环境,在多项GUI评测基准中超越GPT-5.6 Sol、Claude Opus 4.8等竞品,建立超百台真机测试集群以支持训练与验证。
阿里巴巴于8月20日正式推出Qwen-UI-Agent,这是一款专注于真实世界图形用户界面交互的智能体基座模型。该模型旨在解决现有大模型难以直接操作各类数字设备界面的问题,通过理解屏幕内容并模拟人类操作步骤,实现对移动端、PC桌面端、网页以及深度搜索环境的统一控制。此次发布标志着AI智能体从单纯的任务规划向实际设备执行能力的延伸,核心目标是让模型具备“使用每一块屏幕”的通用执行能力。
在性能表现方面,Qwen-UI-Agent在多个关键基准测试中取得领先数据。移动端测试显示,其MobileWorld得分达到82.1%,真机基准MobileWorld-Real为92.2%,Android Daily任务完成率高达97.5%。电脑端操作中,OSWorld-Verified得分为79.5%,在OSWorld-v2 Partial测试中不仅获得40.0%的分数,还实现了较基线方案节省58%执行步数的效率优化。浏览器与深度搜索领域,WebArena得分为73.6%,BrowseComp-ZH为75.0%,均位列对比模型首位。此外,在ScreenSpot-Pro界面定位任务中,该模型得分81.5%,并在其他四个定位评测基准上刷新了行业最佳表现。上述数据表明,其在GUI专用任务上的表现已全面对标并超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等主流海外旗舰模型,同时保持了基座模型在通用对话与代理任务上的原有能力。
为支撑模型的训练与评估,阿里巴巴构建了覆盖超过100台真实手机和150余款应用的物理测试环境。该集群用于生成任务轨迹、采集操作数据以及进行最终的真实性验证,并以此建立了MobileWorld-Real真机基准体系。这种从仿真模拟到真实设备落地的技术路径,旨在解决虚拟环境训练与真实世界执行之间的差距问题。行业观察认为,随着GUI智能体能力的提升,AI将更深度地融入操作系统与应用生态,为自动化办公、无障碍辅助及复杂流程自动化提供更直接的技术支持,同时也加剧了全球大模型厂商在具身智能与数字交互领域的竞争。