该模型于6月24日推出,通过单一架构统一模拟文本与图形界面环境,并同步开放包含真实观测数据的AgentWorldBench评测基准。
阿里巴巴千问团队于6月24日正式发布Qwen-AgentWorld,这是业界首个原生语言世界模型(Language World Model)。该模型旨在突破传统大语言模型仅能处理文本交互的局限,将环境建模作为核心训练目标贯穿从继续预训练(CPT)到监督微调(SFT)及强化学习(RL)的全流程。不同于以往对通用模型进行事后适配的方案,Qwen-AgentWorld基于超过1000万条真实环境交互轨迹构建,能够模拟智能体在复杂数字世界中的交互行为,推动人工智能从对话工具向具备独立操作能力的行动者转变。
在技术架构与应用覆盖上,该模型实现了单一架构对七大智能体交互领域的统一支持。具体涵盖文本类环境(MCP、Search、Terminal、SWE)与图形界面类环境(Web、OS、Android),使得模型能够在代码生成、信息检索、终端操作、软件工程、网页浏览、系统控制及移动应用等多个场景中实现跨领域知识迁移。官方提供了两个不同规模的模型版本,分别为35B-A3B和397B-A17B。其中,较大规模的Qwen-AgentWorld-397B-A17B在同步发布的AgentWorldBench评测基准中取得了最高整体模拟质量,其表现超越了GPT-5.4、Claude Opus 4.8与Gemini 3.1 Pro等竞品模型。
为确保评估的客观性与实战性,研究团队同步推出了AgentWorldBench评测基准。该基准覆盖上述七大核心领域,所有测试样本均配备由真实环境执行所产生的观测数据,摒弃了传统依赖模拟仿真数据的评价方式。目前,Qwen-AgentWorld模型权重及评测工具集已通过Hugging Face和ModelScope平台向全球开发者开放。这一发布标志着语言模型在通用智能体构建路径上的重要进展,为自动化工作流、跨平台任务执行及复杂数字环境下的智能决策提供了新的技术范式。
从行业背景来看,Qwen-AgentWorld的问世响应了大模型向智能体演进的技术趋势。通过解决不同操作环境间的割裂问题,该模型提升了AI在真实业务场景中的适应性,有助于开发者构建更高效的自动化系统。其开源策略将进一步促进智能体生态的发展,使具备多环境感知与执行能力的技术能够更广泛地应用于办公辅助、代码开发及业务流程优化等领域。