该模型于 7 月 17 日由阿里通义实验室推出,整合听看说演功能至单一 Transformer 架构,将视频输出分辨率提升至 640×368,支持全双工实时交互并应用于教育、医疗及游戏场景。
阿里通义实验室于 7 月 17 日正式发布 Wan-Streamer v0.2 模型,该模型定位为面向实时双工交互的端到端全模态理解与生成系统。其核心突破在于将听觉感知、视觉理解、语言生成及动作表现统一整合至单个 Transformer 架构中,实现了 AI 在接收用户输入的同时进行同步响应。系统实测数据显示,包含网络传输在内的端到端交互延迟压缩至 550ms,其中模型计算耗时约为 200ms,网络传输耗时约为 350ms。
在技术实现层面,Wan-Streamer v0.2 摒弃了传统级联流水线的处理模式,转而采用原生流式架构。系统引入“流式单元”概念,以约 160ms 为周期完成闭环操作:感知当前时段的音视频输入、更新交互状态与上下文、生成同步的语音和视频潜变量,并解码输出上一单元的响应内容。这种机制使得 AI 无需等待用户完整表达即可进行实时反馈,将“感知、理解、生成、解码”过程并行化处理。相比前代版本 v0.1,该模型在视频画质上实现了显著升级,输出分辨率从 192×336 提升至 640×368,帧率维持在 25FPS,使得微表情及场景细节得以清晰呈现。
交互形态上,新版本构建了具备完整身体语言的数字人形象,突破了仅展示头部悬浮影像的局限。模型能够根据对话内容动态调整视线焦点、坐姿站态及手势动作,并支持在复杂光照和动态背景环境下保持高同步率。其应用场景覆盖口语陪练、心理咨询、教育辅导及游戏非玩家角色互动等多个领域。在医疗与教育试点中,系统能够通过微表情分析识别用户情绪,自动调整语速与肢体语言以提供更具亲和力的交互体验,解决了传统实时交互系统中常见的卡顿与声画不同步问题。