原xAI多模态负责人蔺旭东加入腾讯担任算法负责人,伴随部门合并与人事调整,腾讯明确将多模态理解融入大模型主线而非独立发展世界模型路线。
腾讯混元团队近期完成组织重构,大语言模型部与多模态模型部合并为“基础模型部”,由姚顺雨全面负责。原xAI多模态理解负责人蔺旭东正式加入该部门,出任多模态内容生成算法负责人。此次人事变动发生在胡瀚离职创业、前OpenAI研究员田永龙加入等密集调整背景下,标志着腾讯在多模态大模型技术路线上的深度调整。
蔺旭东毕业于清华大学并获哥伦比亚大学博士学位,研究背景涵盖嵌入学习、视频分析及生成模型,曾参与Facebook AI合作的Vx2Text项目。该项目尝试将视频、音频等多模态数据转换为语言token向量,统一输入语言模型进行融合处理。其加入旨在强化腾讯在多模态理解与内容生成领域的技术整合能力,推动视觉模态作为服务于语言模型的工具化应用。
在战略层面,腾讯正从侧重独立世界模型研发转向强调上下文理解与推理能力的演进路径。姚顺雨公开表示,AI竞争核心已转向长上下文承接、工具调用稳定性及真实场景执行效率,而非单纯追求参数规模。这一方向与李飞飞World Labs倡导的“世界模型作为AGI主线”观点形成区分,更接近DeepSeek等机构主张的视觉模态辅助语言模型的技术路线。目前,腾讯已推出HunyuanVideo、HunyuanImage 3.0(800亿参数)、Hy3D及Hy World1.0等多款模型,其中HunyuanVideo在2024年底成为全球最大开源视频生成模型。
此次调整反映出大模型行业从内容生成向智能体行动能力过渡的趋势。通过整合多模态理解与基础语言模型,腾讯意在提升GUI Agent、办公自动化等垂直场景的落地效率。技术路线的选择将直接影响其在空间智能与具身智能领域的长期布局,同时也为行业提供了另一种AGI演进路径的实践样本。