本次开放发生于9月4日,模型提供2B、4B、9B三种参数规格,覆盖检索、推荐和内容理解等应用,将文本、图像、视频与视觉文档统一到同一语义空间中处理,以提升跨媒体内容召回效率。
微信方面在9月4日公布其通用多模态嵌入模型 WeMM-Embedding 的开源安排,并提供 2B、4B、9B 三个参数规模版本。该模型定位为跨模态理解与检索基础组件,能够接收文本、图像、视频、视觉文档以及由不同内容类型交错组成的输入,并将这些信号编码到统一向量空间内,便于后续比对、排序和召回。
这套模型已接入微信内部多项业务链路,包括朋友圈内容搜索、视频号推荐、公众号推荐和微信电商相关功能,整体日调用规模达到 10亿次。技术路线上,模型重点在于建立联合语义表征:文字描述、画面片段、视频帧、文档区域等均可被转换为可比较的嵌入向量,从而在同一框架中完成跨媒介关联分析。以常见查询为例,当用户输入某件商品的文字描述时,系统不只匹配图文素材,也可以召回包含该商品的视频或混合媒体内容,提升结果覆盖面和相关性。
项目论文位于 arXiv,编号为 2608.24053;源代码托管在 GitHub 的 Tencent/WeMM-Embedding 仓库;模型文件通过 Hugging Face 的 tencent/wemm-embedding 集合提供。评测结果显示,模型在 MMEB-v2 榜单排名处于首位,且超过此前已提交的开源和闭源模型。对于外部使用者,三个版本可按算力条件选择,2B 对应移动端部署,4B 兼顾性能与效率,9B 面向更高精度场景;在行业层面,这类跨模态嵌入能力可用于社交平台的搜索、推荐和商品理解,并为研究团队提供可复用的参考基线。