微信视觉团队近日宣布,其研发的通用多模态嵌入模型WeMM-Embedding正式开源,包含2B、4B、9B三个参数规模的版本。该模型突破了传统单一模态处理的局限,能够同时解析文本、图像、视频及视觉文档等多种形式的内容,并实现跨模态语义空间的统一映射与检索。
据微信内部技术人员透露,WeMM-Embedding的核心创新在于构建了多模态联合表征空间。通过将不同类型的数据映射至同一语义维度,系统可精准理解"文字描述与对应图像的关联性"或"视频片段与文本摘要的匹配度"。这种能力使得跨模态内容检索的准确率显著提升,例如用户用文字搜索图片库时,系统能理解抽象描述并返回高度相关的视觉结果。
该模型已深度融入微信生态的多个核心场景。朋友圈的智能搜索功能通过WeMM-Embedding实现图文混合检索,视频号推荐系统利用其进行多模态内容理解,公众号推荐算法则借助模型提升图文匹配度。更值得关注的是,微信电商板块通过该模型实现了商品图文视频的联合推荐,日均调用量突破10亿次,成为国内首个大规模落地的多模态应用案例。
在国际权威评测基准MMEB-v2上,WeMM-Embedding以显著优势登顶榜首,超越了所有已提交的开源及闭源模型。评测数据显示,该模型在跨模态检索、语义理解等关键指标上较第二名提升超过15%,特别是在处理复杂视觉文档与长视频理解任务时展现出独特优势。目前,微信团队已将模型代码及训练框架完整开源,为全球开发者提供多模态技术研发的基础设施。

