微信官方平台近日正式宣布,其视觉团队将自主研发的通用多模态嵌入模型WeMM-Embedding全面开源。该模型每日在线上处理超十亿次调用请求,现已推出2B、4B、9B三种参数规模的版本,可同时支持文本、图像、视频及视觉文档等单一或混合模态的输入处理。
技术架构方面,WeMM-Embedding采用统一多模态设计框架,通过分阶段训练策略显著提升内容区分能力。研发团队创新性地结合知识蒸馏技术与套娃表示方法,在保持小参数模型性能的同时,有效优化了大规模部署的运算效率。这种设计使得不同量级的模型版本均能满足多样化应用场景的需求。
该模型的开源将为多模态内容理解领域提供重要基础设施。开发者可基于不同参数规模的版本,灵活构建涉及跨模态检索、智能内容分析等功能的系统。微信团队表示,此次开源旨在推动行业技术共享,促进多模态AI技术在更广泛场景中的落地应用。
