微信开源 WeMM-Embedding 多模态模型,日调用量超 10 亿次

2 阅读

微信开源 WeMM-Embedding,多模态能力落地真实场景

微信 AI 最近开源了通用多模态嵌入模型 WeMM-Embedding,并一次性放出三个参数规模的版本:2B、4B 和 9B。这个模型最特别的地方在于,它不只处理单一模态,而是能同时理解文字、图片、视频,甚至直接解析 PDF、扫描件这类视觉文档,还能应对文本和图像交错出现的复杂输入——比如带图的文章、图文混排的聊天记录,或者视频里穿插字幕和画面的情况。

这种能力背后的核心思路,是把不同模态的信息都映射到同一个语义空间里。简单说,就是让系统“看图”和“读文”时用的是同一套理解逻辑,这样在做跨模态检索(比如用一句话搜相关图片)时,匹配会更准、响应也更快。

在权威榜单上跑赢闭源商业模型

WeMM-Embedding 的表现已经通过国际公认的多模态评测基准 MMEB-v2 验证。在这个综合评估多模态理解与检索能力的榜单上,它拿下了第一名,成绩超过了此前所有提交的开源模型,也包括一些未公开细节的商业闭源方案。

MMEB-v2 测试涵盖多个子任务,比如图文匹配、视频-文本对齐、跨模态零样本分类等。WeMM-Embedding 能在整体得分上领先,说明它在不同任务间的泛化能力比较均衡,不是靠某一项“偏科”拉高分数。

值得注意的是,这个榜单并不只看准确率,还会评估推理效率和资源占用。微信团队在设计时显然考虑了实际部署成本,所以即使是 9B 版本,也能在合理硬件条件下运行,而不是一个只能在实验室跑的“纸面模型”。

日调用量破 10 亿,真正在微信生态里跑起来了

比起很多停留在论文或 demo 阶段的多模态模型,WeMM-Embedding 的最大优势是已经在微信内部大规模使用。根据官方披露的数据,它每天被调用超过 10 亿次,覆盖多个核心功能:

  • 朋友圈搜索:用户输入关键词,系统能找出包含相关图片或文字的朋友圈内容;
  • 视频号推荐:理解视频画面和语音内容,结合用户兴趣做精准分发;
  • 公众号推荐:分析文章中的图文组合,提升内容匹配度;
  • 微信电商:帮助用户通过图片或描述快速找到商品。

这些场景对延迟和稳定性要求极高。比如朋友圈搜索必须在几百毫秒内返回结果,否则用户体验会明显下降。能在这种压力下稳定运行,说明模型不仅效果好,工程优化也到位。

开源资源已开放,开发者可直接上手

为了让社区能复现和扩展这项工作,微信 AI 同步开源了完整的代码库和预训练模型。开发者可以在 Hugging Face 或 ModelScope 上下载三个版本的权重,并通过提供的推理脚本快速测试。

代码仓库里还包含了详细的使用示例,比如如何用一句话检索本地图片库,或者如何对一段视频生成语义向量用于聚类。对于想做多模态应用但缺乏训练数据和算力的团队来说,这相当于省去了从头搭建基础模型的成本。

不过需要注意,虽然模型本身开源,但训练数据并未公开。微信团队提到,训练集主要来自微信生态内的脱敏日志,包含大量真实用户交互产生的图文、视频内容。这也解释了为什么模型在中文场景和社交内容理解上表现突出。

支持视觉文档,解决实际痛点

WeMM-Embedding 的另一个实用特性是原生支持 视觉文档(visual documents)。这指的是那些以图像形式存在的文本内容,比如扫描的合同、发票、菜单、手写笔记等。传统 OCR 先识别再处理的方式容易出错,而 WeMM-Embedding 能直接把整张图当作输入,在嵌入空间里和纯文本做对齐。

举个例子,用户拍一张餐厅菜单的照片,系统可以直接理解“宫保鸡丁”这道菜,并关联到相关的菜品介绍或用户评价,而不需要先准确识别出每个字。这种端到端的理解方式在模糊、倾斜或低光照的图片上更鲁棒。

目前这一能力已在微信的“扫一扫”和部分企业服务中试用。未来如果开放给第三方小程序,可能会催生一批基于视觉文档的新应用,比如智能报销、合同比对或教育领域的作业批改。

混合多模态输入:不只是拼接,而是融合

很多多模态模型处理混合输入时,只是简单地把文本 token 和图像 patch 拼在一起送进网络。WeMM-Embedding 则采用了更精细的融合机制。据技术文档透露,它在编码阶段就引入了跨模态注意力,让文本和图像特征在早期就能相互引导。

比如输入一段带表情包的聊天记录:“今天加班好累 😩”,模型不会把文字和表情分开理解,而是联合判断情绪强度。这种设计在社交场景中特别有用,因为用户表达往往依赖图文配合。

测试显示,在处理这类交错输入时,WeMM-Embedding 的语义一致性得分比基线模型高出 15% 以上。这意味着它更少出现“文字说开心,却匹配到悲伤图片”的错误。

开源不等于万能,仍有使用门槛

尽管模型已开源,但要真正用起来,还是有些门槛。首先是硬件要求:9B 版本在 FP16 精度下需要至少 24GB 显存,普通消费级显卡可能跑不动。不过 2B 版本可以在 8GB 显存的设备上运行,适合轻量级应用。

其次是中文优先。虽然模型理论上支持多语言,但训练数据以中文为主,英文或其他语言的表现可能不如专门针对该语言训练的模型。如果要做国际化产品,可能需要额外微调。

最后是部署复杂度。微信提供了 Docker 镜像和 ONNX 导出脚本,但要集成到现有系统里,仍需一定的工程能力。对于只想调用 API 的用户,目前还没有公开的在线服务,得自己搭推理后端。

为什么这件事值得关注?

过去几年,多模态大模型大多由海外公司主导,比如 OpenAI 的 CLIP、Google 的 PaLI。WeMM-Embedding 的出现,标志着国内团队不仅能跟上节奏,还能在特定场景(如中文社交内容)做到领先。

更重要的是,它证明了大模型的价值不只在“炫技”,而在于解决真实问题。10 亿次的日调用量不是靠营销吹出来的,是用户每天在用微信时实实在在产生的需求。这种从场景出发、再反哺技术的路径,或许比单纯追求参数规模更有参考意义。

对开发者来说,现在有了一个经过实战检验的开源选项。与其从零开始训练,不如站在微信的肩膀上,快速构建自己的多模态应用。毕竟,在 AI 领域,能跑在生产环境里的模型,才真正有价值。