多语言检索新突破:mLateOn如何超越翻译训练的语言边界?

0 阅读

从英语到多语言:开放数据配方的扩展之路

在上一轮工作中,我们验证了英语检索模型的开放数据配方,证明了精心策划的数据集能够缩小与闭源实验室的差距。现在,我们将这一配方扩展至多语言场景,通过翻译训练构建了大规模的多语言检索语料库。这一过程并非简单的数据复制,而是对原有英语数据管道的系统性延伸,涉及翻译策略、跨语言配对以及训练方法的全面调整。

翻译训练的核心逻辑

为何选择翻译训练

独立为每种语言构建同等规模的高质量训练数据,成本高昂且质量难以保证。翻译训练的优势在于,它从已经过严格筛选的英语数据出发,通过机器翻译生成多语言版本,既保留了原始数据的语义相关性,又避免了重复的数据清洗工作。当然,翻译本身可能引入新的噪声,因此我们将其视为起点而非终点。

翻译管道的设计

我们使用Mistral-Small-3.1-24B-Instruct模型进行预训练数据的翻译,采用语言特定的提示词,包含两个翻译示例,引导模型进行意译而非直译。查询和文档在同一上下文中联合翻译,确保两侧语义一致。对于微调数据,则使用Qwen3-32B模型,因为其发布时间较晚,但效果同样可靠。

One English query and document pair translated into the eight target languages in a single pass, with the idiomatic translation of 'a common culprit' highlighted in each language

跨语言配对的构建

One English query and document pair translated into the eight target languages in a single pass, with the idiomatic translation of 'a common culprit' highlighted in each language

为了支持跨语言检索,我们将25%的单语数据中的文档替换为另一种语言的翻译版本,同时保持查询语言不变。这种设计使得英语在跨语言对中占据约60%的比例,其余八种目标语言各占约10%。实验表明,25%的跨语言比例是性能与效率的平衡点。

训练设置与数据规模

预训练阶段

两个模型均从mmBERT-base骨干初始化,参数量为307M,使用InfoNCE损失和批内负样本,批大小高达16k,借助GradCache技术管理内存。数据混合采用20%英语和80%多语言(其中25%为跨语言对),这一比例在消融实验中表现最佳。

Per-dataset language mix and stored size in the multilingual contrastive pre-training data

监督微调阶段

mLateOn采用MeanMaxSim评分,相比标准MaxSim略有提升,并减少了查询长度偏差。mDenseOn则应用Matryoshka表示学习,支持低维嵌入。两者共享相同的骨干、语料、教师模型和训练时长,确保公平对比。微调数据包含16.3M样本,涵盖九种自然语言和代码,其中加入了MIRACL和MLDR的有机数据,以及LateOn-Code的代码数据。

Per-dataset language mix and total number of query-positive pairs in the filtered contrastive fine-tuning data

实验结果:晚期交互的显著优势

Shared training pipeline for mLateOn and mDenseOn, covering English source filtering, translate-train data, multilingual pre-training, supervised fine-tuning, and model-specific retrieval objectives

英语基准(BEIR)

MLDR NDCG@10 per language: mLateOn vs. mDenseOn, grouped into languages seen and never seen during retrieval training

mLateOn在BEIR上达到57.56 NDCG@10,超过所有对比模型,包括两倍大小的密集模型。mDenseOn也达到56.70,与pplx-embed-v1-0.6b持平,表明多语言训练并未牺牲英语性能。

Models

多语言检索(MIRACL)

Models' highlighted in each language

在目标语言上,mLateOn以65.61分领先,mDenseOn为59.61。更关键的是,在未见语言上,mLateOn平均67.59分,甚至高于目标语言,而mDenseOn仅为57.42。这一差距在MLDR上更为悬殊:mLateOn在未见语言上66.52分,mDenseOn仅35.97分。

BEIR ranking before and after decontamination: every late-interaction model holds or climbs, nearly every dense model falls

长文档检索(MLDR)

BEIR ranking before and after decontamination: every late-interaction model holds or climbs, nearly every dense model falls

mLateOn在目标语言上达到87.69分,全语言77.92分,均为最佳。mDenseOn虽然也使用了MLDR训练数据,但仅与最强密集基线持平,凸显了晚期交互在长文档场景中的优势。

MLDR NDCG@10 per language: mLateOn vs. mDenseOn, grouped into languages seen and never seen during retrieval training

代码检索(MTEB Code)

fig_translate_train_scatter

尽管未进行代码预训练,mLateOn仍以73.48分紧随顶尖模型,mDenseOn也达到71.53分,证明了针对性微调的有效性。

晚期交互为何能超越翻译训练的语言边界

核心发现是,在相同骨干和训练数据下,晚期交互模型对未见语言的泛化能力远强于密集模型。这可能是因为token级表示保留了骨干网络的多语言对齐信息,而单向量池化造成了信息瓶颈。mLateOn在芬兰语、俄语、日语等不同语系和文字上均表现优异,而mDenseOn即使在拉丁语系语言上也大幅下降。

hero

消融实验的实用见解

MIRACL NDCG@10 per language: mLateOn vs. mDenseOn, grouped into languages seen and never seen during retrieval training

英语与多语言比例

MIRACL NDCG@10 per language: mLateOn vs. mDenseOn, grouped into languages seen and never seen during retrieval training

20%英语/80%多语言的混合在微调后英语性能与纯英语相当,但多语言能力显著提升。预训练阶段看似不佳的混合,在完整训练流程后反而最优。

跨语言对比例

增加跨语言对比例(最高60%)并未带来明显收益,少量跨语言数据已足够。这可能是因为翻译训练本身已提供了强对齐信号。

MeanMaxSim vs MaxSim

MeanMaxSim在BEIR上略优(56.46 vs 56.19),且减少了查询长度偏差,更适合多语言混合数据。

局限与展望

翻译数据可能引入伪影,未见语言可能出现在骨干预训练中,跨语言检索评估尚不全面。未来可加入更多有机数据,并探索代码预训练。但当前结果已表明,开放数据配方结合晚期交互,能够有效突破翻译训练的语言边界。

结语

mDenseOn和mLateOn的发布,再次印证了开放数据的力量。通过翻译训练,我们不仅扩展了语言覆盖,还揭示了检索范式对泛化能力的决定性影响。所有模型、数据和代码均已开源,期待社区在此基础上进一步探索。