Luth-2:借助MOPD技术突破法语小语言模型能力边界

1 阅读

引言

在自然语言处理领域,小语言模型(SLM)因其高效性和可部署性而备受关注,但多数研究集中在英语上,导致其他语言(包括法语)的能力开发严重不足。Luth-2系列模型(0.8B和2B)的发布,正是为了填补这一空白。通过创新的多领域在线策略蒸馏(MOPD)技术,Luth-2在法语数学、代码、指令遵循、通用知识和工具调用等任务上取得了同尺寸模型的最佳成绩,甚至在某些基准上超越了参数规模两到三倍的模型。这一成果不仅展示了SLM在非英语语言上的巨大潜力,也为多语言模型的后训练提供了新思路。

评估方法

为了全面衡量模型性能,我们扩展了评估体系,使用lm-evaluation-harness的分支版本,并针对法语特点进行了优化。所有法语基准要么采用官方法语子集,要么使用经过人工验证的翻译版本。关键改进包括:

  • 数学:采用MGSM-Rev2(修正版),并遵循其规定的解析和输出规范化方法。例如,法语使用逗号作为小数点,因此27,00会被规范化为27,避免误解析为2700
  • 知识与科学:使用Global-MMLU-Lite和MMLU-ProX-Lite的法语子集,以及翻译后的GPQA-Diamond。评分采用生成模式,从\boxed{}中解析答案。
  • 代码:使用法语翻译的HumanEval+和MBPP+,翻译由Opus 4.8完成并人工验证,评分时解析模型输出的Python代码块。
  • 指令遵循:采用M-IFEval的法语版本(包含法语特定约束)和Multi-IF的法语子集(用于多轮指令遵循)。
  • 工具调用:将BFCL v1和v2子集翻译为法语,并人工抽查验证。

所有评估均在temperature=0.6, top_p=0.95, top_k=20、禁用思考模式下进行,结果取10次运行的平均值。IFEval报告提示级严格准确率,Multi-IF报告最终轮复合分数。

法语基准结果

Luth-2-0.8B在12项基准上均排名同尺寸第一,显著超越前代Luth-0.6B-Instruct。仅被参数多33%的Gemma-3-1B-IT(MBPP+)和参数多56%的LFM2.5-1.2B-Instruct(5项基准)超越。Luth-2-2B同样表现优异,在11项基准上超越Luth-1.7B-Instruct,并在10项上排名第一,仅被更大的LFM2-2.6B(Global-MMLU-Lite)和Luth-1.7B-Instruct(BFCL v2)超越。

监督微调

我们构建了包含约30亿token的SFT数据集(Luth-2-Post-Training-SFT),涵盖知识、代码、数学、指令遵循和工具调用五大领域。数据生成流程包括:将英文数据集(如Nemotron-Post-Training-Dataset-v2、Dolci-Instruct-SFT等)的提示翻译为法语,并使用强教师模型(如Qwen3.6-35B-A3B、Gemma-4-31B-it等)重新生成答案。每个领域独立调优后合并,并进行全局去重。

luth2_leaderboard_scatter_wide

去污处理采用Tülu 3方法:若训练样本与任何基准项的8-gram重叠超过50%,则丢弃该样本。

luth2_results_table_2b

使用TRL库在Qwen3.5-0.8B和Qwen3.5-2B上进行全参数微调,训练1个epoch,采用FlashAttention-3、序列打包、最大序列长度16384、学习率3e-5(余弦调度)、全局批大小约50万token。SFT后,两个模型在各项基准上均大幅提升,例如MGSM-rev2从35.20提升至66.12(0.8B),从64.60提升至84.12(2B)。

luth2_results_table_08b

多领域在线策略蒸馏

MOPD的核心思想是:为每个领域训练一个RL专家,然后将所有专家知识蒸馏回单一学生模型。这种方法避免了混合领域RL训练中的能力权衡问题。

RL专家训练

每个专家使用相同的GRPO算法,并采用DAPO的零方差组过滤,训练500步,每步32个提示×8个rollout,学习率1e-6,温度1.0,最大离策略步数2。

  • 数学专家:对于2B模型,使用DAPO-Math-17k的翻译提示,奖励基于\boxed{}答案与标准答案的匹配。对于0.8B模型,使用Big-Math-RL-Verified-Processed,因为DAPO-Math对非推理模型难度过高。
  • 代码专家:使用OpenCodeInstruct的翻译提示,奖励基于单元测试是否全部通过。
  • 指令遵循专家:从SFT数据中选取聊天提示,并附加法语IFEval约束。为增强泛化,我们扩展了约束类型(12种域外约束+30种IFEval-fr约束)、扩大值范围,并堆叠1-5个约束。同时包含多轮提示(2-3轮,每轮新增约束且需满足先前约束)。

为防止奖励黑客(模型生成短句满足约束但忽略问题),我们采用IFBench的混合奖励:

R = V + 1.0    if V > 0 and S > α
    V0.5    if V > 0 and S ≤ α
    V          if V ≤ 0

其中V为约束满足率,S为Qwen3.5-9B法官给出的法语质量评分(1-10分),α=7。法官仅看到任务,不看到附加约束。

所有RL提示也经过8-gram去污处理。

蒸馏阶段

以SFT模型为学生,三个RL专家为教师,使用与训练专家相同的RL提示,每个领域分配1/3的提示,进行100步MOPD。学生采样rollout,教师评分,损失为逐token反向KL。由于密集信号比稀疏奖励更高效,100步即可达到专家500步的效果。采样配置为128提示×4 rollout,最大离策略步数2,学习率提升至2e-6,并设置20步预热。

蒸馏后的模型保留了专家的大部分增益,同时保持了SFT阶段的知识、科学和工具调用能力,甚至略有提升。例如,2B模型在MGSM-rev2上从84.12提升至86.52,在IFEval上从64.64提升至75.06。

结论与展望

Luth-2系列通过MOPD技术,成功将法语SLM的性能推至新高度,证明了多语言SLM在非英语语言上仍有巨大提升空间。我们开源了模型、数据集和代码,希望促进法语AI社区的发展,并为其他语言模型的后训练提供参考。未来,我们计划探索更多领域(如多语言、多模态)的MOPD应用,并进一步优化蒸馏效率。

致谢

感谢LightOn提供的计算资源支持。

引用

@misc{luth2,
  title  = {Luth-2: Pushing the French Capabilities of SLMs with MOPD},
  author = {Maxence Lasbordes and Guillaume Pradel},
  year   = {2026},
  url    = {https://huggingface.co/blog/MaxLSB/luth-2}
}

参考文献

  • Peter et al. (2025). Mind the Gap… or Not? How Translation Errors and Evaluation Details Skew Multilingual Results. arXiv:2511.05162
  • Shi et al. (2022). Language Models are Multilingual Chain-of-Thought Reasoners. arXiv:2210.03057
  • Singh et al. (2024). Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation. arXiv:2412.03304
  • Xuan et al. (2025). MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation. arXiv:2503.10497
  • Rein et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. arXiv:2311.12022
  • Liu et al. (2023). Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation. arXiv:2305.01210
  • Dussolle et al. (2025). M-IFEval: Multilingual Instruction-Following Evaluation. arXiv:2502.04688
  • He et al. (2024). Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following. arXiv:2410.15553
  • Patil et al. (2025). The Berkeley Function Calling Leaderboard (BFCL): From Tool Use to Agentic Evaluation of Large Language Models. ICML 2025
  • Lambert et al. (2025). Tülu 3: Pushing Frontiers in Open Language Model Post-Training. arXiv:2411.15124
  • NVIDIA (2026). Nemotron-Cascade 2. arXiv:2603.19220
  • Shao et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300
  • Yu et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. arXiv:2503.14476
  • Albalak et al. (2025). Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models. arXiv:2502.17387
  • Ahmad et al. (2025). OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs. arXiv:2504.04030
  • Pyatkin et al. (2025). IFBench: Generalizing Verifiable Instruction Following. arXiv:2507.02833

luth2_recipe_fan_dark