阿拉伯语TTS竞技场排名争议:方言偏见还是数据操纵?

0 阅读

从怀疑到真相:阿拉伯语TTS竞技场排名背后的故事

最近,我们的社区成员对阿拉伯语TTS竞技场的排名提出了质疑。他们发现,自己平时喜欢使用的模型得分不高,而一些表现平平的模型却占据了榜首。这种反差让我们意识到,可能存在问题,于是我们立即展开了调查。

起初,我们怀疑是有人恶意刷票,因为某些日子的投票数量异常。例如,7月23日,投票数达到了422次,是平时的十倍,其中四分之一涉及一个新加入的模型Audar-TTS-V1-Pro。该模型在短短四小时内赢得了91场对决,仅输1场,而其他时间它的胜率约为50%。这种异常让我们几乎认定是操纵行为,并准备删除这些可疑投票。

但在执行删除之前,我们决定先亲自听一听这些对决的音频。结果出乎意料:Audar确实在那些对决中表现更佳,而且我们发现,这些投票的提示词大多使用沙特或海湾方言。原来,是一位用户花了一下午时间用自己熟悉的方言进行测试,并诚实地根据听觉感受投票。这让我们意识到,问题可能不是作弊,而是方言差异导致的排名偏差。

为了验证这一假设,我们使用方言分类器对历史投票中的所有提示词进行了分析。结果证实了我们的猜想:不同方言下,模型的表现差异巨大。例如,Audar在海湾方言中的胜率高达93%,而在现代标准阿拉伯语中仅为48%。而当时排名第一的AIC TTS在现代标准阿拉伯语中胜率84%,但阿拉伯语竞技场的投票中,近三分之二是现代标准阿拉伯语。因此,整体排名实际上偏向于现代标准阿拉伯语,而忽略了其他方言。

进一步按方言拆分排名后,我们发现每个方言类别都有不同的领先者:现代标准阿拉伯语由AIC领先,海湾方言由Audar领先,埃及方言由Grok Voice领先,黎凡特方言由Hamsa领先,马格里布方言由VoxCPM领先。没有一个模型能通吃所有方言。这解释了为什么不同用户对排名的感受截然不同:沙特用户觉得最好的海湾语音模型排名太低,而现代标准阿拉伯语用户则觉得排名合理。

最终,我们没有删除任何投票,因为每一票都是真实用户的真实判断。问题不在于投票本身,而在于我们用单一排名来代表400万人的多样化需求。为此,我们引入了方言筛选功能,用户现在可以按方言查看排名,并且我们增加了更多方言的测试句子,以鼓励用户用自己熟悉的方言投票。

我们还注意到,Audar在海湾方言中的高胜率主要来自那一天的集中投票,其他时间的数据不足,因此其海湾方言榜首地位还需更多数据支持。我们鼓励用户继续用自己方言投票,让排名更加准确。

这次经历让我们学到了几点:第一,不要急于下结论,数据异常可能有更合理的解释;第二,不要过于相信自己的模型或排名,要保持怀疑态度;第三,社区反馈至关重要,没有用户的质疑,我们可能永远发现不了方言偏见问题。

我们承诺保持透明,所有投票数据、代码和规则都是公开的,欢迎任何人审查。如果你发现任何问题,请随时在Hugging Face社区讨论区联系我们。你的耳朵就是基准,让排行榜真正反映你的语言。