一个面向真实噪声环境的语音数据集:覆盖58种印度语言的100多种带时间戳噪声类型
“只要加点噪声”为什么不够用
现在的语音AI在安静房间里表现很好,但一到真实环境就容易出错。常见的做法是把干净语音和单独录制的噪声片段混合起来,制造“带噪语音”。听起来确实吵了,但这种合成方式有个致命缺陷:它没告诉模型噪声到底什么时候出现、持续多久、和说话内容怎么重叠。
合成噪声通常人为设定信噪比,开头结尾生硬,和语音的交互也是预设的,不像真实世界那样自然。比如印度已有的Kathbath-Noisy数据集虽然提供了带噪语音用于评估ASR鲁棒性,但没有标注噪声类型或发生时间,模型无法从中学习噪声的时序特性。
这个数据集的不同之处
新发布的Vaani噪声事件时间戳数据集核心在于结构化、时间精确定位的噪声标注。所有语音和背景噪声都是同步实地录制的——用普通手机在真实环境中一次录完,没有后期叠加任何合成噪声。
标注员对每个背景噪声事件都标出了毫秒级精度的起止时间。因为是真实录音,噪声会自然地和语音重叠,甚至多个噪声彼此重叠。比如一句话说到一半,狗叫了一声,同时远处有车经过,桌上手机又响了——这些复杂情况都被完整保留下来。
所有背景声音被归为七大类:动物叫声、交通声、婴幼儿声音、音乐、电话/闹钟提示音、家电运行声,以及咳嗽、笑声、咂嘴等非语音人声。
数据集概览
- 总音频时长:122+ 小时
- 语音片段数:72,756 段
- 说话人数量:38,541 人
- 覆盖语言:58 种印度语言
- 地理范围:30 个邦,162 个县
- 噪声类别:7 类
- 录制条件:实地使用普通手机
- 已验证子集(
verified_timestamps):约 22 小时(经多名标注员一致确认) - 未验证子集(
unverified_timestamps):约 100 小时

语言覆盖有意保持广泛,从印地语、泰卢固语等大语种,到查克玛语(Chakma)、加罗语(Garo)、米佐语(Mizo)等真正低资源语言都有包含。虽然印地语占了近84小时,但团队特意保留了大量小语种数据,避免噪声鲁棒性研究只偏向主流语言。

七类日常噪声的分布特点
非语音人声(如咳嗽、笑、咂嘴)是最常见的噪声类型,出现在约38%的语音片段中,但每次持续很短,平均不到半秒。
相比之下,动物叫声和交通噪声出现频率低得多,但单次持续时间长,两者合计占了整个数据集中最多的噪声总时长。
这种“高频短暂”与“低频持久”的组合,正是真实音频的典型特征。只有给每个事件打上精确的时间戳,这种结构才能被模型捕捉到,进而学会在不同噪声模式下调整识别策略。
如何保证数据可信
数据集明确分为两个层级:
verified_timestamps:约22小时,经多名标注员交叉验证unverified_timestamps:约100小时,供研究者按需选择信任度
所有时间戳都经过多阶段人工质控流程:自由职业者初标 → 合理性检查 → 内部复核 → 发布前随机抽取10%进行独立审计。
标准定得相当严格:只要一个批次中有一个时间戳未通过审计,整批数据都要重做。这对如此规模的数据集来说是少见的高要求。
现有数据集为何填不上这个空缺
团队对比了九个主流数据集,包括WHAM!、AudioSet、MUSAN、CHiME-6和FSD50K,发现没有一个同时满足三个条件:真实共现的背景噪声、毫秒级时间戳、自然的印度多语言语音。
现有选项基本分两类:一类以英语为中心、场景偏西方(如CHiME-6、AVA-Speech);另一类虽聚焦印度,但完全缺乏噪声标注。
印度已有两个噪声相关数据集——iNoise和Kathbath-Noisy,但它们都没能像Vaani这样,将噪声与自然同步发生的语音配对。这意味着Vaani成了首个能真实反映印度语音AI部署环境的可复用基准。
无论是银行IVR、农业咨询机器人,还是家用语音助手,只要目标是在印度家庭、街道或农田中工作,都可以用这个数据集做针对性压力测试,而不是依赖不匹配的西方城市噪声模型。
它能带来什么
首先是真正的噪声鲁棒语音识别——在拥挤街头或嘈杂厨房里依然能准确听清你说什么,而不只是在安静实验室里表现好。
其次,因为噪声被精确标注且真实存在,AI系统可以更准确地学习声音事件检测和语音增强技术,比如识别出狗叫的时段并针对性降噪,效果远超合成混合数据训练出的模型。
更重要的是低资源语言的红利。噪声标注层直接构建在Project Vaani已有的多语言语音之上,让查克玛语、加罗语、米佐语等几乎没有任何带噪语音资源的语言,首次拥有了可用于噪声鲁棒性研究的数据。这不仅是印度的突破,在全球低资源ASR领域也属首创。
最终目标很朴素:让语音AI真正在印度日常环境中可用——用普通手机、说地方语言、身处嘈杂无剧本的真实生活里。而实现这一点,始于一个微小却关键的细节:精确知道狗是什么时候叫的。