科大讯飞发布语音基座模型 Spark-Audio-1.0-Preview
Spark-Audio-1.0-Preview 是什么
科大讯飞最近发布了 Spark-Audio-1.0-Preview,这是一个专注于语音理解的基座大模型。与传统方案不同,它不依赖“先转文字再理解”的级联流程,而是直接从原始音频中提取语义、情绪和场景信息。模型架构由一个 0.65B 参数的音频编码器和一个 30B-A3B 的 MoE(混合专家)语言模型组成,整体在纯国产算力集群上完成训练,使用的数据包括 1300 万小时的音频和大量文本。
这种设计让模型不仅能听清人声,还能同时处理背景音、音乐等非语音信号,并理解它们所处的上下文。例如,在嘈杂的街道上,它既能识别用户说的“导航到最近的加油站”,也能判断周围有汽车鸣笛或施工噪音,从而更准确地理解意图。目前,该模型支持 99 种语言和 202 种中国方言,包括粤语、温州话等较难识别的变体。
核心功能:从“听清”到“听懂”
Spark-Audio-1.0-Preview 的能力覆盖了语音处理的多个关键环节:
- 语音转写:将语音实时转换为文字,准确率在高噪声、低音量等挑战性条件下仍保持领先。
- 多语言翻译:支持语音到文本或语音到语音的跨语言翻译,并保留原始语气、语调等韵律特征,避免机械感。
- 方言识别:覆盖全国主要方言区,对地方口音的适应性强,尤其在南方复杂方言如闽南语、客家话等场景下表现稳定。
- 环境音理解:不仅能识别人声,还能分析背景中的声音类型(如雨声、键盘敲击、警报声),辅助判断场景。
- 说话人区分:自动识别不同发言者,适用于多人会议、访谈等需要角色分离的场合。
- 情感分析:通过语速、音高、停顿等声学特征判断用户情绪状态,比如是否焦虑、愤怒或满意。
- 音频问答:用户可以直接对一段音频提问,例如“刚才谁提到了预算?”或“这段对话发生在什么场所?”,模型能基于音频内容作答。
这些功能不是孤立模块的堆砌,而是统一在一个端到端框架内协同工作,避免了传统流水线中因多次转换导致的信息损失。
技术亮点:端到端架构与国产算力
传统语音系统通常分为两个阶段:先用 ASR(自动语音识别)模型将语音转为文本,再将文本输入大语言模型进行理解。这种方式存在明显缺陷——语气、重音、停顿等非文字信息在第一步就被丢弃,而背景音、多人重叠说话等问题也会在 ASR 阶段引入错误,后续难以纠正。
Spark-Audio-1.0-Preview 改变了这一范式。它的音频编码器直接将原始波形映射为语义向量,与文本 token 一起输入同一个 MoE 语言模型。这意味着模型在“思考”时同时看到声音和文字两种模态,能够更完整地还原说话人的意图。例如,当用户用讽刺语气说“这服务真好啊”,传统系统可能只记录文字并给出正面反馈,而 Spark-Audio 能结合语调判断出实际是负面评价。
另一个重要突破是训练完全依赖国产算力。科大讯飞表示,这是业界首个基于纯国产芯片和服务器集群训练的语音基座模型。尽管硬件生态仍在发展中,但最终效果证明,国产算力已能支撑起达到国际先进水平的大模型训练任务。这也为未来在安全敏感领域(如政务、金融、国防)部署自主可控的语音 AI 提供了技术基础。
此外,模型采用了可微调的基座设计。类似于讯飞星火大模型的“1+N”体系,Spark-Audio 作为通用语音理解底座,可以针对具体场景(如医疗问诊、法庭庭审、航空调度)进行领域适配,快速生成专用子模型,降低落地门槛。
实际表现:小模型对标更大闭源系统
尽管总参数规模为 30B(MoE 激活约 3B),Spark-Audio-1.0-Preview 在多项评测中表现不输更大模型。在 Fleurs 中文测试集上,其语音识别错误率(WER)达到当前最优(SOTA)水平。官方还提到,在部分任务上,其效果接近 Qwen3.5-Omni-Plus——后者参数量高出一个数量级。

更值得注意的是,它在保持强大语音能力的同时,没有牺牲文本任务的表现。很多语音大模型在加入音频模态后,通用知识、数学推理或代码生成能力会明显下降,但 Spark-Audio 在这些方面未出现“降智”现象。这说明其多模态融合策略较为成熟,音频和文本路径之间实现了有效协同而非互相干扰。
在复杂真实场景中,优势更为明显。例如在车载环境中,发动机轰鸣、空调风噪、乘客交谈等多重干扰下,模型仍能准确捕捉驾驶员指令;在客服电话中,即使用户声音微弱或带有浓重口音,系统也能正确转写并识别情绪状态。这些能力对实际业务至关重要,远比实验室干净数据下的指标更有说服力。
应用场景:不止于转写
虽然语音转写是最直观的功能,但 Spark-Audio 的潜力远不止于此。以下是几个典型落地方向:
智能客服:传统客服系统只能处理文字或简单语音指令,而新模型能感知用户是否不耐烦、困惑或着急,从而动态调整回应策略。比如检测到用户语速加快、音量提高,系统可主动转接人工或优先处理。
汽车座舱交互:在高速行驶时,驾驶员无法操作屏幕,语音成为主要交互方式。模型支持方言识别(如四川话、东北话)和抗噪能力,让不同地区用户都能自然对话。同时,它能区分主驾、副驾甚至后排乘客的指令,避免误触发。
跨语言会议与同传:在国际会议中,系统不仅能实时翻译发言内容,还能保留演讲者的强调语气和情感色彩,使译文更贴近原意。相比纯文本翻译,这种“带感情的语音翻译”更能传递沟通的真实意图。
会议纪要自动化:自动区分多位发言人,标记关键决策点(如“我们决定下周上线”),并生成结构化摘要。这对律师、记者、企业管理者等高频会议人群能大幅减少后期整理时间。
医疗语音录入:医生在查房时口述病历,系统实时转写并识别专业术语(如“窦性心动过缓”),同时过滤掉监护仪报警声、护士呼叫等干扰音。这比手动打字效率高得多,也减少了录入错误。
如何体验
目前,科大讯飞已开放 Spark-Audio-1.0-Preview 的在线体验页面(https://iflytekresearch.iflytek.com/experience/spark-audio)。用户可以直接上传音频文件或通过麦克风输入语音,测试转写、翻译、方言识别、情感分析等功能。界面简洁,响应较快,适合开发者、产品经理或企业用户初步评估其能力边界。
需要注意的是,当前版本为 Preview(预览版),部分高级功能(如长音频处理、定制化微调)可能尚未完全开放。但即便如此,其基础能力已足够支撑许多实际业务需求。
小结
Spark-Audio-1.0-Preview 的发布标志着语音 AI 正从“工具型”向“理解型”演进。它不再只是把声音变成文字,而是试图像人类一样“听懂”声音背后的全部信息——谁在说、说什么、怎么说、在什么环境下说、带着什么情绪说。这种端到端的理解能力,加上国产算力的支撑,为语音技术在关键行业的深度应用打开了新的可能性。