阶跃星辰发布 Step Audio 3:五模型覆盖语音全场景

0 阅读

Step Audio 3 是什么

Step Audio 3 是阶跃星辰推出的语音大模型系列,由 Realtime、ASR、TTS、Gen 和 Music 五款模型组成。这套系统不只是“能听会说”,更强调对语境、情绪和任务逻辑的理解。根据官方数据,Realtime 模型的语音推理准确率达到 99.7%,ASR(自动语音识别)的词错误率仅为 1.7%,两项指标均在第三方评测平台 Artificial Analysis 的全球榜单上排名第一。

这五个模型分工明确:Realtime 负责实时对话交互,ASR 处理语音转文字,TTS 实现高质量语音合成,Gen 能一次性生成包含人声、音效、环境音和背景音乐的完整音频,而 Music 则专注于音乐创作,支持从清唱配乐到 ABC 记谱法驱动的结构化生成。

核心功能详解

Realtime:真正意义上的实时对话

Realtime 不是简单的“你说我答”,而是原生支持全双工交互——听、想、说可以同时进行。这意味着它能在用户说话中途就开始处理信息,判断是否需要打断、何时回应、如何调整节奏。更重要的是,它支持异步执行工具调用(Tool Call),比如用户说“帮我订明天去上海的机票”,模型一边继续对话安抚用户,一边在后台调用订票接口,不会卡住当前交互流。

Loomy

这种能力让语音助手从“聊天机器人”变成“能干活的协作者”,尤其适合客服、车载或智能家居等需要连续任务处理的场景。

ASR:从转写到理解

传统语音识别只负责把声音变成文字,但 Step Audio 3 的 ASR 把大语言模型的能力融入进来。它不仅能识别普通话、英语、方言和中英混杂内容,还能利用上下文知识纠正同音词错误。比如“张三去了南京西路”和“张三去了男西路”,前者会被正确还原,因为模型知道“南京西路”是真实地名。

此外,它对专业术语(如医学、法律、金融词汇)和复杂长句的处理也更可靠,适合会议记录、法庭笔录或学术访谈等高要求场景。

TTS:还原“人味”的细节

TTS 生成的语音接近真人水平,关键在于它建模了大量副语言特征:语气起伏、情绪变化、气口停顿、甚至笑声和迟疑。比如一句“这个嘛……我觉得可能不太行”,模型会自然加入犹豫的停顿和降调,而不是机械地平读。

同时,它采用流式生成架构,边生成边播放,延迟极低,满足实时对话需求。用户还可以通过参数控制语速、音色、情绪强度等,灵活适配不同角色或场景。

Gen:一次生成完整声音场景

过去做一段广播剧,需要分别录制人声、添加音效、叠加环境音、再配上背景音乐,后期混音耗时耗力。Gen 模型改变了这一流程:只需一段自然语言描述(如“雨夜,咖啡馆内,年轻女子低声讲述往事,背景有轻柔爵士乐和杯碟碰撞声”),它就能一次性输出包含所有声音元素的完整音频,并精确控制各元素出现的时间点和音量层次。

这种能力对短视频创作者、游戏开发者或有声内容制作人来说,大幅降低了音频制作门槛。

Music:不止是生成旋律

Music 模块支持多种输入方式:你可以哼一段旋律,它自动配器编曲;提供歌词,它生成完整歌曲;甚至用 ABC 记谱法指定主歌、副歌结构和和弦走向,实现结构化创作。它对歌曲段落、能量变化和跨段落旋律发展都有建模,输出的不是零散片段,而是结构完整的成品。

虽然官方未明确标注生成时长和音质参数,但从演示效果看,已能满足 Demo 制作甚至部分商用需求。

技术实现思路

Realtime 的核心是原生全双工架构,打破传统“听-停-说”的串行模式,让音频理解、推理和生成并行推进。ASR 则通过大语言模型增强上下文纠错能力,将识别从“声学匹配”升级为“语义理解”。

TTS 采用流式生成,兼顾低延迟与高表现力;Gen 使用统一模型替代多个专用工具,通过时间轴编排能力整合多层声音;Music 则结合符号化记谱(ABC)与神经生成,平衡创意自由与结构控制。

这些设计共同指向一个目标:让机器生成的声音不仅准确,而且“合理”“自然”“可用”。

如何体验和接入

想试用 Step Audio 3,可以先访问官网页面了解各模型能力,然后进入“阶跃语音体验中心”在线测试效果。如果打算集成到自己的产品中,需注册阶跃星辰开放平台账号,获取 API Key,并查阅对应模型的接入文档。

API 调用方式相对标准:传入文本、音频文件或自然语言描述,即可获得合成语音、识别结果或生成音频。开发者还能通过参数调整音色、情绪、语速、声音编排等细节,逐步优化输出效果。

目前所有模型仅通过云端 API 提供,不开放本地部署或模型权重,与 MiniMax Music 3.0 等开源方案形成差异。

实际应用场景

在智能客服领域,Realtime 的全双工能力和异步任务执行可以让对话更流畅,减少“请稍等”的机械感。会议系统可借助 ASR 高精度转写多人讨论,自动生成带发言人标记的纪要。车载场景下,模型对方言、口音和噪声的鲁棒性提升了语音控制的可靠性。

影视和有声内容制作是 Gen 模型的主战场。动画、广播剧、有声书制作方无需再协调配音演员、音效师和作曲家,一个提示词就能产出带完整声景的初稿。音乐人则可用 Music 快速将灵感转化为可听的 Demo,加速创作迭代。

与竞品的差异

对比 MiniMax Music 3.0,Step Audio 3 Music 更强调多模态输入(清唱、旋律、ABC 记谱)和交互式创作,而 MiniMax 侧重单次生成完整歌曲和本地部署能力。前者是闭环云端服务,后者开放模型权重,适合不同需求的用户。

整体来看,Step Audio 3 的优势不在单一功能突破,而在于五模型协同形成的“语音全栈”能力——从听到说,从识别到创作,覆盖了语音技术的完整链条。加上 Artificial Analysis 榜单的实测成绩背书,其工程落地能力值得期待。

当然,实际效果仍需开发者在具体场景中验证。但至少从设计思路上,阶跃星辰试图解决的不是“能不能发声”,而是“发出来的声是否真的有用、自然、可融入真实工作流”。