阶跃星辰发布StepAudio3系列:五款音频模型覆盖生成、识别与实时交互
五款模型同步上线,覆盖音频全链路能力
阶跃星辰近日发布了StepAudio3系列模型,一次性推出五款针对不同音频任务的专用模型:StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music。这些模型已全部开放接入,且在第三方评测平台 Artificial Analysis 的多个子项中拿到全球第一的成绩。

过去几年,语音模型大多聚焦在“说”或“听”单点能力上——比如把文字转成语音,或者把语音转成文字。但StepAudio3系列试图打破这种割裂。它不再只做转换器,而是往“完整音频内容生产”和“实时智能交互”两个方向延伸。这意味着,从理解复杂语境下的语音,到生成带情绪、停顿甚至结巴的真人级语音,再到创作整段包含人声、音效和背景音乐的音频内容,现在都能在一个技术体系下完成。
StepAudio3Realtime:真正意义上的实时对话
最引人注目的是 StepAudio3Realtime。它支持原生全双工对话——也就是说,模型可以一边听用户说话,一边思考并开始回应,不需要等对方说完才启动。这种机制更接近人类对话的自然节奏。
更进一步,它不仅能理解字面语义,还能捕捉语气、情绪、副语言(比如叹气、笑声)甚至环境声音。在 Artificial Analysis 的 Conversational Dynamics 榜单中,它的综合得分达到98.9%,语音推理准确率高达99.7%,两项均排全球第一。
技术上,它实现了推理与语音生成并行,并支持 Tool Call(调用外部工具)和长任务的异步执行。举个例子,用户说“帮我订明天早上8点飞上海的机票,顺便查一下天气”,模型可以在生成语音回复的同时,后台调用航班和天气API,把结果整合进后续对话流里,而不会卡住或中断交互。
ASR与TTS:专业场景下的高精度与高拟真
StepAudio3ASR 主打复杂语音识别。它不仅支持普通话、英语、方言和中英混说,还能处理医疗、法律、金融等专业领域的术语。在长音频场景下(比如会议录音或讲座),它的词错误率(WER)仅为1.7%,与另一家厂商并列全球第一。

值得注意的是,它融合了大模型的上下文理解能力。这意味着即使某个词发音模糊,只要上下文足够清晰,模型仍能正确还原。比如在医生口述病历时,“心肌梗死”可能说得很快,但结合前后文中的“胸痛”“ECG异常”等关键词,系统能准确识别而非误判为“心肌梗塞”之类近音词。
另一边,StepAudio3TTS 则在“像人”上下了功夫。除了常规的音色、语调、节奏控制,它还加入了笑声、迟疑、结巴、吞音等副语言特征。这些细节往往被传统TTS忽略,但恰恰是让语音显得自然的关键。此外,它支持流式生成,适合用在需要低延迟响应的实时对话系统中。
音频生成与音乐创作:从单一声源到完整作品
StepAudio3Gen 的定位是“统一音频生成器”。它可以同时生成角色人声、环境音(如雨声、街道嘈杂)、音效(如门铃、键盘敲击)和背景音乐,并支持多角色声音的时序编排。比如生成一段“咖啡馆里的对话”,左边是顾客点单的声音,右边是咖啡机运作的噪音,背景还有轻柔的爵士乐——这些元素可以按时间轴精确控制。
而 StepAudio3Music 则专注于音乐创作。它支持多种任务:从零开始写歌、给清唱配伴奏、翻唱已有歌曲,甚至基于 ABC 记谱法进行多轮迭代创作。用户可以用自然语言描述需求,比如“写一首忧伤的民谣,用木吉他为主,节奏舒缓,副歌部分加入小提琴”,模型就能生成符合要求的完整曲目。
这种能力背后是对旋律、和弦、节奏、乐器编排和情绪表达的联合建模。不同于简单拼接预制片段,StepAudio3Music 能保持音乐结构的连贯性,避免副歌突然变调或节奏断裂的问题。
从工具到体验:音频模型的新阶段
整体来看,StepAudio3系列标志着语音/AI音频模型进入新阶段。过去,这类模型多作为后台工具存在——比如客服电话里的语音识别,或导航软件的播报声。但现在,它们开始直接参与用户体验的核心环节。
实时对话模型让智能体能“边听边想边说”,不再有机械的停顿;高拟真TTS让虚拟角色的声音有了性格;统一音频生成则打开了游戏、影视、播客等内容创作的新可能。而音乐模型更是把创作门槛进一步降低,普通人也能快速产出带情绪、有结构的原创音乐。
当然,技术指标亮眼只是第一步。真正的考验在于实际场景中的稳定性、延迟控制和资源消耗。比如全双工对话在嘈杂环境中是否依然可靠?长音频识别在多人交叉发言时会不会混乱?这些细节才是决定产品能否落地的关键。
目前,所有五款模型已在阶跃星辰开放平台上线,开发者可直接调用API或下载SDK集成。对于想尝试下一代语音交互或音频内容生成的团队来说,这或许是个不错的起点。