← 返回新闻列表
InfoQ AI 🗓️ 2026-09-17

阶跃发布全新语音大模型 StepAudio 3系列:覆盖语音识别、生成、实时交互与音乐创作,这一消息引发行业关注

⚡ 一句话看懂:阶跃发布全新语音大模型 StepAudio 3系列:覆盖语音识别、生成、实时交互与音乐创作,这一消息引发行业关注。来源:InfoQ AI。

9 月 15 日,阶跃发布新一代语音大模型 StepAudio 3 系列,一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。

其中,多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。

相比过去主要围绕语音识别或语音生成等单项能力展开竞争,StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力,让 AI 不仅能够“听”和“说”,也能够理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。

其中,面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话,可以在持续交流过程中判断何时回应、何时等待,并处理临时打断和连续反馈。

在 Artificial Analysis Conversational Dynamics 榜单中,该模型以 98.9%的综合得分排名全球第一。

与传统实时语音模型主要追求低延迟和自然对话不同,StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。

模型能够同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行;Tool Call 和长任务则可以异步执行,在任务运行期间不打断当前对话。

其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。

在语音识别方面,StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合,不仅要解决“听清楚”,也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。

该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。

在 Artificial Analysis 非流式语音识别准确性榜单中,StepAudio 3 ASR 的 WER(词错误率)为 1.7%,并列全球第一。

除实时交互和语音识别外,此次发布也进一步拓展了语音生成模型的能力边界。

StepAudio 3 TTS 面向真人级语音生成,在音色、语调、节奏、停顿和情绪表达之外,还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。

该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用需求。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接