阶跃发布StepAudio 3系列,五款模型登全球榜首
9月15日,阶跃推出新一代语音大模型StepAudio 3系列,首批包括StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music,分别面向实时语音交互、语音识别、真人级语音生成、综合音频生成及音乐创作等场景。其中,多款模型在第三方评测机构Artificial Analysis的相关榜单中取得全球第一。
与过去侧重单项识别或生成能力的语音模型不同,StepAudio 3覆盖语音理解、语音生成、实时推理、任务执行和音频创作等环节,试图让AI同时具备听、说、理解声音语义与情绪,以及参与完整交互和内容生产的能力。
StepAudio 3 Realtime支持原生全双工对话,能够在持续交流中判断回应或等待的时机,并处理打断和连续反馈。在Artificial Analysis Conversational Dynamics榜单中,该模型综合得分为98.9%,排名全球第一。
除低延迟和自然对话外,StepAudio 3 Realtime还支持语音推理与任务执行,可同时分析语义、语气、情绪和环境声音,并并行完成推理与语音生成。Tool Call及长任务能够异步运行,执行期间不会中断当前对话;该模型在Artificial Analysis Speech Reasoning榜单中同样排名全球第一。
StepAudio 3 ASR将高精度转写与大语言模型的上下文理解和知识能力结合,针对专业术语、人名、地名、方言及复杂语境进行优化。它支持中文、英文、中英混说、方言、长音频和专业领域场景,也适配低声、快速语音、含糊连读及背景音乐等输入。在Artificial Analysis非流式语音识别准确性榜单中,其WER为1.7%,并列全球第一,WER数值越低代表转写错误越少。
StepAudio 3 TTS面向真人级语音合成,除音色、语调、节奏、停顿和情绪外,还能表现笑声、迟疑、重复和改口等副语言特征,并采用流式架构实现边生成边播放。StepAudio 3 Gen可将人声、音效、环境声和背景音乐统一生成,用户通过自然语言描述角色、场景和剧情,即可控制音色、情绪及声音出现的时间顺序,适用于影视、动画、游戏、广播剧、有声书和短视频。
StepAudio 3 Music支持歌曲创作、清唱配乐、歌曲翻唱及基于ABC记谱法的多轮创作。用户可以用歌词、清唱或参考歌曲参与编曲和迭代。随着该系列发布,阶跃的音频模型产品已覆盖听、说、理解、推理和创作,五款模型目前均已上线阶跃星辰开放平台。
相关页面还列出了音乐大模型部署、Step Plan订阅方案及StepClaw等内容,并配有对应图片。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文