语音大模型竞争升级!阶跃星辰 StepAudio 3 系列发布,五模型各有亮点拿下多个全球第一
2026/9/16 0:10:24 网站建设 项目流程

语音大模型竞争正发生转变,阶跃星辰今日推出 StepAudio 3 系列,包含五个模型。其中 StepAudio 3 Realtime 等表现出色,各有优势,且均已上线开放平台。

竞争方向转变

语音大模型竞争已从单纯的“把文字念出来”转变为“真正理解声音、组织声音”。阶跃星辰的 StepAudio 3 系列正是顺应此方向推出,一次发布五个模型。

Realtime 表现卓越

StepAudio 3 Realtime 在相关榜单上成绩亮眼,以 98.9% 的综合得分在 Conversational Dynamics 榜单排全球第一,语音推理准确率 99.7% 在 Speech Reasoning 榜单登顶。它更强调在对话中判断节奏。

ASR 实现“听懂”

ASR 从“听清”迈向“听懂”,在高精度识别基础上接入 LLM 上下文理解,能处理多种语言情况,在非流式准确性榜单上 WER 为 1.7%,并列全球第一。

TTS 追求“真人表达”

TTS 致力于“像真人表达”,除生成语音外,还能还原副语言表现,如示例中“要不要换工作”的独白,纠结情绪尽显。

Gen 和 Music 各有特色

Gen 整合声音链路,靠自然语言描述和参考音频一次生成多种声音元素。Music 支持多轮交互创作,能基于用户素材完成编曲等工作。目前五款模型均已上线开放平台。

编辑观点:阶跃星辰此次发布的 StepAudio 3 系列展现了强大实力,有望在语音大模型竞争中占据优势,推动行业向更智能、更真实的方向发展。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询