语音大模型竞争正发生转变,阶跃星辰今日推出 StepAudio 3 系列,包含五个模型。其中 StepAudio 3 Realtime 等表现出色,各有优势,且均已上线开放平台。
语音大模型竞争已从单纯的“把文字念出来”转变为“真正理解声音、组织声音”。阶跃星辰的 StepAudio 3 系列正是顺应此方向推出,一次发布五个模型。
StepAudio 3 Realtime 在相关榜单上成绩亮眼,以 98.9% 的综合得分在 Conversational Dynamics 榜单排全球第一,语音推理准确率 99.7% 在 Speech Reasoning 榜单登顶。它更强调在对话中判断节奏。
ASR 从“听清”迈向“听懂”,在高精度识别基础上接入 LLM 上下文理解,能处理多种语言情况,在非流式准确性榜单上 WER 为 1.7%,并列全球第一。
TTS 致力于“像真人表达”,除生成语音外,还能还原副语言表现,如示例中“要不要换工作”的独白,纠结情绪尽显。
Gen 整合声音链路,靠自然语言描述和参考音频一次生成多种声音元素。Music 支持多轮交互创作,能基于用户素材完成编曲等工作。目前五款模型均已上线开放平台。
编辑观点:阶跃星辰此次发布的 StepAudio 3 系列展现了强大实力,有望在语音大模型竞争中占据优势,推动行业向更智能、更真实的方向发展。