阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一

2026-09-15 · 来源 IT之家

IT之家 9 月 15 日消息,今日阶跃正式发布 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型,目前均已上线阶跃星辰开放…

IT之家 9 月 15 日消息,今日阶跃正式发布 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型,目前均已上线阶跃星辰开放平台。官方称,StepAudio 3 系列分别面向几类核心场景:真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。

IT之家附模型官方详细介绍如下: StepAudio 3 Realtime:不仅“能打断”,更能理解、思考和行动 今天,越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的,不只是“能不能同时听和说”,而是模型能否在一场持续发生的对话中,边听边理解、判断何时接话,同时完成推理和任务执行。StepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力,支持原生全双工实时对话。

在 Artificial Analysis Conversational Dynamics 榜单中,StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一,展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”,更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待,以及如何处理用户的临时打断和连续反馈。与此同时,StepAudio 3 Realtime 以 99.7% 的语音推理准确率位列 Artificial Analysis Speech Reasoning 榜单全球第一。

Speech Reasoning 聚焦模型直接理解音频并完成复杂推理任务的能力,是业内评估“原生语音模型”最权威的第三方基准之一。模型还可以同时理解语义、语气、情绪、副语言和环境声音,让实时交互不只依赖文字内容,而是利用更完整的音频信息理解用户意图。面对复杂问题,StepAudio 3 Realtime 支持推理与语音生成并行,在快速回应的同时继续组织和深化后续答案。不仅如此,Tool Call 和长任务可以异步执行,不阻塞当前语音会话。

任务运行期间,用户仍然可以继续交流,结果完成后再自然回到当前上下文。这让 Realtime 语音模型不只是“更自然地聊天”,而是能够在同一场持续对话中完成听、说、想、做。StepAudio 3 ASR:从听清,到听懂 传统语音识别主要解决“听到了什么”,但真实世界中的语音往往包含方言、口音、专业术语、同音词和复杂上下文。真正可用的 ASR 模型,不仅需要准确转写声音,也需要理解说话者表达的含义。StepAudio 3 ASR 将高精度语音识别与大语言模型的上下文理解、知识和推理能力结合,让语音识别从“辨认声音”进一步走向“理解语境”。

它支持中文、英文、方言、中英混说、长音频以及专业领域等多类场景识别,能够适应不同语言环境和表达方式。同时,依托大语言模型带来的知识理解能力,StepAudio 3 ASR 能够更准确识别人名、地名、专业术语等复杂内容,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。模型也能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入,让真实声音环境下的语音被更准确地识别和使用。这意味着,ASR 模型不再只是个声音转写工具,而是能够更准确地理解、检索和使用每一段语音内容。

在会议纪要、视频字幕和直播理解、智能客服、车载交互、医疗记录、金融服务与专业内容生产场景,都能精准地完成任务。StepAudio 3 ASR 在 Artificial Analysis 非流式语音识别准确性榜单中,WER(词错误率) 仅为 1.7%,并列全球第一。StepAudio 3 TTS:不止朗读,更像真人表达 声音不仅承载文字信息,也包含语气、节奏、停顿和情绪等丰富的表达细节。如何让 AI 生成的语音更接近真实交流,一直是语音生成模型的重要方向。

StepAudio 3 TTS 是一款面向实时交互场景的真人级语音生成模型,致力于让 AI 语音从“准确发声”走向“自然表达”。模型在音色基底、语调层次、节奏律动和气口停顿等方面高度贴合人类自然口语模式,不仅能够生成文字对应的语音,还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,让合成语音更接近真人说话。同时,StepAudio 3 TTS 能够结合语义内容理解表达意图,自主调整情绪与语气变化,使声音表达更加符合具体场景。

在实时交互方面,模型基于流式生成架构,实现生成与播放同步进行,可满足实时语音应用需求。StepAudio 3 Gen:人声、音效、环境、音乐,一次生成 传统音频内容生产往往是一条很长的链路。角色配音、环境音、音效、背景音乐需要分别制作,再经过剪辑、对齐和混音,才能形成最终作品。StepAudio 3 Gen 尝试把这些原本分散的环节统一到一个模型里。它可以基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐。

用户只需要描述角色、场景和剧情,无需针对特定角色或场景进行额外训练。就可以直接生成具有完整声音层次的音频内容。更重要的是,这些声音并不是简单叠加。StepAudio 3 Gen 支持对多个角色的音色、说话方式、语气、情绪、方言口音,以及笑声、喘息、停顿等副语言特征进行精细控制,也可以进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。这意味着,模型不仅在“生成声音”,也开始参与整段内容的声音设计和时序编排。

对于影视、动画、游戏、广播剧、有声书和短视频创作者而言,原本需要素材搜集、多工具协作和大量后期处理的声音制作流程,有机会被压缩到一次生成和持续迭代中。StepAudio 3 Music:不止生成,更参与创作 音乐生成模型已经越来越擅长“一句话生成一首歌”。但真正的音乐创作,并不应该是这样“简单抽卡”。创作者可能已经有一段歌词、一段清唱、一句旋律、一段乐谱、或者一个 Demo,希望 AI 接着往下完成编曲、改编和制作。

StepAudio 3 Music 因此不仅支持从零生成,也支持基于 ABC 记谱法控制的多轮交互创作。模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可以提供歌词、清唱、参考歌曲、ABC 记谱法等多种输入,让模型围绕已有创作继续生成和完善作品。与此同时,用户可以通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。模型还对主歌、副歌、桥段、间奏等歌曲结构,以及跨段落的旋律发展、能量变化和演唱表达进行建模,让生成目标不只是“一段好听的音乐”,而是一首结构完整、表达连贯的作品。

尤其在清唱配乐场景中,用户只需要提供一段清唱,模型就可以理解其中的旋律、节奏和情绪,并进一步补充和声、节奏、乐器和完整编曲。一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫。这让音乐大模型开始更深入地进入真实音乐生产流程,而不仅仅是一个“一键生成歌曲”的工具。

TokenTria 策展

本文要点:行业 前沿研究动态。TokenTria 将持续追踪其对主流 LLM 能力评估榜单的潜在影响。

全文转载自 IT之家,TokenTria 仅作信息聚合与策展引用。