刚刚,中国语音AI连拿多项全球第一
地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来···
你甚至能感觉到车厢在晃。
这不是电影原声带。整段声音是用一句 prompt,AI 一次性生成的。
再来听一首歌。先是一段清唱,没有伴奏,就是一个人对着麦克风干唱:
然后,AI 接手了。一句提示词——
一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫
模型直接在这段清唱的基础上,补齐了编曲、和声、节奏和完整制作:
从一段干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗?
说实话,我第一次听的时候也没分出来。
音频大模型,开始比「体系」了
过去两年,语音 AI 赛道非常热闹。
Suno 两天前刚发布了 v6 系列,OpenAI 的 GPT-Realtime-2 今年把实时语音推理能力拉到了 GPT-5 级别,Google 在 I/O 上把 Gemini Live 推到 70+ 语言的流式翻译。
但有一个现象值得注意:几乎所有玩家,都在比单项。
做语音合成的比谁说话更像真人,做语音识别的比谁听写更准,做音乐的比谁生成的歌更好听,做实时对话的比谁反应更快。
然而现实世界里的语音需求,从来不是一个孤立的点。
一条短视频的声音制作,需要角色配音、环境音效、背景音乐,可能还需要先把素材里的人声转成文字做理解。
Voice Agent 要跑起来,语音识别、语音生成、实时交互、推理、工具调用得同时在线。一个音乐创作者做一首歌,可能先有一段清唱,需要 AI 补上编曲、和声和制作。
这些场景对应的不是一个模型,而是「一组能力」。
这正是行业正在发生的一个结构性变化:当单点能力逐渐拉平,决定竞争力上限的,变成了谁能把理解、生成、交互和创作连成一套完整的体系。
9 月 15 日,阶跃星辰一口气放出了 StepAudio 3 系列五款模型:StepAudio 3 TTS(语音生成)、StepAudio 3 Gen(完整音频生成)、StepAudio 3 Realtime(实时语音交互)、StepAudio 3 ASR(语音识别)和 StepAudio 3 Music(音乐创作)。
五条产品线,覆盖「听、说、理解、交互、创作」全链路。这在国内音频大模型领域,是第一家以完整矩阵形态同时推出的。
它反映出阶跃对语音 AI 竞争走向的一个判断:单项能力竞赛的窗口期正在关闭,全栈体系化能力开始成为真正的壁垒。
不过话说回来,全栈的前提是每一条腿都得站得住。
这一点,第三方榜单先给了答案——三个全球第一。
Artificial Analysis Conversational Dynamics 榜单,StepAudio 3 Realtime 以 98.9% 的综合得分,全球第一。
这个榜单测的是「对话节奏感」:什么时候该接话,什么时候该等你说完,用户突然插一句是想打断还是只在附和。这恰恰是实时语音里最像人也最难的部分——不是听懂和回答,而是知道该不该现在开口。
Artificial Analysis Speech Reasoning 榜单,StepAudio 3 Realtime 以 99.7% 的语音推理准确率,位列全球第一。
这张榜考的是模型能不能直接「听」懂音频并完成复杂推理任务,而不是先老老实实转成文字再去想。它是业内评估原生语音模型最权威的第三方基准之一。
Artificial Analysis 非流式语音识别准确性榜单,StepAudio 3 ASR 的 WER(词错误率)仅 1.7%,并列全球第一。
WER 这个指标很朴素:每转写 100 个词错几个。1.7% 意味着差不多 60 个词才错一个,已经接近专业速记员的水准。
榜单说完了。接下来的部分,我们不看分数,只看这些模型在真实场景里到底是什么表现。
像人一样交流
语音模型的基础能力正在快速成熟。
但「识别准确」「声音自然」「响应够快」这些单点指标,已经不足以构成完整体验。
真正拉开差距的,是模型能否接近真实人类交流的状态:听懂语境、自然表达,并在持续对话中完成理解、回应和行动。
StepAudio 3 TTS:从「声音自然」到「表达自然」
市面上大多数 TTS 模型已经能把声音做得很「像真人」了。
但仔细听会发现,它们像的是「播音员」。字正腔圆,完美得不像在说话,更像在「朗读」。
真实的人类交流不是这样的。是「呃」、是「就是那个」、是说到一半改口、是突然笑出来又赶紧收住。
来听一段 StepAudio 3 TTS 生成的语音:
「我最近就特别纠结,就是要不要换工作这个事。呃,现在这家吧,钱少,但是离家近嘛,走路十分钟。新的那个 offer 呢,给得多,多个,多个四千吧大概,但通勤单程要一个半小时。我妈说钱重要,我朋友说命重要,我就,唉,怎么说呢,天天睡前想这事,越想越睡不着。」
注意那些细节:「就特别纠结」里带着微妙的叹气,「多个,多个四千」的口语化重复完全自然,说到「命重要」时语气微微上扬,紧接着的「唉」里满是无奈。
这些不是预设的情绪标签,而是模型根据语义自主判断出来的表达方式。
「你不老说通勤无聊吗,我给你安利个播客,就,讲那种,呃,讲历史八卦的。主播俩人特逗,一集大概,嗯,一个小时吧,正好我来回路上听。我这两个月,就,就靠它撑着了。你搜那个名字我回头发你,反正免费的。」
这段语音里的「就,就靠它撑着了」,两个「就」之间有一个几乎无意识的停顿,完全是人在组织语言时的自然节奏。
目前行业里大部分 TTS 模型处理这类口语化表达时,要么直接忽略重复词,要么机械地念两遍,很难做到这种「不完美但真实」的语感还原。
从技术层面看,StepAudio 3 TTS 在音色基底、语调层次、节奏律动和气口停顿上全面贴合自然口语模式,并能还原笑声、迟疑、结巴、改口等副语言特征。
前代 StepAudio 2.5 TTS 已经在全球权威的 Artificial Analysis Speech Arena 拿下国产第一、全球前三。
StepAudio 3 TTS 在这个基底上再往前推了一步,把「音色像不像」转移到了「说话方式像不像」。
StepAudio 3 ASR:从「听清」到「听懂」
语音识别看起来已经很成熟了。但 AI「听清」和「听懂」之间,隔着一条鸿沟。
你说「骁龙8至尊版」,它给你转成「小龙八至尊版」。你说「张靓颖」,它给你写成「张亮影」。
问题的根源在于,传统 ASR 只依赖声学信息——它在意「听到了什么音」,而不是「说的是什么意思」。
StepAudio 3 ASR 的思路是把高精度声学建模和大语言模型的语境理解结合在一起。
识别语音时,模型不只做「音-字」对应,还会调用语言模型的知识和推理能力辅助判断:根据上下文,这个音更可能是哪个词?
这个方向并非阶跃独创,业内多家都在探索 ASR 与 LLM 的融合。
但 StepAudio 3 ASR 的覆盖面值得关注:方言、口音、中英混说、低声耳语、快语速连读、甚至唱歌和有背景音乐的场景都能处理。长音频支持也不是简单的「切片-转写-拼接」,而是端到端的完整理解,避免上下文断裂。
这直接关系到会议纪要、视频字幕、智能客服、车载交互、医疗记录等一系列场景的实际可用性。
比如,我们先用 StepAudio 3 Gen 出一段机场的背景音。
再拿去让 StepAudio 3 ASR 去听。这其实是拿 StepAudio 3 自己考自己。
Gen 这边,广播腔拿捏得很准:有那种通过航站楼喇叭传出来的压缩感和轻微失真,不是干干净净的棚里录音。
ASR 这边更见功夫,全程 40 秒的音频里,「MU 5127」「C17」「C31」「18 点 45 分」这些字母数字混排的信息一个没错。
机场广播的登机口和航班号恰恰是最容易听错的部分,C17 和 C31 又是在同一句话里对照出现,转错一个字乘客就跑错门了。


