AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
<p>细粒度标签+ 20 种方言</p> <p>7 月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。</p>

Qwen-Audio-3.0-TTS的上一代版本已支持freestyle(自由风格模式),可在提示词中加入“资深客服”、“足球解说员”等角色设定,以控制情绪、场景和语速等。新模型则在细粒度上进一步跃迁,通过结构化标签,用户可直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”,适用于需要精确控制细节的叙事、游戏、配音等场景。
面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖中、英、日、韩、德等16 种语言,新增阿拉伯语、越南语、马来语以及菲律宾语。根据CV3-Eval的多语种基准测试,在16 种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在 10 种语言中获得 SOTA,韩语和马来语的领先幅度最大;在 16 种语言的“说话人相似度”评测中,Qwen-Audio-3.0-TTS-Plus 全胜,包揽全部最优,Flash版本包揽了15项第二,其中马来语、西班牙语和阿拉伯语领先幅度最为明显。

模型规模越大、训练数据越杂,方言的发音会不自觉地滑向普通话腔。针对这个痛点,研究团队专门设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等 20种方言。
语音克隆产品往往要求原始参考音频在安静环境下录制,Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,让模型在高噪声、高混响条件下也能过滤干扰、只留音色。面向严肃创作场景,模型拥有开箱即用的精品音色库,并将音频输出从提升24kHz 到 48kHz,相当于视频配音和有声书的品质提升到录音棚、影视配音的规格,单次语音合成可长达 3 分钟。
即日起,两款模型已在阿里云百炼开放调用。
版权所有,未经授权不得以任何形式转载及使用,违者必究。
Related Articles
SpaceX in your index fund, explained
Index funds are touted as one of the safest ways to invest. Rather than picking and choosing individual stocks, index funds let you bet on the market as a whole. So what happens when a company like SpaceX — a...
Adobe’s ‘natural look’ camera app embraces generative AI
Adobe’s experimental camera app has taken an unexpected turn. After Project Indigo was launched last year to provide a “more natural (SLR-like) look” for iPhone photography, the Indigo camera app is now being...
WAIC 2026收官|范式大会亮点集锦,见证AI 2.0从技术突破走向产业实践
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 2026-07-20 ...
不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 2026-07-20 ...