阿里甩出配音神器:能调整情绪还会说方言
智东西
作者 杨京丽
编辑 李水青
智东西7月20日报道,今天,千问大模型发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。
模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。目前,Qwen-Audio-3.0-TTS-Plus在第三方评测机构Artificial Analysis的Speech Arena语音合成榜单中居于第一,Elo得分为1237。
▲Qwen-Audio-3.0-TTS-Plus在语音合成榜单中排名第一(图源:Artificial Analysis)
阿里还将陆续上线指令风格音色、20种方言音色、细粒度控制音色及14种以上小语种音色,供开发者直接调用。在输出规格方面,Qwen-Audio-3.0-TTS将音频采样率从24kHz提高至48kHz,单次语音合成最长可达3分钟。
目前,Qwen-Audio-3.0-TTS-Plus和Flash版本均已在阿里云百炼开放。
Qwen-Audio-3.0-TTS-Plus:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-TTS-Flash:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china
一、文本里插入标签,模型可调节语气、情绪、呼吸等
细粒度标签控制是Qwen-Audio-3.0-TTS此次升级的重点之一。用户可以在文本中直接插入结构化标签,嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等这类标记,可以调节语气、情绪和呼吸等细节。
最新也给出了相关的案例,在一段飞船事故相关台词前加入[angry]标签后,模型会以愤怒语气合成后续内容。
合成文本:[angry]你们竟然私自切断了主控系统的能源!知不知道防护罩一旦失效,整艘飞船的人都会化为灰烬?这就是你们所谓的‘为了大局’吗!简直是不可理喻!
参考音频:
//oss.zhidx.com/uploads/2026/07/6a5df7a6e2862_6a5df7a6df376_6a5df7a6df347_1.mp3
合成音频:
//oss.zhidx.com/uploads/2026/07/6a5df7a95e1b8_6a5df7a959e24_6a5df7a959df0_02.mp3
根据文本提示,模型在生成的音频中加入了愤怒的语气,角色的质问感和紧迫感随台词逐步增强。
此外,用户也可以通过输入指令,要求模型在说话过程中笑出声。
指令:说到一半忍不住扑哧笑出声
合成文本:你说的这个事啊,我都听过好几遍了,扑哧——还是觉得好笑。
合成音频:
//oss.zhidx.com/uploads/2026/07/6a5df7aa5a583_6a5df7aa56dd7_6a5df7aa56dad_03.mp3二、自由指令控制,可直接用自然语言描述
除结构化标签外,Qwen-Audio-3.0-TTS还支持Free-style自然语言指令控制。用户可以直接用自然语言描述角色、情绪、场景和语速,不需要单独调整专业音频参数。
最新给出了下面这几个案例:
指令:你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。
合成文本:我们再来读一次,j、q、x这三个声母后面如果跟着u,那个u上的两点要去掉。你跟老师一起读,j——u——ju。
参考音频:
//oss.zhidx.com/uploads/2026/07/6a5df7b047763_6a5df7b043e16_6a5df7b043deb_05.mp3
合成音频:
//oss.zhidx.com/uploads/2026/07/6a5df7b300305_6a5df7b2efd27_6a5df7b2efcfa_06.mp3
模型会按照这段指令合成对应的课堂讲解录音。类似方式也可以用于旁白、角色配音、有声内容和语音助手等场景。
指令:你是悬疑剧旁白,屏住呼吸把紧张感一层层叠上去。
合成文本:那天夜里下着大雨,林晚一个人坐在书房里。窗外的雷声一阵接一阵,灯光忽明忽暗。她忽然听见楼下传来了脚步声——缓慢、沉重,像是有人在故意压低声响。她屏住呼吸,手指紧紧抓住椅子的扶手。脚步声越来越近,最终停在了书房门口。门把手轻轻地,转动了一下。
合成音频:
//oss.zhidx.com/uploads/2026/07/6a5df7ac48ee7_6a5df7ac45300_6a5df7ac452d8_04.mp3
从合成效果来看,旁白语速较为急促,营造出明显的紧张感,让人仿佛置身故事场景之中。如果有声小说采用这种能够随情节调整节奏和情绪的配音,听众的沉浸感和代入感也会更强。
三、覆盖16种语言,10种语言字词错误率最低
Qwen-Audio-3.0-TTS-Plus覆盖中文、英语、日语、韩语、德语等16种语言,新增了阿拉伯语、越南语、马来语和菲律宾语。
根据最新公布的CV3-Eval多语种测试结果,目前,Qwen-Audio-3.0-TTS在16种语言的词或字错误率评测中,Qwen-Audio-3.0-TTS系列在10种语言中排名第一,其中韩语和马来语的领先幅度较大。
在16种语言的说话人相似度评测中,Qwen-Audio-3.0-TTS-Plus取得全部16项最优成绩,Flash版本取得其中15项第二。马来语、西班牙语和阿拉伯语的提升较为明显。
四、支持20种中文方言,强化韵律和声调训练
中文方言方面,Qwen-Audio-3.0-TTS目前支持广东话、重庆话、东北话、陕西话、上海话、四川话和云南话等20种方言。千问称,新模型使用了更多方言数据,并增加了方言强化训练阶段,让模型在韵律、声调与口语表达上接近母语者,减少通用语音强化学习过程中可能出现的方言特征减弱问题。
用户可以通过自然语言指令指定输出方言。例如,输入“输出上海话”,模型即可根据后续文本合成上海话语音。
指令:
输出上海话:屋里向装修真个是烦人,天天敲墙壁,声音响得来!灰尘落得一塌糊涂,真想快点弄清爽。
合成音频:
//oss.zhidx.com/uploads/2026/07/6a5df7b988f87_6a5df7b98456e_6a5df7b984538_08.mp3五、噪声和混响环境下,仍具备较强声音复刻能力
声音复刻通常需要使用较为清晰的参考录音,但实际获得的音频中可能包含背景噪声或混响。
Qwen-Audio-3.0-TTS加入了真实声学环境仿真训练,将语音增强能力用于声音复刻流程。最新称,在参考音频存在较高噪声或混响的情况下,模型可以过滤部分环境干扰,并提取说话人的音色。
合成文本:听到这首歌的时候,突然想起很多年前的夏天。
参考音频:
//oss.zhidx.com/uploads/2026/07/6a5df7baa4948_6a5df7baa0ef8_6a5df7baa0ece_09.mp3
合成音频:
//oss.zhidx.com/uploads/2026/07/6a5df7bcc77e7_6a5df7bcc2839_6a5df7bcc280e_10.mp3结语:语音合成增强语气、情绪等控制能力
从此次升级来看,Qwen-Audio-3.0-TTS提高了对于语气、情绪、呼吸和角色风格的控制能力。结构化标签适合调节具体位置的表达效果,自然语言指令则能对角色、场景和语速进行整体描述,多语种、方言及复杂声学环境下的声音复刻能力也得到扩展。
随着Plus和Flash版本在阿里云百炼开放,这些能力将进入更多实际应用场景,为旁白、角色配音、有声内容和语音助手提供更多配音方案。
-
07.21
月亮影视大全app如何下载电视剧
-
07.21
炉石兆示萨卡组3月2026一览
-
07.21
炉石打脸法卡组3月2026详情
-
07.21
金铲铲之战16.7b版本更新全部内容详情
-
07.21
江南百景图同乡会馆建造位置介绍
-
07.21
原神冬极白星属性及突破材料介绍
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏