我做了个新闻联播版《甄嬛传》:全靠这款字节模型
智东西
作者 茄子
编辑 程茜
智东西7月20日消息,今日,字节跳动发布音频创作模型Seed Audio 1.0。据最新介绍,该模型通过一段提示词即可生成包含对白、音效和环境声的完整声音场景,支持多音频要素协同生成、音色风格控制和多语种自然表达,并能够保持长音频中的角色一致性。
智东西对Seed Audio 1.0进行了实际体验。在测试中发现,该模型能够根据提示词生成包含角色对白、环境音和音效的完整场景,并在角色音色保持、声音模仿、多语言表达等方面展现出较强能力。不过,在部分场景下,该模型生成的音频仍存在一定AI感,情绪细节和真实度仍有提升空间。
比如,在这段办公室场景对话中,Seed Audio 1.0生成的对话创作了办公室日常遇到困难时的讨论场景。其中,该模型对角色落寞的语气、翻页时的停顿和领导走过来时的高跟鞋音效都有较好地还原。
//oss.zhidx.com/uploads/2026/07/6a5def2408391_6a5def2404310_6a5def24042d6_智东西-场景对话.wav
▲Seed Audio 1.0生成办公室对话音频
最新评测显示,Seed Audio 1.0在音色生成、复杂场景创作和多语种表达等方面具备较强能力。在盲测主观偏好CMOS打分中,该模型相较头部商用音频服务最高提升0.79,用户更偏好其生成音频;在电影、短剧、播客、动画等十余类场景测试下,该模型生成的整体音频可用率达91%;在多语种能力测试方面,该模型支持20余种语言生成,绝大多数语种人声自然度MOS平均分超4分(≥4分为优质标准)。
▲Seed Audio 1.0各项测试得分
体验平台:火山方舟体验中心
https://seed.bytedance.com/seedaudio1_0
一、凭环境描写,Seed Audio 1.0能直出环境音+人物对话音频
Seed Audio 1.0发布后,智东西体验了该模型在音频创作和声音模仿上的能力。
智东西首先输入了一段不包含语气和对白信息的提示词,测试Seed Audio 1.0是否能够仅根据场景描述生成符合人物设定的角色对话。
提示词:荧光灯持续嗡鸣、冰柜压缩机低响、高速货车不时驶过,低沉悬疑弦乐铺垫,两名中年男人分开站在窗口两侧,一人局促不安反复望向加油站入口,另一人单手插兜、神色冷淡散漫,两人刻意保持距离互不靠近。
//oss.zhidx.com/uploads/2026/07/6a5dd5100267c_6a5dd50fed330_6a5dd50fed2ee_一句提示词生成一段对话.wav
▲Seed Audio 1.0一句话创作音频
该模型生成了一段两名男子在高速加油站等待同伙接头的悬疑场景,并通过环境音和角色语气营造出紧张氛围。此外,两人的语气和对话也较好地对应了提示词中的一人紧张、一人散漫。
第二,智东西给出了一段古风武侠对话,验证Seed Audio 1.0生成的音频在角色声音输出上是否能保持一致性,以及能否生成包含对白、音效和环境声在内的完整声音场景。
提示词:
1[古风武侠电影氛围,深秋密林浓雾笼罩,林间寒风穿林呼啸,远处山间隐约传来狼嚎,肃杀紧张]
2[枯枝踩踏碎裂声响,林间冷风持续沙沙作响,树叶被气流卷动四处飞舞]
3苏晚(女子,二十余岁,温润古风声线,紧绷急促,压低声音)快步穿梭树丛,低声急呼:“追兵已经追上山了,快走,往悬崖密道去!”
4[身后树干被箭矢穿透闷响,树枝断裂轰然落地]
5沈砚(男子,三十岁上下,声线慌乱急促,踉跄摔倒在枯叶堆)喘息慌乱开口:“密道入口被巨石封死,我们走投无路了!”
6苏晚(语气坚定凌厉,拔剑出鞘轻鸣)沉声决断:“我来劈开封堵岩石,你紧随我身后,切莫乱跑!”
7[片刻安静,风声减弱,只剩二人急促喘气与远处渐近的马蹄声]
8[长剑全力劈砸巨石轰然爆响,碎石滚落山崖,低沉古风弦乐骤然响起,随后彻底静默]
//oss.zhidx.com/uploads/2026/07/6a5dd65119855_6a5dd6510e14b_6a5dd6510e115_古风武侠.wav
▲Seed Audio 1.0创作古风武侠场景音频
从生成效果来看,Seed Audio 1.0不仅能够理解提示词中的场景设定,还能将环境音、人物对白和剧情事件进行组合生成。在这段音频中,该模型还原了密林环境中的风声、狼嚎、箭矢穿透、巨石碎裂等声音元素,并根据人物设定生成了不同角色的声音表现。其中,苏晚和沈砚的音色、语气与提示词中的角色状态保持一致,前者表现出紧张中的坚定,后者呈现出慌乱急促的情绪,并且,苏晚的2段台词也没有出现明显的角色漂移。
第三,智东西体验了该模型对声音的模仿能力。我们给出了一段新闻联播女声和一段《甄嬛传》中甄嬛的台词,并要求该模型用新闻联播女声输出这段台词音频。
//oss.zhidx.com/uploads/2026/07/6a5dd74abde60_6a5dd74ab80dc_6a5dd74ab809c_新闻联播女声_爱给网_aigei_com_cut_21sec.mp3
▲新闻联播女声
从生成音频来看,该模型的声音模仿能力较突出,无需额外训练,就可以根据参考音频生成新闻联播女声风格的《甄嬛传》台词。在音色方面,生成结果能够较好还原参考声音的特点,声音辨识度较高。
//oss.zhidx.com/uploads/2026/07/6a5dd76faa341_6a5dd76fa4277_6a5dd76fa4248_Result-1.wav
▲Seed Audio 1.0用新闻联播女声生成《甄嬛传》台词
第四,智东西还体验了Seed Audio 1.0的多语言能力。我们给出了一段文字,并要求该模型用粤语生成音频。
提示词:【底层音效:茶餐厅瓷碗碰撞、抽油烟机低频嗡鸣、邻桌客人细碎交谈、风扇转动声】中年阿姨拉开胶凳坐下,拿起茶单小声自语,语气放松家常:“落咗成日落雨,收工即刻过嚟叹茶,整份虾饺烧卖同冻柠茶先,冻柠茶要少冰多柠。”手指轻敲塑料茶单发出沙沙声。服务员端着托盘快步走近,瓷杯磕碰作响,扬声搭话:“阿姐,今日凤爪炆得够晒火候,好多熟客特登过嚟点,要唔要加一碟?” 阿姨摆手轻笑,翻了两页餐单,随口闲聊:“唔使啦,今日仲要赶返屋企煮饭畀孙仔,听日再嚟试。对咗,隔篱街市今日水果平唔平?寻日我买嘅荔枝好甜。”远处收银台扫码机滴滴响,服务员转身回话,脚步声走远:“今日芒果特价,十蚊三斤,晚黑收摊仲会再平啲,行过可以睇下。”
//oss.zhidx.com/uploads/2026/07/6a5ddb3e66b24_6a5ddb3e5491a_6a5ddb3e548cf_粤语对话.wav
▲Seed Audio 1.0输出粤语音频
Seed Audio 1.0生成的对话完整地还原了茶餐厅的背景音效,并且生成的音频在语气、节奏上也有较好地把握。但是在音色上还存在一定的AI感,尤其在刚进入对话的时候,难以让人代入,后面的对话较前面更自然一点。
二、多要素协同与精准控制,Seed Audio 1.0创作完整音频
据最新介绍,Seed Audio 1.0具备复杂声音场景编排能力。它不需要拼接就能自然地组织角色语气、背景氛围和声音节奏,输出的音频更接近一段完整作品。
比如,最新展示的这段救灾音频,既包含新闻记者的沉稳女声,也包括前线救灾员略带东北口音的普通话,还有渲染紧张氛围的背景音。
//oss.zhidx.com/uploads/2026/07/6a5ddc0926289_6a5ddc0922b83_6a5ddc0922b45_救援.m4a
▲Seed Audio 1.0生成复杂声音场景
其次,Seed Audio 1.0还具备时间线控制能力。据最新介绍,Seed Audio 1.0能理解创作意图,将角色、台词、情绪和音效按照时间线进行编排,控制不同声音的进入时机与衔接方式,支持100ms级时间精度,让生成音频更符合影视、广告等内容创作需求。
最新展示了一段Seed Audio 1.0对一段视频的翻配,该模型在角色进场和说话时间上都能较好卡点。
//oss.zhidx.com/uploads/2026/07/6a5ddc5f4ad00_6a5ddc5f4795c_6a5ddc5f47931_时间卡点.m4a
▲Seed Audio 1.0对视频的翻配卡点
此外,Seed Audio 1.0还支持零样本音频生成。创作者既可以直接用文字描述目标声音,也可以结合参考音频进一步控制生成结果,就不需要为每一种声音单独训练模型。
最新展示了2段音频,一段是Seed Audio 1.0根据英文文本创作的音频,还有一段是Seed Audio 1.0对一段播客中2名外国青年男子声音的模仿。
//oss.zhidx.com/uploads/2026/07/6a5ddcd72a705_6a5ddcd72456f_6a5ddcd724540_文本一键生成音频.m4a
▲Seed Audio 1.0根据英文文本创作音频
//oss.zhidx.com/uploads/2026/07/6a5ddce48a9b2_6a5ddce480a1a_6a5ddce4809f0_模仿音频.m4a
▲Seed Audio 1.0参考英文播客输出模仿音色音频
并且,该模型还能在同一音色的基础上生成不同风格的音频。比如,在最新案例中,同一音色在不同场景下能够呈现不同表达方式:足球解说中的高亢激昂、有声书中的平稳叙述,以及直播带货中的快速强调。
最新介绍,该模型还具有多语种创作的能力。在多语种生成案例中,Seed Audio 1.0能够根据不同语言调整发音节奏、重音和情绪表达。
结语:AI音频从“会说”走向“会创作”
从语音合成到音频创作,AI音频模型正在突破单一声音生成的边界。Seed Audio 1.0尝试将对白、音效、环境声和情绪表达统一到同一生成框架中,让AI能够理解完整声音场景,而不只是输出一段语音。
随着模型对声音结构、角色一致性和时间控制能力不断增强,AI音频正在从辅助工具逐渐走向内容生产环节。未来,如何让生成声音进一步接近真人表达,并满足更复杂的创作需求,将成为音频大模型持续探索的方向。
-
07.21
月亮影视大全app如何下载电视剧
-
07.21
炉石兆示萨卡组3月2026一览
-
07.21
炉石打脸法卡组3月2026详情
-
07.21
金铲铲之战16.7b版本更新全部内容详情
-
07.21
江南百景图同乡会馆建造位置介绍
-
07.21
原神冬极白星属性及突破材料介绍
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏