该模型于火山方舟上线,通过统一框架联合建模人声、音效与环境声,支持20余种语言生成及百毫秒级时间精度控制,旨在实现影视级端到端音频叙事。
字节跳动正式推出名为Seed Audio 1.0的音频创作模型,标志着其音频生成技术从单一语音合成向完整声音场景创作的演进。该模型已接入火山方舟体验中心供用户测试,核心逻辑在于打破传统多模型分别处理人声、音效与环境声并人工拼接的模式,转而采用统一框架进行联合建模,能够根据文本指令端到端生成包含对白、关键音效及背景环境的完整音频叙事作品。
在技术特性方面,Seed Audio 1.0具备三大核心能力。首先是时空编排精度达到100毫秒级,允许用户通过单一提示词按时间线精确控制各类声音要素的入场时机与持续长度,满足视频配音及广告制作的严苛需求。其次是音色演绎的稳定性与多样性,模型支持零样本生成及长音频延展,在保持角色音色一致性的前提下,可自然切换愤怒、喜悦等不同情绪,甚至实现同一音色演绎多个不同角色。最后是语言适配能力,系统覆盖中文、英语、日语等20余种语言,能确保生成的语音符合各语种本土的发音习惯与重音节奏。
官方评测数据显示,该模型在影视、短剧、播客、直播带货等九大类常见创作场景中的音频可用率超过90%。在多语言自然度评估中,大部分语言的MOS评分达到4分以上,除越南语外其余语种在复杂指令遵循上的评分均高于3.5分。团队表示未来计划引入视频参考等多模态输入,并探索可控翻译技术,以进一步拓展长音频与分轨生成功能,降低高质量影视级音频内容的制作门槛。