火山引擎发布豆包音频生成模型1.0支持多模态参考与长时一致性

6月24日 09:39
6月23日推出的Doubao-Seed-Audio 1.0整合文本与音频输入,实现从提示词直接输出含对白、音效及配乐的成片级作品,旨在解决长时生成中的音色一致性问题并降低专业制作门槛。

火山引擎于6月23日正式推出豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),该模型核心功能在于支持多模态参考生成与长时音色一致性控制。用户仅需输入包含角色台词、情绪语气、背景音乐及环境氛围描述的单条指令,系统即可端到端生成具备完整叙事张力的音频作品,将传统需要分别生成人声、音效并进行多轨混音的繁琐流程压缩为一次性交付。这一技术路径使得创作者能够直接获得有声剧、播客或品牌音频等成片级内容,无需依赖复杂的后期剪辑与对齐操作。

在技术参数与应用细节方面,该模型单次生成时长支持2分钟,并具备多次延长功能以应对长音频场景需求。针对长篇幅创作中常见的角色声音随时间推移发生偏差的问题,模型通过文生音频与参考音频的深度联动技术,确保同一角色在不同时间段落(如第1分钟至第10分钟)的声音特征保持高度统一。此外,系统支持音色与风格的深度解耦,允许同一音色源在不同情绪、语境或角色设定下呈现差异化表现,实现“一声多角”的演绎能力。用户既可通过文本描述生成目标音频,也可上传参考音频进行风格迁移,且无需额外训练即可获得高质量输出。

该模型的发布标志着音频制作工作流从传统的“剪辑拼接”模式向“创意导演”模式的转型。目前,火山方舟平台已开放该模型的API邀请测试,个人用户可在体验中心获取30分钟免费创作额度。未来,豆包音频生成模型1.0将陆续接入剪映、即梦及番茄等内部产品线,服务于更广泛的视频与内容创作者群体。这一举措降低了专业音频生产的门槛,提升了有声内容、播客节目及影视配乐等环节的生产效率与标准化程度。