该模型于2026年6月23日由网易有道正式推出,作为业内首个无需参考文本即可实现跨语种无口音语音合成的开源方案,仅需3秒音频即可完成相似度超85%的音色迁移。
网易有道于2026年6月23日正式对外发布“子曰4.0”TTS语音合成引擎Confucius4-TTS。该引擎定位为业内首个支持14种语言跨语种无口音且无需参考文本即可完成语音克隆的开源模型,旨在降低多语种内容生成与跨境传播的技术门槛。此次发布标志着国产开源TTS在跨语种语音克隆、免参考文本建模及情感韵律迁移等维度达到国际先进水平,并面向全球开发者全量开放。
在技术细节层面,Confucius4-TTS支持中文、英语、西班牙语、法语、德语、韩语、泰语、越南语等14种语言的自然流利表达。用户仅需提供3秒音频素材,无需额外参考文本或前期训练步骤,系统即可完成音色克隆,克隆音色与原声相似度超过85%,任务准确度达到97%。该模型具备跨语种发音能力,输入中文音频后,AI能够利用原声音色直接输出英语、日语等其他语言,并保持全过程中音色高度一致。情感表达方面,引擎摒弃了传统依赖文本标签控制情感的粗放方式,转而采用音频Prompt情感克隆迁移技术,系统可自动提取参考音频中的情感特征,精准复刻语调与韵律,实现跨语种无损迁移。
底层架构上,Confucius4-TTS实现了全面革新,引入GPT式语义大模型作为主干,搭配基于SSL预训练特征和ECAPA-TDNN的可学习说话人编码器,并采用Flow Matching流匹配生成框架替代了传统声码器方案。相较于初代EmotiVoice采用的HiFi-GAN声码器和Speaker ID查表方案,新架构在生成效果与效率上均有提升。网易有道已采用Apache开源协议将该模型全量开源,提供包括54GB完整资源包在内的模型权重和配套工具链,支持本地离线部署且商用无限制,服务于数字人配音、跨语言教学及短剧出海等场景。