谷歌发布Gemini 3.8 Flash两款TTS模型

9月24日 02:06
新版区分创意与轻量路径,支持自然语言调音、30秒样本复刻和逾百种语言,已进入API与Studio环境,满足角色设计和高并发批量需求。

美国当地时间2026年9月23日,Google向开发端和企业端推出Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两项文本转语音能力,把过去偏重固定音色的合成流程推向可按段落编排的声音生产方式。两类模型已进入Gemini API与Google AI Studio,并对接Notebook、Vids等产品形态,企业侧调用通道也同步打开。

Flash TTS承担角色与音色设计,适配游戏人物、长篇叙事听读和播客节目;Flash-Lite TTS承担吞吐型任务,对应长视频旁白和多条音频内容的批量生成。二者都可以通过描述性文字设定声音质感、停顿、速度和口音,并对每句单独给出表现要求。模型还能处理较长时间音频和两个说话者交替的场景,支持上传30秒音频样本形成近似音色,并带有SynthID标记、许可核验等安全环节。多语言覆盖为100种以上,预置音色超过2000个。Hume AI语音设计基准的名次显示,Flash TTS位于第一位。来源标题还显示一条最低为0.54美元/小时的价格线索,但未说明完整约束条件。

这次产品调整与Google近期扩展实时语音交互、转写的路线一致,也把生成式语音拉进更细的创作控制层面。参与发布的DeepMind研究科学总监艾伦·考恩(Alan Cowen)原创办Hume AI,本次由他与集团产品经理利兰·雷基斯(Leland Rechis)共同推动。随着Figma、HeyGen等应用开始接入,这套能力可能被更多界面、视频生产和内容流水线直接采用;相对于ElevenLabs等单一语音公司,Google的路径在于既有云、API与消费者工具的连通,而不只是出售模型接口。