该音频模型集成于Google翻译及Meet,保留说话者语调并压缩延迟至数秒,开发者可通过API接入多语言通话场景。
谷歌正式发布名为Gemini 3.5 Live Translate的实时语音到语音音频模型,旨在改变传统翻译工具需等待整句结束后才输出的交互模式。该模型能够连续生成翻译语音,在理解上下文以提升准确性与即时响应以保持同步之间进行动态平衡,使译文输出始终仅落后说话者数秒,并保留原始说话的语速、音高及语调特征。
技术细节显示,Gemini 3.5 Live Translate基于Gemini 3 Pro架构构建,支持自动识别70多种语言,无需用户手动切换设置即可处理多语言输入流。模型具备较强的抗噪能力,可在嘈杂或不可预测的声学环境中稳定运行。在部署方面,开发者可通过Gemini Live API和Google AI Studio获取公开预览版,用于多语言通话、会议、直播解说等场景;企业客户可于本月起在Google Meet中使用私有预览版,使会议支持的语言组合扩展至2000多种,打破以往仅以英语为枢纽的限制。普通用户将在Android和iOS版的谷歌翻译应用中体验该功能,其中Android端新增“聆听模式”,用户连接耳机后可在实时听模式下获取带语气还原的译文,部分场景下亦可通过手机听筒低调接收翻译内容。
此次更新标志着谷歌将实时同传技术从实验室推向了更广泛的大众及企业应用层。行业观察指出,该模型通过流式处理解决了传统轮流式系统的沟通节奏断裂问题,提升了跨语言交流的自然度。目前已有出行平台Grab在千万级司乘沟通场景中试用该能力以验证低延迟与翻译质量。尽管功能已上线,部分实测反馈显示在古诗翻译等复杂语境下仍存在一定延迟,且“实时听”模式在部分终端需连接外置耳机方可激活,双向同时同传能力的覆盖范围仍在持续优化中。