采用原生全双工架构的新一代系统支持实时打断与多任务并行,付费用户默认使用完整版GPT-Live-1,免费用户获得mini版本,旨在将语音打造为核心交互入口。
OpenAI于2026年7月9日正式推出名为GPT-Live的全新语音交互模型,并同步将其应用于ChatGPT语音功能的重构。该模型摒弃了传统的级联式处理流程,转而采用原生全双工架构,实现了系统同时处理语音输入、理解语义与生成输出的并行能力。这一技术变革使得AI在对话过程中能够实时识别用户的停顿意图或插话行为,通过自然的语气反馈(如“嗯哼”)维持交流节奏,无需等待用户完整陈述即可进行动态响应。
在功能配置上,GPT-Live分为GPT-Live-1和GPT-Live-1 mini两个版本。付费订阅用户(包括ChatGPT Go、Plus及Pro会员)默认调用功能更全面的GPT-Live-1,免费用户则使用由GPT-Live-1 mini驱动的语音服务。两款模型均支持网页端、iOS及安卓平台,并计划在未来数周内通过API向开发者开放。后台推理方面,系统默认调用GPT-5.5模型处理复杂任务,同时保持与用户的实时语音连接。当涉及网络搜索、深度逻辑推理或跨语言翻译时,系统可在维持对话流的同时完成多步骤操作,并以自然语音反馈结果。此外,新版系统支持智能听写、动态语速调节(通过改变发音节奏而非简单变速)以及针对青少年的家长控制功能,后者可在检测到高危内容时发送通知。
当前每周已有超过1.5亿用户通过语音功能与ChatGPT进行互动,此次升级标志着OpenAI将语音确立为产品核心入口的战略意图。测试数据显示,在盲测中该模型在对话流畅度、打断恢复能力及交流自然度等指标上表现优于前代Advanced Voice Mode。尽管已支持多语言环境,但部分非母语口音的识别与生成效果仍有优化空间。与此同时,当前版本暂不支持视频会议及屏幕共享场景下的语音交互,用户在这些特定场景中需沿用旧版功能。行业观察认为,GPT-Live的发布使ChatGPT在实时语音架构上追平了Gemini Live及豆包等竞品的技术水准,将人机交互模式从“一问一答”的轮次制推向更接近人类自然交流的并行处理阶段。