技术媒体披露OpenAI正推进新一代音频架构研发以弥合多模态体验差距,同时向付费用户开放自动执行周期性任务功能以取代旧版Pulse体系。
科技媒体披露OpenAI正在筹备推出名为GPT-Bidi-1的新型语音模型,旨在对ChatGPT的语音交互能力进行重大升级。该模型基于双向(BiDi)架构开发,允许系统同时处理语音输入与输出,支持在对话过程中直接打断并进行实时语义调整。报道指出,OpenAI自2026年年初启动该架构的研发工作,试图解决当前文本模型已进化至GPT-5.5版本而语音技术栈相对滞后导致的体验断层问题。新模型计划与现有的高级语音模式并存,用户可在两种模式间切换,并首次引入High(高)、Medium(中)、Instant(即时)三种智能等级,以根据任务需求在响应速度与推理深度之间进行权衡。
在产品功能层面,OpenAI近期还向Plus、Pro、Business及Enterprise版本用户推出了全新的定时任务系统。该功能旨在将ChatGPT从被动问答工具转化为具备主动执行能力的智能体,允许用户设定周期性提醒、信息监测或自动化操作。新系统在侧边栏增设独立的Scheduled管理页面,支持对任务进行暂停、恢复、编辑或删除,并设定了每小时最多执行一次的上限以及长期无交互自动暂停机制以优化资源。随着新系统上线,原有的Pulse功能体系将在14天后停止服务。此外,此次更新还同步优化了图片导入流程及Mac端Codex工具的功能。
行业观察显示,GPT-Bidi-1的引入被视为OpenAI多模态战略的关键补充,其通过并行处理技术试图将语音交互的流畅度提升至接近人类自然对话水平。虽然部分报道提及新模型在测试中实现了特定的延迟指标或语义保留率数据,但整体来看,此次产品迭代反映了公司在构建音频优先设备及企业级语音工具方面的布局意图,同时也标志着ChatGPT正从单一对话界面转向具备复杂任务调度能力的综合智能平台。