7月29日推出支持上下文感知的实时及异步语音转写服务,在多语言基准测试中错误率较Whisper模型降低约一半,并开放API接口供开发者调用。
OpenAI于7月29日正式宣布推出两款新型语音转录模型GPT-Live-Transcribe与GPT-Transcribe,两者均通过API接口向外部开发者开放调用。此次发布将语音转写任务明确划分为低延迟实时处理与高精度异步批量处理两种模式,旨在解决复杂声学环境下的识别难题。新模型引入了上下文感知技术,能够利用自由文本提示、关键词列表及语言设定等参数优化输出结果,显著提升了在包含多口音、专业术语、数字序列及背景噪音场景下的转录准确性。官方建议新项目优先采用这两款模型替代原有的Whisper或gpt-4o-transcribe路径。
在定价策略上,GPT-Live-Transcribe面向实时流媒体与会议记录等即时响应场景,收费标准为每分钟0.017美元(约合人民币0.12元);GPT-Transcribe则针对已完成的音频文件及批量工作负载进行优化,定价为每分钟0.0045美元(约合人民币0.03元)。两款模型在技术文档中均支持MP3、WAV等主流格式,并允许单次请求处理长达3小时的音频文件。企业级用户还可申请定制化微调服务以提升特定领域的识别表现。
性能测试数据显示,新模型在Context Aware ASR基准测试中的语义准确率从无上下文时的41.6%提升至有上下文时的45.2%。在与前代Whisper(whisper-1)模型的对比中,GPT-Transcribe在Common Voice数据集涵盖的22种语言上实现了19.27%的转录错误率,较Whisper的40.37%大幅下降;在真实世界音频录制基准的九种语言测试中,其错误率为8.98%,而Whisper同期数据为15.21%。此外,报告指出模型在医疗、法律等垂直领域的专业术语识别准确率较前代提升37%,数字与符号转录错误率控制在1.2%以下。这一进展标志着语音交互技术在复杂场景下的实用化能力得到实质性增强。