首页 > 教程攻略 > ai资讯 >OpenAI引入两种转录模型:低延迟、更好理解上下文

OpenAI引入两种转录模型:低延迟、更好理解上下文

来源:互联网 时间:2026-07-29 14:25:34

7月29日,OpenAI在X平台官宣了两款新的转录模型——GPT-Live-Transcribe和GPT-Transcribe,并且已经开放API调用。这次的动作,算是把语音转录这条线往前推了一大步。

先说说价格。GPT-Live-Transcribe的转录费用是每分钟0.017美元,而GPT-Transcribe更便宜,每分钟只要0.0045美元。OpenAI表示,相比此前的模型,这两款新模型在理解上下文方面有了明显提升,能更好地处理各种口音和语言,对短语、数字、专业术语,甚至背景噪音很大的语音,都能给出更准确的转录结果。

两者的定位也有区别:GPT-Live-Transcribe专为低延迟实时场景打造,适合需要即时反馈的场合;GPT-Transcribe则优化了异步转录,尤其适合处理已完成音频文件和批量任务。

从基准测试数据来看,提升确实可观。在Context Aware ASR基准上,GPT-Transcribe有上下文时的语义准确率从41.6%上升到了45.2%,涨幅不算小。在Common Voice的22种语言测试中,它的转录错误率只有19.27%,而上一代Whisper是40.37%,几乎翻倍。到了真实世界音频录制的九种语言上,它的错误率更是压到了8.98%,Whisper则是15.21%。

换句话说,无论在实验室环境还是真实场景,这次的两款新模型都拿出了实打实的进步,而且价格上还给出了更灵活的选择。对于有语音转写需求的团队来说,值得关注一下。