OpenAI 给机器装上更灵的耳朵:两款转录模型上线,Whisper 被甩开一倍差距
来源:互联网
时间:2026-07-29 16:04:04
7月29日,OpenAI悄然推出了两款新的听觉引擎——GPT-Live-Transcribe和GPT-Transcribe,这两个转录模型正式通过API开放调用。它们不再只是把声音转成文字的搬运工,而是开始学着去理解一句话背后的上下文:口音、术语、数字,甚至背景里那阵喧闹的人声,都不再轻易让它们犯晕。
两款模型各有所长。GPT-Live-Transcribe天生为低延迟的实时场景而造,像一位贴着说话人同步落笔的速记员,每分钟收费0.017美元,按现汇率约合0.12元软妹币。GPT-Transcribe则把力气花在已完成的音频文件和批量任务上,走异步转录的路子,价格压到每分钟0.0045美元,约合0.03元软妹币,更适合事后成批消化录音的活儿。
真正拉开代差的,是它们对语境的消化能力。在Context Aware ASR基准上,GPT-Transcribe的语义准确率从没有自由形式上下文时的41.6%,一路爬升到接入上下文后的45.2%——它开始明白,同一个词在不同对话里可能意味着完全不同的东西。
面对Whisper这位老前辈,新模型几乎赢下了一个身位。在Common Voice覆盖的22种语言里,GPT-Transcribe把转录错误率压到了19.27%,而Whisper(whisper-1)还停在40.37%,差距超过一倍;放到真实世界录音的九种语言基准上,它更是把错误率砍到8.98%,把Whisper的15.21%远远甩在身后。当机器能听清带噪环境下的专业术语,语音交互那扇一直半掩的门,似乎又被推开了一道缝。