马斯克发Grok新模型,登智能体测评榜首,比OpenAI家便宜一半
智东西7月30日报道,马斯克旗下SpaceXAI今天扔出了一颗重磅冲击波——正式发布新一代语音模型
Grok Voice Think Fast 2.0

消息一出,马斯克本人连发两条推文。第一条直接甩出结论:“Grok Voice现在在智能体性能方面排名第一”;第二条则更干脆,招呼网友“试试新的Grok Voice”。


马斯克发文
权威评测机构Artificial Analysis的语音到语音指数(Speech to Speech Index)中,Grok Voice Think Fast 2.0高推理能力版本以82.9%的得分位列第二,
仅次于千问Qwen Audio 3.0 Realtime Plus(84.1%)

更值得关注的是响应速度——
该模型平均首音频响应时间仅0.70秒,是榜单前五名中唯一低于1秒的模型

定价方面,Grok Voice Think Fast 2.0
每分钟0.08美元
在评论区,不少网友已经按捺不住。有人期待用它生成多角色有声剧,也有开发者表示“之前一直用Gemini,现在终于有新的选择了”。


01.多位开发者实测后给出好评:响应飞快,对话更自然
01.多位开发者实测后给出好评:响应飞快,对话更自然
AI公司Helionova AI的CEO Nick White在X上分享了他的实测体验。他在旗下产品Tradecraft上完成了面向grok-voice-think-fast-2.0的全栈语音实时升级,直言“
绝对是一次飞跃式的进步
Nick White放出的实测音频中,他让Grok Voice扮演一名因维修人员爽约而愤怒投诉的客户,自己则扮演客服接线员,双方围绕预约迟到展开了一段多轮实时电话对话。整个过程几乎没有明显停顿,模型能根据对话内容持续推进情节,并针对客服回答实时作出反馈。
另一位开发者则把Think Fast 2.0集成进终端工具GrokTerm,展示其对话速度。视频中,测试者先让模型介绍新版本亮点,模型以极快速度回应。随后测试者连续发出“将应用主题切换为赛博朋克风格”“切回原主题”“切到另一边屏幕”“再切回赛博朋克”等指令,
模型均快速响应并完成操作,全程对答如流
SpaceXAI软件工程师Parker Conrad也发文感叹:“整个语音团队为此倾注了大量的努力、思考和热爱。模型的智能水平、准确性和能力几乎让人感觉不真实。语音领域仍然充满摩擦,Think Fast 2.0向着‘
开箱即用

02.响应仅0.7秒,推理更快、识别更准
02.响应仅0.7秒,推理更快、识别更准
Grok Think Fast 2.0定位为下一代语音模型,升级重点集中在
模型能力、响应速度与推理效率
首先是模型能力。
Artificial Analysis数据显示,
Think Fast 2.0综合得分达到82.9%
与此同时,新模型也是目前排行榜前五中响应速度最快的模型。
平均首次语音响应时间仅0.70秒,明显快于GPT-Realtime-2 High(1.14秒)、GPT-Realtime-2.1 High(1.21秒)以及Think Fast 1.0(1.25秒)。
除了速度,Grok Think Fast 2.0还重点优化了语音识别。
在覆盖24种语言、数千条短语的测试中,Think Fast 2.0整体转写准确率相比Think Fast 1.0
提升约1.4倍
识别误差可降低约10倍

另一个变化来自推理效率。
不同于许多语音模型需要先完成推理再生成语音,
Think Fast系列支持一边说话一边完成推理
Think Fast 2.0进一步优化了推理Token利用效率

除了推理效率,对话方式也进行了调整
03.结语:语音模型竞争,进入“智能体时代”
03.结语:语音模型竞争,进入“智能体时代”
过去一年,OpenAI、Google与阿里千问等厂商持续升级实时语音模型,竞争重点也逐渐从语音识别、语音合成,转向复杂任务处理、多轮对话以及工具调用能力。
从此次发布来看,SpaceXAI延续了这一方向。一方面,Think Fast 2.0进一步提升了语音推理、实时交互和语音识别能力;另一方面,通过“边说边推理”、更低的推理Token消耗以及更快的工具调用速度,其希望让语音智能体能够真正承担客服、电话助手、销售等真实业务场景。
从Artificial Analysis最新榜单来看,Think Fast 2.0已经在语音智能体能力(Tau Voice)上取得第一,并跻身Speech-to-Speech综合榜单前列。随着8月5日默认模型完成升级,其实际表现也将在更多开发者和企业应用中接受进一步验证。