性能狂飙!Grok_4.6正式发布,实力比肩GPT-5.6_Sol
最近,SpaceX AI正式推出了全新升级的旗舰级人工智能大模型——Grok4.6。这个版本显然是冲着高复杂度、长周期的Agent任务去的,做了相当深入的针对性优化。从多项权威基准测试的表现来看,它已经具备与OpenAI最新旗舰模型GPT-5.6Sol正面较量的实力,而且在部分场景下,表现还要更进一步。
回溯技术发展路径,SpaceX AI早在7月便携手Cursor,依托数万张英伟达GB300 GPU的强大算力,成功训练并推出了Grok4.5。以此为基石,Grok4.6实现了质的跃升:其训练策略全面聚焦于长程任务建模,大量引入涵盖多步逻辑推理、前沿技术原理阐释及工业级高质量工程代码的合成数据;同时,模型还经历了覆盖知识型工作流、通用编程任务及多个垂直领域交互环境的强化学习训练,在视觉理解、多轮交互与可执行应用构建等场景下,显著提升了初始响应质量与任务完成稳定性。

据全球知名AI评测机构Artificial Analysis发布的九项主流基准综合指数显示,Grok4.6已成功追平GPT-5.6Sol的整体表现,当前仅略逊于Claude Opus5与Fable5Max。细分来看,在侧重逻辑推演与常识知识整合能力的GDPval-AA v2测试中,Grok4.6斩获1753分Elo评分;而在专门评估长周期知识工作者Agent行为效能的私有基准AA-Briefcase中,亦取得1577分Elo成绩,两项核心指标均稳居Claude Opus5之后,位列第二。
性能显著拉升之外,Grok4.6依然没有偏离那条很明确的路线:既要高效能,也要把性价比做出来。具体来看,它的推理吞吐量最高可达80TPS;基础版本的输入与输出价格,分别是每百万Token 2美元和6美元;高速优化版则对应每百万Token 4美元和12美元。现阶段,Cursor平台用户与Grok Build开发者已经可以立即启用;其他外部开发者也能通过标准化API,快速完成集成与调用。