英伟达发布Vera CPU架构:88核Olympus设计
先说几个核心判断:英伟达在2026年7月22日正式揭开了其新一代Vera中央处理器的架构面纱,从自研的Olympus计算核心内部结构,到整颗芯片的互连方案,信息量相当密集。
先看一眼基本配置:单颗Vera芯片集成了88个Olympus核心,支持176个硬件线程,统一L3缓存高达164兆字节。每个Olympus核心采用宽发射前端设计,内部搭载了神经网络驱动的分支预测器,单周期最多能提取16条指令;解码队列深度为48条指令,解码宽度达到10路,意味着每周期可以处理10条融合指令。
核心中段同样不含糊。重命名、分配与提交单元均按每周期10条微操作的规模配置,并且引入了内存重命名、值预测以及移动消除等关键技术——这些技术专门用来缓解数据依赖造成的执行停顿,算是直击痛点。执行引擎则全面覆盖了整数运算、分支处理、向量计算、浮点运算、加密加速,以及专用的加载与存储单元,几乎没有短板。
缓存体系同样值得关注:每个核心拥有64千字节的四路组相联L1指令缓存,以及96千字节的六路组相联L1数据缓存;L2缓存为2兆字节的八路组相联结构。芯片还集成了多级硬件预取机制,其中特别值得一提的是,专门为指针密集型数据结构与图计算任务设计了一款图预取器,这类负载的数据访问效率因此有了明显提升。
Vera还采用了空间多线程技术,每个Olympus核心支持两个硬件线程。这个设计的巧妙之处在于,核心资源可以在两个线程之间进行物理分区,从而避免了传统同步多线程常见的资源竞争问题。一个线程可以专注执行高性能敏感任务,另一个线程则高效承担系统调度与管理类工作,各司其职。
互连架构方面,基于第二代英伟达可扩展一致性总线,实现了核心、缓存、内存控制器与I/O模块的高效协同。核间互连带宽最高可达3.4太字节每秒;SOCAMM2 LPDDR5X内存接口带宽为1.2太字节每秒,单颗CPU最高支持1.5太字节内存容量。此外,Vera还集成了1.8太字节每秒的NVLink-C2C直连接口,全面兼容PCIe Gen 6与CXL 3.1协议;双路系统提供总计176条PCIe通道,采用双节点NUMA架构,每个CPU插槽构成独立的NUMA域。
最后来看性能。根据英伟达内部于2026年7月完成的SPEC CPU 2026基准测试,在特定智能体类工作负载下,Vera性能表现最高可达主流x86平台的1.8倍。当然,这个结果目前尚未经过第三方独立验证,但仅从架构设计来看,冲击力已经相当明显。