NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图
NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图
NVIDIA 昨天(7 月 21 日)发布了 Vera CPU 的技术博客和架构白皮书。这可能是 NVIDIA 迄今为止最详细的一次 CPU 技术披露——从 Olympus 核心的微架构到双路 NUMA 拓扑,全摊开了。
我读完之后最强烈的感受:NVIDIA 在为 GPU 空转等 CPU 这个问题建护城河。而且这堵墙 x86 短期翻不过去。
Vera vs Grace:不只是迭代
| 参数 | Grace (2024) | Vera (2026 H2) | 变化 |
|---|---|---|---|
| 核心 | 72× Neoverse V2 授权 | 88× Olympus 自研 | 全自研 |
| 线程 | 72 | 176 (空间多线程) | +144% |
| 解码宽度 | 6 | 10 指令/周期 | +67% |
| L2 | 1 MB/核 | 2 MB/核 | 翻倍 |
| L3 | 114 MB | 164 MB 统一 | +43% |
| SCF 对分带宽 | — | 3.4 TB/s | 全新 |
| 内存带宽 | 512 GB/s | 1.2 TB/s (14 GB/s/核) | +134% |
| NVLink-C2C | 900 GB/s | 1.8 TB/s | 翻倍 |
| PCIe | Gen 5 | Gen 6.4 | 新标准 |
| 双路 | 无 | 单 NUMA 双路 | 新能力 |
| FP8 | ❌ | ✅ 首个原生 FP8 CPU | 关键新能力 |
| 机密计算 | — | Arm CCA/RME + 机架级可信 | 新能力 |
Olympus 核心微架构
NVIDIA 将 Olympus 核心拆为四个子系统:前端、中核、执行引擎、缓存子系统。
前端:10-wide Decode + 神经分支预测器。当前 x86 最高(Zen 5/6)是 8-wide,ARM 公版 Neoverse V2 是 6-wide,Olympus 直接拉到 10-wide——对标 Apple M 系列的设计规模。背后的支撑是神经分支预测器(Neural Branch Predictor),每周期处理两个 taken branch。Agent 代码全是 if-else 和动态调用,分支预测命中率直接决定有效 IPC。
中核:价值预测 + 内存重命名 + 关键路径加速。价值预测(Value Prediction)——猜 load 指令会返回什么值,不等 DRAM 直接继续执行后面的指令。这在学术圈研究了二十年,商业 CPU 中大规模部署的极少。内存重命名(Memory Renaming)解决指针链的 alias 问题。关键路径加速标记最长依赖链上的指令给予优先调度。再加上大 ROB + 大物理寄存器堆,in-flight 指令数远超 Grace。
执行引擎:SVE2 + FP8。6×128-bit SVE2 向量单元(单线程),双线程时各 3×128-bit。FP8 原生支持是 CPU 史上首次——之前的 Intel AMX 和 ARM SME 把 FP8 放在矩阵加速器里,不在核心流水线中。LLM 推理前的 token 量化——过去在 GPU 上浪费 GPU 算力,Vera 在 CPU 上以 FP8 精度完成,直接通过 NVLink-C2C 喂给 GPU。
缓存子系统:图预取器(Graph Prefetcher)。标准 prefetcher 对规律访问有效。Agent 的数据结构完全不同——每一步地址取决于上一步取值,传统 prefetcher 完全失效。图预取器通过学习内存访问中的指针模式来预测下一个 load 地址。Intel 和 AMD 的 CPU 里没见过——NVIDIA 专门为 Agent 负载做的差异化投资。
空间多线程:名字就叫 SMT,但和你知道的那个完全不一样
NVIDIA 的 Spatial Multithreading 缩写也叫 SMT。两个 SMT 的区别:
传统 SMT(Intel Hyper-Threading):两个线程共享分支预测器、解码带宽、执行单元、Load/Store 队列、L1/L2 Cache。一条线程的 cache miss 驱逐另一条的数据。结果:0-30% 吞吐提升,延迟完全不可预测。
Vera 空间多线程:Olympus 核心足够宽,物理分两个线程槽。单线程模式时全部资源给一条线程,兄弟线程只跑后台管理。双线程模式时资源物理平分,互不干扰。结果:接近 100% 吞吐提升,延迟完全可预测。
为什么确定性延迟对 Agentic AI 是刚需?
一个 Rubin GPU 集群每秒烧几千美元。如果 CPU 线程竞争导致 Kernel Launch 抖动 30ms——1 个 GPU 空转 → 72 个 GPU 一起等(NVL72 紧耦合)→ 1 次抖动 = 2.16 GPU-秒浪费。每天几千次 = 几万 GPU-秒。空间多线程把这种不确定性归零。x86 SMT 可以提供接近的平均延迟,但无法消除尾延迟。
SCF 互联与 SOCAMM2 内存子系统
SCF(Scalable Coherency Fabric)是 Vera 的片上骨干:3.4 TB/s 对分带宽,164 MB 统一 L3,所有 88 核在单片 Die 上,无跨 Die NUMA。
SOCAMM2 LPDDR5X 是 Vera 在内存形态上的关键创新:LPDDR 的低功耗和高带宽(1.2 TB/s)+ DIMM 的可维护性 + 企业级 RAS(ECC/内存镜像/rank sparing)。之前这三个需求互斥(LPDDR 必须焊死才能维持短电气路径),NVIDIA 通过模块化设计突破了这个限制。
双路单 NUMA:和 Chiplet 路线说再见
x86 双路服务器的 NUMA 地狱:Socket 0 内 2-4 NUMA + Socket 1 内 2-4 NUMA = 总共 4-8 个 NUMA 域。线程放哪、内存在哪、I/O 走哪——需要专门的性能工程师。
Vera 的方案:每个 Socket单 NUMA 域(单片 Die 的自然结果),双路 = 两个 NUMA 域。NVLink-C2C Gen 2 做 Socket 间互联。NVIDIA 博客原话:“avoids the die-hop latency and variability common in fragmented chiplet designs”。软件优先。
性能:1.8× Agent 负载提升
博客 Figure 6:“Vera CPU delivers up to 1.8x higher performance on agentic workloads”。
注意限定词:“up to”——最好情况。“agentic workloads”——Python 执行、代码编译、工具驱动路径,不是 SPEC 整数。“loaded single-thread performance”——全 socket 跑满 176 线程时的单线程性能,不是单核空跑峰值。
这个指标比单核峰值难得多:88 个核心同时争抢 L3、内存带宽、SCF 对分带宽。单核的邻居越多,单核越难维持高性能。Vera 在这个场景下比 Grace 好 1.8 倍。
我的几个判断
第一,Olympus 自研核心是 NVIDIA CPU 战略的梭哈时刻。Grace 是试水(ARM 公版 + NVLink 包装),Vera 是全栈自研——核心、互联、内存、NUMA 全部自己定义。这个跨越相当于 AMD 从 Bulldozer 到 Zen。
第二,神经预测器 + 价值预测 + 图预取器一起出现,说明 NVIDIA 对 Agent 负载做了深度 profiling。不是"比 x86 快 10%“,而是"x86 架构在 Agent 负载上有 30-50% 的无用功”。这三个技术没有一个是传统服务器 CPU 的标配。
第三,单片 Die 短期很对,长期有天花板。88 核是物理极限。SCF 正在为未来多 Die 扩展做准备。Vera-next(2028?)必须面对 Chiplet 问题——那时 Rubin GPU 的计算密度又翻了一倍。
第四,NVLink-C2C 1.8TB/s 是 x86 翻不过去的结构性壁垒。不是技术问题,是商业模式——Intel 和 AMD 不可能为 NVIDIA 定制 CPU-GPU 一致性互联协议。
第五,白皮书里的 SPEC 分数才是硬验证。博客是架构叙事,1.8× 是定性结论。等拿到白皮书原文我会补上 SPEC 分析。
发布时间:2026年7月22日来源:NVIDIA Developer Blog “Inside NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Threaded Performance in Agentic AI” (2026.7.21)、NVIDIA Vera CPU Architecture Whitepaper
