当前位置: 首页 > news >正文

NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

NVIDIA 昨天(7 月 21 日)发布了 Vera CPU 的技术博客和架构白皮书。这可能是 NVIDIA 迄今为止最详细的一次 CPU 技术披露——从 Olympus 核心的微架构到双路 NUMA 拓扑,全摊开了。

我读完之后最强烈的感受:NVIDIA 在为 GPU 空转等 CPU 这个问题建护城河。而且这堵墙 x86 短期翻不过去。


Vera vs Grace:不只是迭代

参数Grace (2024)Vera (2026 H2)变化
核心72× Neoverse V2 授权88× Olympus 自研全自研
线程72176 (空间多线程)+144%
解码宽度610 指令/周期+67%
L21 MB/核2 MB/核翻倍
L3114 MB164 MB 统一+43%
SCF 对分带宽3.4 TB/s全新
内存带宽512 GB/s1.2 TB/s (14 GB/s/核)+134%
NVLink-C2C900 GB/s1.8 TB/s翻倍
PCIeGen 5Gen 6.4新标准
双路单 NUMA 双路新能力
FP8✅ 首个原生 FP8 CPU关键新能力
机密计算Arm CCA/RME + 机架级可信新能力

Olympus 核心微架构

NVIDIA 将 Olympus 核心拆为四个子系统:前端、中核、执行引擎、缓存子系统

前端:10-wide Decode + 神经分支预测器。当前 x86 最高(Zen 5/6)是 8-wide,ARM 公版 Neoverse V2 是 6-wide,Olympus 直接拉到 10-wide——对标 Apple M 系列的设计规模。背后的支撑是神经分支预测器(Neural Branch Predictor),每周期处理两个 taken branch。Agent 代码全是 if-else 和动态调用,分支预测命中率直接决定有效 IPC。

中核:价值预测 + 内存重命名 + 关键路径加速。价值预测(Value Prediction)——猜 load 指令会返回什么值,不等 DRAM 直接继续执行后面的指令。这在学术圈研究了二十年,商业 CPU 中大规模部署的极少。内存重命名(Memory Renaming)解决指针链的 alias 问题。关键路径加速标记最长依赖链上的指令给予优先调度。再加上大 ROB + 大物理寄存器堆,in-flight 指令数远超 Grace。

执行引擎:SVE2 + FP8。6×128-bit SVE2 向量单元(单线程),双线程时各 3×128-bit。FP8 原生支持是 CPU 史上首次——之前的 Intel AMX 和 ARM SME 把 FP8 放在矩阵加速器里,不在核心流水线中。LLM 推理前的 token 量化——过去在 GPU 上浪费 GPU 算力,Vera 在 CPU 上以 FP8 精度完成,直接通过 NVLink-C2C 喂给 GPU。

缓存子系统:图预取器(Graph Prefetcher)。标准 prefetcher 对规律访问有效。Agent 的数据结构完全不同——每一步地址取决于上一步取值,传统 prefetcher 完全失效。图预取器通过学习内存访问中的指针模式来预测下一个 load 地址。Intel 和 AMD 的 CPU 里没见过——NVIDIA 专门为 Agent 负载做的差异化投资。


空间多线程:名字就叫 SMT,但和你知道的那个完全不一样

NVIDIA 的 Spatial Multithreading 缩写也叫 SMT。两个 SMT 的区别:

传统 SMT(Intel Hyper-Threading):两个线程共享分支预测器、解码带宽、执行单元、Load/Store 队列、L1/L2 Cache。一条线程的 cache miss 驱逐另一条的数据。结果:0-30% 吞吐提升,延迟完全不可预测。

Vera 空间多线程:Olympus 核心足够宽,物理分两个线程槽。单线程模式时全部资源给一条线程,兄弟线程只跑后台管理。双线程模式时资源物理平分,互不干扰。结果:接近 100% 吞吐提升,延迟完全可预测。

为什么确定性延迟对 Agentic AI 是刚需?

一个 Rubin GPU 集群每秒烧几千美元。如果 CPU 线程竞争导致 Kernel Launch 抖动 30ms——1 个 GPU 空转 → 72 个 GPU 一起等(NVL72 紧耦合)→ 1 次抖动 = 2.16 GPU-秒浪费。每天几千次 = 几万 GPU-秒。空间多线程把这种不确定性归零。x86 SMT 可以提供接近的平均延迟,但无法消除尾延迟。


SCF 互联与 SOCAMM2 内存子系统

SCF(Scalable Coherency Fabric)是 Vera 的片上骨干:3.4 TB/s 对分带宽,164 MB 统一 L3,所有 88 核在单片 Die 上,无跨 Die NUMA。

SOCAMM2 LPDDR5X 是 Vera 在内存形态上的关键创新:LPDDR 的低功耗和高带宽(1.2 TB/s)+ DIMM 的可维护性 + 企业级 RAS(ECC/内存镜像/rank sparing)。之前这三个需求互斥(LPDDR 必须焊死才能维持短电气路径),NVIDIA 通过模块化设计突破了这个限制。


双路单 NUMA:和 Chiplet 路线说再见

x86 双路服务器的 NUMA 地狱:Socket 0 内 2-4 NUMA + Socket 1 内 2-4 NUMA = 总共 4-8 个 NUMA 域。线程放哪、内存在哪、I/O 走哪——需要专门的性能工程师。

Vera 的方案:每个 Socket单 NUMA 域(单片 Die 的自然结果),双路 = 两个 NUMA 域。NVLink-C2C Gen 2 做 Socket 间互联。NVIDIA 博客原话:“avoids the die-hop latency and variability common in fragmented chiplet designs”。软件优先。


性能:1.8× Agent 负载提升

博客 Figure 6:“Vera CPU delivers up to 1.8x higher performance on agentic workloads”。

注意限定词:“up to”——最好情况。“agentic workloads”——Python 执行、代码编译、工具驱动路径,不是 SPEC 整数。“loaded single-thread performance”——全 socket 跑满 176 线程时的单线程性能,不是单核空跑峰值。

这个指标比单核峰值难得多:88 个核心同时争抢 L3、内存带宽、SCF 对分带宽。单核的邻居越多,单核越难维持高性能。Vera 在这个场景下比 Grace 好 1.8 倍。


我的几个判断

第一,Olympus 自研核心是 NVIDIA CPU 战略的梭哈时刻。Grace 是试水(ARM 公版 + NVLink 包装),Vera 是全栈自研——核心、互联、内存、NUMA 全部自己定义。这个跨越相当于 AMD 从 Bulldozer 到 Zen。

第二,神经预测器 + 价值预测 + 图预取器一起出现,说明 NVIDIA 对 Agent 负载做了深度 profiling。不是"比 x86 快 10%“,而是"x86 架构在 Agent 负载上有 30-50% 的无用功”。这三个技术没有一个是传统服务器 CPU 的标配。

第三,单片 Die 短期很对,长期有天花板。88 核是物理极限。SCF 正在为未来多 Die 扩展做准备。Vera-next(2028?)必须面对 Chiplet 问题——那时 Rubin GPU 的计算密度又翻了一倍。

第四,NVLink-C2C 1.8TB/s 是 x86 翻不过去的结构性壁垒。不是技术问题,是商业模式——Intel 和 AMD 不可能为 NVIDIA 定制 CPU-GPU 一致性互联协议。

第五,白皮书里的 SPEC 分数才是硬验证。博客是架构叙事,1.8× 是定性结论。等拿到白皮书原文我会补上 SPEC 分析。


发布时间:2026年7月22日来源:NVIDIA Developer Blog “Inside NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Threaded Performance in Agentic AI” (2026.7.21)、NVIDIA Vera CPU Architecture Whitepaper

http://www.cnnetsun.cn/news/3595109.html

相关文章:

  • 《天灵诀》手游正版下载与安全验证全攻略
  • Linux操作系统C盘扩容方式
  • 从工具提效到智能原生:中国企业 AI 转型的四级进阶体系与标杆实践
  • UE4物体操控核心:空间转换、旋转处理与性能优化实战
  • 根治英伟达显卡驱动崩溃损坏问题(亲测有效)
  • 4小时原则,杀死了我的SCI拖延症
  • 肌电数据处理实战06:膝关节康复动作的真实 sEMG 姿态评估
  • C++20项目构建实战:Conan包管理器与现代工具链配置指南
  • JavaScript高效开发:核心技巧与性能优化
  • AI写作论文生成器:技术架构与2026年TOP5工具评测
  • 战神book本地部署ollama+千问
  • PyCharm脱机连接Oracle数据库实战指南
  • TI HTU模块实战:双缓冲与静默请求实现N2HET定时器高效DMA传输
  • 别再做PPT牛马了!2026年6款AI生成PPT工具横评,百度文库断层第一
  • 从Cursor迁移到Qoder NEXT踩了5个坑——AI编程工具换了才发现“水土不服“比想象的多
  • C++ WebRTC WHEP客户端开发:资源管理与多线程同步实战
  • 上课记不完还不会整理?2026新学期课堂记录工具对比评测供你参考
  • 鸿蒙 ArkTS 实战:Monthly Shift Roster 从月度排班表到班次安排应用完整解析
  • 多语言句子嵌入与LiRA框架:跨语言内容可靠性审计实战指南
  • ADSL Clear EOC信道工程解析与CPE远程管理方案设计
  • MQTT客户端性能深度排查:C语言实现时延波动的根源与优化实践
  • 2026年量化最小流程,先验证再扩展复杂功能
  • Openwrt软路由在Vmware环境的搭建
  • 口碑好的氮化硅陶瓷供应商
  • 成人职业培训机构招生黑洞:SaaS系统选错一次学员流失率飙升30%
  • Linux的几个简单命令
  • 面向无电流传感的谐振型 DAB 变换器 MPC 控制策略及性能分析(Simulink仿真实现)
  • 解决华为eNSP错误代码40与VirtualBox虚拟网卡缺失问题
  • Kimi K3模型思维链95.5%为英文:跨语言推理机制解析
  • 代码大模型微调、部署与应用实战——以Qwen与DeepSeek为例