Arm 架构 · AI 工厂 · CPU-GPU 紧耦合

NVIDIA CPU Grace → Vera AI 演进

从 2023 年 Grace 首发到 2026 年 Vera 量产,NVIDIA 基于 Arm 架构打造 专为 AI 工厂优化的数据中心 CPU。以 NVLink-C2C 实现 CPU-GPU 内存一致性紧耦合, 用高能效 LPDDR5X 和空间多线程为 Agentic AI 提供高密度编排能力。

2代
Grace → Vera 架构演进
1.8TB/s
Vera NVLink-C2C 双向带宽
88核
Vera Olympus 自研核心
7x
比 PCIe Gen6 快 7 倍

产品演进总览

NVIDIA 不追求传统 x86 CPU 的通用性能竞赛,而是围绕 AI 工厂需求, 打造 CPU-GPU 紧耦合、高能效、专为 Agent 编排优化的处理器。

G1
2023 - Grace

第一代 Arm 服务器 CPU

  • • 72 × Arm Neoverse V2
  • • 4×128b SVE2 / 核
  • • LPDDR5X 500GB/s
  • • NVLink-C2C 900GB/s
V2
2026 - Vera 当前

第二代 Olympus 自研核

  • • 88 × 自研 Olympus 核
  • • 6×128b SVE2 + FP8
  • • LPDDR5X 1.2TB/s
  • • NVLink-C2C 1.8TB/s
R
机架级系统

Vera Rubin NVL72

  • • 72 × Rubin GPU
  • • 36 × Vera CPU
  • • 256 CPU 独立机架
  • • ConnectX-9 + BlueField-4

定位说明

NVIDIA CPU 不与 AMD/Intel 在传统通用服务器市场正面竞争,而是作为 AI 工厂的配套组件: 单看 CPU 单体性能并非顶尖,但通过 NVLink-C2C 与 GPU 共享统一内存地址空间, 端到端 AI 工作流性能显著高于传统 PCIe 分立方案。主要用于 AI 训练推理主机、 Agent 编排、强化学习环境、数据预处理等 GPU 伴生负载。

产品深度解析

所有参数均来自 NVIDIA 官方文档与 GTC 公开技术资料,未做推测性夸大。

G1

Grace / 第一代数据中心 CPU

2023 量产 · Arm Neoverse V2 · 4nm 工艺 · 开创 CPU-GPU 紧耦合

核心与向量单元

单芯片 72 个 Arm Neoverse V2 核心,支持 Armv8.6-A 指令集。 每核心 4 条 128 位 SVE2 向量管线,可配置为 2×256 位执行。 每核 64KB L1 指令 + 64KB L1 数据缓存,L2 缓存每核 1MB。 双芯 Superchip 共 144 核,FP64 峰值 7.1 TFLOPS。

LPDDR5X 高能效内存

业界首款服务器级 LPDDR5X 内存子系统,单芯片提供 500GB/s 带宽, 整个内存子系统功耗仅约 16W,约为传统 DDR5 方案的 1/5。 单芯片最大支持 480GB LPDDR5X,双芯 Superchip 共 960GB。 相同功耗下内存带宽是传统 x86 方案的 2 倍。

NVLink-C2C 第一代

芯片间一致性互联总线,双向带宽 900GB/s。 两颗 Grace 可组成 Superchip,或 Grace 与 Hopper GPU 直接相连。 CPU 与 GPU 共享统一内存地址空间,应用可透明访问显存, 无需显式 PCIe 拷贝,大幅降低 AI 数据传输开销。

SCF 可扩展一致性光纤

NVIDIA 自研网状一致性互联架构,片上二分带宽 3.2TB/s,是传统 CPU 环总线的 2 倍。 采用分布式缓存目录设计,72 核大规模下仍保持一致的内存访问延迟。

IO 与平台

单芯片提供 4 条 PCIe Gen5 x16,双芯 Superchip 共 8 条。 双芯版本 TDP 约 500W,单芯片约 300W 级。 支持 Arm 标准软件生态,主流 Linux 发行版和容器运行时均可运行。

V2

Vera / 第二代数据中心 CPU 2026 量产

NVIDIA 自研 Olympus 核心 · 专为 Agentic AI 设计

Olympus 自研核心

88 个 NVIDIA 自研 Olympus 核心,完整 Armv9.2 兼容。 每核心 6 条 128 位 SVE2 向量管线,原生支持 FP8 数据类型。 采用 NVIDIA 空间多线程技术,每核双线程,共 176 并发线程。 48 指令解码队列,中速缓存 96KB,单芯片 164MB 统一 L3 缓存。

第二代 LPDDR5X 内存

内存带宽提升至 1.2TB/s,相对 Grace 提升 140%。 延续 LPDDR5X 低功耗特性,相同带宽下功耗远低于 DDR5/MRDIMM 方案。 为 Agent 大规模并发、多实例沙箱、数据预处理提供充足带宽。

第二代 NVLink-C2C

双向带宽提升至 1.8TB/s,是 PCIe Gen6 的 7 倍。 支持与 Rubin GPU 组成 Vera Rubin 超级芯片, 也支持双路 Vera CPU 缓存一致性互联。 硬件支持安全隔离,敏感数据和代码可在可信域内执行。

专为 Agentic AI 优化

Vera 的设计目标不是单线程通用性能,而是让 AI 工厂中的 GPU 保持满负荷运转。 针对编译器、运行时引擎、分析管道、Agent 工具调用、编排服务等 CPU 密集型步骤优化, 减少 Agent 等待 CPU 的时间。支持 Arm MPAM 内存资源分区,多租户环境下性能可预测。 官方数据显示,相同功耗下 Vera 处理 Agent 编排任务的速度为传统 x86 方案的 2 倍。

产品形态与超级芯片组合

CPU 不单独售卖,而是与 GPU/网络组成完整 AI 工厂模块

CPU Only

Grace CPU Superchip

2× Grace = 144 Neoverse V2 核,960GB LPDDR5X,900GB/s C2C。HPC、云原生、科学计算。

CPU+GPU

Grace Hopper Superchip

Grace + H100 GPU,900GB/s C2C 互联,统一内存地址空间。大模型训练推理经典配置。

CPU+GPU

Grace Blackwell Superchip

Grace + B100/B200 GPU,延续第一代 C2C。Blackwell 世代过渡产品。

CPU Only

Vera CPU

88 Olympus 核,1.2TB/s LPDDR5X,支持双路。Agent 编排、强化学习环境、AI 预处理。

CPU+GPU

Vera Rubin Superchip

Vera + Rubin GPU,1.8TB/s 第二代 C2C。2026 下半年 Rubin 平台标准配置。

机架级

Vera Rubin NVL72

72 Rubin GPU + 36 Vera CPU + ConnectX-9 + BlueField-4。整机架 AI 工厂,液冷设计。

核心技术深度解析

NVIDIA CPU 的核心竞争力不在于核数或频率,而在于系统级协同与 AI 工作流端到端优化。

NVLink-C2C 一致性互联

NVIDIA 自研芯片到芯片一致性总线,是 CPU-GPU 紧耦合的核心技术。 与 PCIe 分立方案不同,C2C 让 CPU 和 GPU 处于同一个缓存一致性域, 指针可在两端自由传递,无需显式内存拷贝。

第一代 (Grace) 900 GB/s 双向
第二代 (Vera) 1.8 TB/s 双向
对比 PCIe Gen6 x16 ~ 7 倍带宽优势

AI 实际收益: 大模型推理中 CPU 侧调度、KV-Cache 管理、数据预处理结果可直接被 GPU 访问, 消除 PCIe 拷贝瓶颈,端到端吞吐量提升 30-50%(NVIDIA 官方 GH200 对比数据)。

LPDDR5X 高能效内存

NVIDIA 率先将移动端 LPDDR 技术引入服务器,用功耗换带宽密度。 不追求最低延迟,而是追求每瓦带宽和 TB/s 级总带宽, 正好匹配 AI 工作流中顺序大块数据访问的特征。

Grace 500 GB/s,内存子系统功耗 ~16W,每瓦带宽 ~31 GB/s/W
Vera 1.2 TB/s,延续 LPDDR5X 低功耗特性,每瓦带宽进一步提升
对比 传统 DDR5-4800 每瓦带宽约 5-6 GB/s/W,能效差 5 倍以上

注意: LPDDR5X 单线程访问延迟高于传统 DDR5,不适合纯通用计算和延迟敏感型企业应用。 优势在于带宽和功耗,适合 AI 伴生负载、多线程并发、流式数据处理。

SVE2 向量扩展

Arm 可变长度向量扩展,NVIDIA CPU 的主要 SIMD 加速单元。 不同于 x86 AVX-512 的固定宽度,SVE2 以 128 位为粒度可组合, 编译器自动向量化友好,在 AI 预处理、特征工程中表现良好。

Grace V2 核心
4 × 128b SVE2 / 核
Vera Olympus
6 × 128b SVE2 / 核 + FP8

说明: SVE2 没有 x86 AMX/AVX-512 那样的专用矩阵引擎, CPU 本身不承担重矩阵计算——这部分由 GPU 完成。 SVE2 主要用于数据预处理、字符串处理、特征转换、Agent 工具执行。

空间多线程 (SMT)

Vera 引入的 NVIDIA 自研多线程技术,类似传统 SMT/超线程, 但在微架构层面做了空间分区,减少线程间资源竞争。 为多租户 AI 工厂、大量并发 Agent 沙箱优化。

Grace 72 核 / 72 线程,无多线程
Vera 88 核 / 176 线程,空间多线程

设计取舍: 单线程峰值性能不是目标,而是在大量并发小任务场景下 提供可预测的吞吐量。配合 Arm MPAM 内存资源隔离, 多租户环境下性能抖动远小于传统超线程方案。

AI 相关性能特征

数据基于 NVIDIA 官方发布,仅展示相对指标,不做跨厂商绝对性能对比。 注意:NVIDIA CPU 价值体现在端到端系统,而非单体 CPU 跑分。

~2x

相同功耗性能

Grace 对比同期 x86 旗舰,同功耗下通用性能约 2 倍

1.8TB/s

C2C 互联带宽

Vera ↔ Rubin 芯片间一致性带宽,远高于 PCIe

~5x

内存能效优势

LPDDR5X 每瓦带宽相对传统 DDR5 的倍数

176

并发线程数

单颗 Vera CPU 支持的硬件并发线程

性能说明与边界

  • 优势场景:AI 训练/推理主机节点、GPU 伴生负载、Agent 编排调度、强化学习环境、大规模并发容器、HPC 能效敏感场景。
  • 不适用场景:传统企业通用计算、延迟敏感型数据库、单线程极限性能、未适配 Arm 的传统商业软件、需要最高单核频率的负载。
  • CPU 单体性能不是 NVIDIA 的追求,核心价值在于 NVLink-C2C 带来的 CPU-GPU 统一内存域和整机架 AI 工厂协同。

软件生态与部署

NVIDIA CPU 基于标准 Arm 架构,软件生态成熟,AI 栈全栈优化。

软件支持

  • Arm v8.6/v9.2 标准指令集,主流 Linux 发行版(RHEL、Ubuntu、SUSE)原生支持
  • 容器生态完整,Docker、Kubernetes、containerd 均有 Arm 版本
  • NVIDIA CUDA 栈完全透明,GPU 代码无需修改即可在 Grace/Vera 主机运行
  • AI 框架 PyTorch、TensorFlow、vLLM、Triton 均原生支持 Arm + CUDA
  • GCC、LLVM 编译器对 SVE2 自动向量化支持成熟

部署形态

  • HGX/DGX 系统:Grace Hopper/Blackwell/Vera Rubin 超级芯片,AI 训练推理标配
  • MGX 模块化服务器:支持纯 CPU 机型(Grace/Vera CPU),用于 AI 工厂编排节点
  • NVL72 机架级:Vera Rubin 整机架交付,72 GPU + 36 CPU 预集成液冷
  • 云实例:AWS、GCP、Azure、Oracle 均已提供 Grace 实例,Vera 实例 2026 下半年上线
  • CPU 独立机架:256 颗 Vera CPU 独立机架,用于大规模 Agent 执行和强化学习

路线图说明

NVIDIA 官方目前仅公开了 Grace (2023) 和 Vera (2026) 两代 CPU, 下一代 CPU 将与 Rubin 之后的 GPU 平台配套,尚未公布正式名称和参数。 与 AMD/Intel 每年一代的节奏不同,NVIDIA CPU 随 GPU 平台节奏更新, 约 3 年一代,每代重点提升 C2C 带宽、内存带宽和 Agent 并发能力, 而非单纯追逐核数和通用 IPC。所有 CPU 均围绕 AI 工厂整体架构设计, 不单独进入通用服务器市场竞争。