从 2023 年 Grace 首发到 2026 年 Vera 量产,NVIDIA 基于 Arm 架构打造 专为 AI 工厂优化的数据中心 CPU。以 NVLink-C2C 实现 CPU-GPU 内存一致性紧耦合, 用高能效 LPDDR5X 和空间多线程为 Agentic AI 提供高密度编排能力。
NVIDIA 不追求传统 x86 CPU 的通用性能竞赛,而是围绕 AI 工厂需求, 打造 CPU-GPU 紧耦合、高能效、专为 Agent 编排优化的处理器。
NVIDIA CPU 不与 AMD/Intel 在传统通用服务器市场正面竞争,而是作为 AI 工厂的配套组件: 单看 CPU 单体性能并非顶尖,但通过 NVLink-C2C 与 GPU 共享统一内存地址空间, 端到端 AI 工作流性能显著高于传统 PCIe 分立方案。主要用于 AI 训练推理主机、 Agent 编排、强化学习环境、数据预处理等 GPU 伴生负载。
所有参数均来自 NVIDIA 官方文档与 GTC 公开技术资料,未做推测性夸大。
2023 量产 · Arm Neoverse V2 · 4nm 工艺 · 开创 CPU-GPU 紧耦合
单芯片 72 个 Arm Neoverse V2 核心,支持 Armv8.6-A 指令集。 每核心 4 条 128 位 SVE2 向量管线,可配置为 2×256 位执行。 每核 64KB L1 指令 + 64KB L1 数据缓存,L2 缓存每核 1MB。 双芯 Superchip 共 144 核,FP64 峰值 7.1 TFLOPS。
业界首款服务器级 LPDDR5X 内存子系统,单芯片提供 500GB/s 带宽, 整个内存子系统功耗仅约 16W,约为传统 DDR5 方案的 1/5。 单芯片最大支持 480GB LPDDR5X,双芯 Superchip 共 960GB。 相同功耗下内存带宽是传统 x86 方案的 2 倍。
芯片间一致性互联总线,双向带宽 900GB/s。 两颗 Grace 可组成 Superchip,或 Grace 与 Hopper GPU 直接相连。 CPU 与 GPU 共享统一内存地址空间,应用可透明访问显存, 无需显式 PCIe 拷贝,大幅降低 AI 数据传输开销。
NVIDIA 自研网状一致性互联架构,片上二分带宽 3.2TB/s,是传统 CPU 环总线的 2 倍。 采用分布式缓存目录设计,72 核大规模下仍保持一致的内存访问延迟。
单芯片提供 4 条 PCIe Gen5 x16,双芯 Superchip 共 8 条。 双芯版本 TDP 约 500W,单芯片约 300W 级。 支持 Arm 标准软件生态,主流 Linux 发行版和容器运行时均可运行。
NVIDIA 自研 Olympus 核心 · 专为 Agentic AI 设计
88 个 NVIDIA 自研 Olympus 核心,完整 Armv9.2 兼容。 每核心 6 条 128 位 SVE2 向量管线,原生支持 FP8 数据类型。 采用 NVIDIA 空间多线程技术,每核双线程,共 176 并发线程。 48 指令解码队列,中速缓存 96KB,单芯片 164MB 统一 L3 缓存。
内存带宽提升至 1.2TB/s,相对 Grace 提升 140%。 延续 LPDDR5X 低功耗特性,相同带宽下功耗远低于 DDR5/MRDIMM 方案。 为 Agent 大规模并发、多实例沙箱、数据预处理提供充足带宽。
双向带宽提升至 1.8TB/s,是 PCIe Gen6 的 7 倍。 支持与 Rubin GPU 组成 Vera Rubin 超级芯片, 也支持双路 Vera CPU 缓存一致性互联。 硬件支持安全隔离,敏感数据和代码可在可信域内执行。
Vera 的设计目标不是单线程通用性能,而是让 AI 工厂中的 GPU 保持满负荷运转。 针对编译器、运行时引擎、分析管道、Agent 工具调用、编排服务等 CPU 密集型步骤优化, 减少 Agent 等待 CPU 的时间。支持 Arm MPAM 内存资源分区,多租户环境下性能可预测。 官方数据显示,相同功耗下 Vera 处理 Agent 编排任务的速度为传统 x86 方案的 2 倍。
CPU 不单独售卖,而是与 GPU/网络组成完整 AI 工厂模块
2× Grace = 144 Neoverse V2 核,960GB LPDDR5X,900GB/s C2C。HPC、云原生、科学计算。
Grace + H100 GPU,900GB/s C2C 互联,统一内存地址空间。大模型训练推理经典配置。
Grace + B100/B200 GPU,延续第一代 C2C。Blackwell 世代过渡产品。
88 Olympus 核,1.2TB/s LPDDR5X,支持双路。Agent 编排、强化学习环境、AI 预处理。
Vera + Rubin GPU,1.8TB/s 第二代 C2C。2026 下半年 Rubin 平台标准配置。
72 Rubin GPU + 36 Vera CPU + ConnectX-9 + BlueField-4。整机架 AI 工厂,液冷设计。
NVIDIA CPU 的核心竞争力不在于核数或频率,而在于系统级协同与 AI 工作流端到端优化。
NVIDIA 自研芯片到芯片一致性总线,是 CPU-GPU 紧耦合的核心技术。 与 PCIe 分立方案不同,C2C 让 CPU 和 GPU 处于同一个缓存一致性域, 指针可在两端自由传递,无需显式内存拷贝。
AI 实际收益: 大模型推理中 CPU 侧调度、KV-Cache 管理、数据预处理结果可直接被 GPU 访问, 消除 PCIe 拷贝瓶颈,端到端吞吐量提升 30-50%(NVIDIA 官方 GH200 对比数据)。
NVIDIA 率先将移动端 LPDDR 技术引入服务器,用功耗换带宽密度。 不追求最低延迟,而是追求每瓦带宽和 TB/s 级总带宽, 正好匹配 AI 工作流中顺序大块数据访问的特征。
注意: LPDDR5X 单线程访问延迟高于传统 DDR5,不适合纯通用计算和延迟敏感型企业应用。 优势在于带宽和功耗,适合 AI 伴生负载、多线程并发、流式数据处理。
Arm 可变长度向量扩展,NVIDIA CPU 的主要 SIMD 加速单元。 不同于 x86 AVX-512 的固定宽度,SVE2 以 128 位为粒度可组合, 编译器自动向量化友好,在 AI 预处理、特征工程中表现良好。
说明: SVE2 没有 x86 AMX/AVX-512 那样的专用矩阵引擎, CPU 本身不承担重矩阵计算——这部分由 GPU 完成。 SVE2 主要用于数据预处理、字符串处理、特征转换、Agent 工具执行。
Vera 引入的 NVIDIA 自研多线程技术,类似传统 SMT/超线程, 但在微架构层面做了空间分区,减少线程间资源竞争。 为多租户 AI 工厂、大量并发 Agent 沙箱优化。
设计取舍: 单线程峰值性能不是目标,而是在大量并发小任务场景下 提供可预测的吞吐量。配合 Arm MPAM 内存资源隔离, 多租户环境下性能抖动远小于传统超线程方案。
数据基于 NVIDIA 官方发布,仅展示相对指标,不做跨厂商绝对性能对比。 注意:NVIDIA CPU 价值体现在端到端系统,而非单体 CPU 跑分。
Grace 对比同期 x86 旗舰,同功耗下通用性能约 2 倍
Vera ↔ Rubin 芯片间一致性带宽,远高于 PCIe
LPDDR5X 每瓦带宽相对传统 DDR5 的倍数
单颗 Vera CPU 支持的硬件并发线程
NVIDIA CPU 基于标准 Arm 架构,软件生态成熟,AI 栈全栈优化。
NVIDIA 官方目前仅公开了 Grace (2023) 和 Vera (2026) 两代 CPU, 下一代 CPU 将与 Rubin 之后的 GPU 平台配套,尚未公布正式名称和参数。 与 AMD/Intel 每年一代的节奏不同,NVIDIA CPU 随 GPU 平台节奏更新, 约 3 年一代,每代重点提升 C2C 带宽、内存带宽和 Agent 并发能力, 而非单纯追逐核数和通用 IPC。所有 CPU 均围绕 AI 工厂整体架构设计, 不单独进入通用服务器市场竞争。