Nvidia 推出搭载超大内存的新 AI 芯片,适合大规模模型训练和推理。硬件升级为开发者提供更强计算基础。
突破性设计,专为超大规模 AI 和 HPC 应用打造。
NVIDIA GH200 Grace Hopper™ Superchip 是一款从零开始设计的突破性处理器,面向超大规模 AI 和高性能计算(HPC)应用。对于需要处理数 TB 数据的应用,这款 Superchip 可提供最高 10 倍的性能提升,帮助科学家和研究人员以前所未有的方式解决世界上最复杂的难题。
GH200 Grace Hopper Superchip 通过 NVIDIA NVLink™-C2C 将 NVIDIA Grace™ 与 Hopper™ 架构结合起来,为加速 AI 和 HPC 应用提供 CPU+GPU 一致性内存模型。其一致性接口带宽达到每秒 900 GB(GB/s),速度是 PCIe Gen5 的 7 倍。借助 HBM3 和 HBM3e GPU 内存,它能够大幅提升加速计算和生成式 AI 的性能。GH200 支持运行 NVIDIA 的全部软件栈和平台,包括 NVIDIA AI Enterprise、HPC SDK 和 Omniverse™。
GH200 目前已经上市。
NVIDIA GH200 NVL2 通过 NVLink 将两颗 GH200 Superchip 完全互联,可提供最高 288GB 高带宽内存、每秒 10 TB(TB/s)内存带宽以及 1.2TB 高速内存。GH200 NVL2 目前已经上市。对于计算和内存密集型工作负载,在单台服务器中,它可提供相较 NVIDIA H100 Tensor Core GPU 最高 3.5 倍的 GPU 内存容量和 3 倍的带宽。
NVIDIA GH200 Superchip 使用 NVLink-C2C,将基于 Arm® 的 Grace CPU 与 Hopper GPU 架构结合起来,正在加速全球超级计算机上的科学研究与发现。采用 NVIDIA Grace Hopper Superchip 的超级计算机合计可提供 200 exaflops,即每秒 20 万亿亿次计算的高能效 AI 处理能力。
随着存储与网络带宽不断取得进展,加之摩尔定律走向终结,分析和查询的瓶颈已经转移到 CPU。借助 GH200,CPU 和 GPU 可共享同一张进程级页表,使所有 CPU 和 GPU 线程都能访问系统分配的全部内存,无论这些内存实际位于 CPU 还是 GPU 的物理内存中。GH200 不再需要在 CPU 和 GPU 之间来回复制内存,可将数据处理速度提升最高 36 倍。
检索增强生成(RAG)将大语言模型(LLM)与知识库连接起来,以提高模型准确性。RAG 需要大规模生成 embeddings 并执行向量搜索。72 个高能效、基于 Arm 的 Grace CPU 核心可加速知识库数据的预处理,而 NVLink-C2C 将预处理后的数据传输至 Hopper GPU 的速度比 PCIe 快 7 倍,从而让 embedding 生成过程提速 30 倍。
图神经网络(GNN)广泛应用于社交网络分析、药物发现、欺诈检测和分子化学等领域。GH200 利用最高 624GB 的 CPU 与 GPU 组合高速内存、H200 GPU 的 4 petaFLOPS 算力,以及带宽为 900 GB/s 的 NVLink-C2C,与 H100 PCIe GPU 相比,可将 GNN 训练速度提升最高 8 倍。
在这个演示中,你将体验 NVIDIA GH200 Grace Hopper Superchip 与 NVIDIA 软件栈的无缝集成。其中包含交互式演示、实际应用和案例研究,包括 LLM。
NVIDIA MGX™ 是一种模块化参考设计,可用于加速多种企业工作负载。MGX 将 GH200 Superchip 的先进能力与 NVIDIA BlueField®-3 DPU、由 OEM 定义的输入/输出(IO)以及第四代 NVLink 集成在一起,为现代数据中心提供量身定制的解决方案。
NVIDIA 通过性能调优指南、开发者工具和库,为 NVIDIA Grace 提供深入支持。