AI 基础设施

NVIDIA 将 NVLink Fusion 与 NVHBM 组合,争取自定义 AI 加速器生态

NVIDIA 详细介绍 NVLink Fusion 与 NVHBM,目标是帮助云厂商和 AI 原生公司把自定义 XPU 接入机架级 AI 基础设施。

发布于 更新于
NVIDIANVLink FusionAI 硬件

NVIDIA 详细介绍了一项面向自定义 AI 加速器公司的基础设施策略,把 NVLink Fusion 与名为 NVHBM 的内存技术组合在一起。8 月 26 日的技术文章指向 AI 硬件市场的关键矛盾:云厂商和 AI 原生公司越来越希望拥有针对自身负载优化的 XPU,但这些芯片如果要与成熟 GPU 基础设施竞争,仍然需要高带宽内存、机架级通信、软件支持和运维集成。

NVLink Fusion 是 NVIDIA 用来把自定义 XPU 和 CPU 接入其 AI 基础设施平台的连接技术。它的思路是让半定制加速器使用 NVIDIA 的 scale-up 与 scale-out 技术栈、MGX 机架架构和生态系统,而不是让每个买家单独搭建孤立的基础设施路径。这具有战略意义,因为 AI 芯片市场正在分化:大型实验室和云服务商希望拥有专用硅片,但这些芯片还必须参与依赖高速机架通信的大规模训练、推理和专家并行负载。

NVHBM 解决的是封装层面的限制。NVIDIA 将其描述为与主要内存供应商共同设计和验证的自定义 HBM base-die 技术。公司给出的收益包括:相比标准 HBM4e,内存带宽最高提升 30%,为额外 XPU 功能释放最多 25% 计算裸片面积,并让 HBM 功耗最高降低 15%。NVIDIA 还称,该设计相比 JEDEC HBM4e 可将 PHY 和支持面积减少最多 67%,为计算或其他加速器逻辑释放更多封装空间。

这些数字之所以重要,是因为现代 AI 系统常常受限于数据移动,而不只是算术吞吐。大模型推理在服务用户时会不断读取模型权重和 KV 缓存数据,同时还要满足严格延迟目标。训练和智能体负载则会在设备之间移动激活值,尤其是混合专家模型使用专家并行时。更多内存带宽可以让计算引擎持续获得数据,较低内存功耗则有助于提升每瓦性能并降低成千上万块加速器的散热压力。

NVIDIA 还把 NVHBM 描述为给自定义芯片团队更多设计自由度的工具。封装面积是加速器设计中最难处理的约束之一,工程师必须在矩阵引擎、向量单元、缓存、SRAM、内存接口、网络和控制逻辑之间分配空间。通过缩小内存接口占用,NVHBM 可能让设计者在相同物理尺寸中投入更多面积给特定负载功能。对于构建推理优化 XPU 的云厂商而言,这种灵活性可能与原始带宽同样重要。

机架级论点同样关键。NVIDIA 称 NVLink Fusion 使用基于 chiplet 的连接,把自定义 XPU 桥接到 NVLink 域中,使加速器能够通过共享 scale-up fabric 通信,并通过 NVLink-C2C 向上连接 CPU。在混合专家模型服务中,token 可能被路由到不同设备上的不同专家,这类互联决定系统更像一台协调机器,还是一组被瓶颈束缚的芯片。

这项发布也带有防御意义。NVIDIA 依靠 GPU 主导 AI 训练和推理,但一些最大客户正在设计自有芯片以管理成本、供应和负载专用化。NVLink Fusion 与 NVHBM 让 NVIDIA 有机会即使在机架中出现更多非 GPU 硅片时,仍然保留基础设施层位置。客户最终会看价格、可用性、内存供应商支持、软件成熟度、集成难度和真实负载性能。但趋势已经明确:AI 基础设施正在走向异构机架,GPU、自定义 XPU、CPU、高带宽内存和网络将被共同设计。