AI 인프라
NVIDIA, NVLink Fusion과 NVHBM으로 커스텀 AI 가속기 생태계 공략
NVIDIA는 NVLink Fusion과 NVHBM을 통해 하이퍼스케일러와 AI 네이티브 기업의 커스텀 XPU를 랙 규모 AI 인프라에 통합하려 한다.
NVIDIA가 커스텀 AI 가속기를 만드는 기업을 겨냥한 새 인프라 전략을 자세히 공개했다. 핵심은 NVLink Fusion과 NVHBM이라는 메모리 기술의 결합이다. 8월 26일 기술 게시물은 AI 하드웨어 시장의 긴장을 다룬다. 하이퍼스케일러와 AI 네이티브 기업은 점점 더 특정 워크로드에 최적화된 XPU를 원하지만, 이런 칩이 성숙한 GPU 인프라와 경쟁하려면 고대역폭 메모리, 랙 규모 통신, 소프트웨어 지원, 운영 통합이 필요하다.
NVLink Fusion은 커스텀 XPU와 CPU를 NVIDIA AI 인프라 플랫폼에 연결하는 기술이다. 반맞춤형 가속기가 NVIDIA의 scale-up 및 scale-out 기술 스택, MGX 랙 아키텍처, broader ecosystem을 활용하도록 하는 것이 목표다. 이는 전략적으로 중요하다. AI 칩 시장은 분화되고 있으며, 대형 연구소와 클라우드 사업자는 전용 실리콘을 원한다. 그러나 그 칩들도 빠른 랙 내 통신에 의존하는 대규모 훈련, 추론, expert parallel workload에 참여해야 한다.
NVHBM은 패키지 수준의 문제를 다룬다. NVIDIA는 이를 주요 메모리 공급사와 설계하고 검증한 커스텀 HBM base-die 기술로 설명한다. 회사가 제시한 이점은 표준 HBM4e 대비 최대 30% 높은 메모리 대역폭, 추가 XPU 기능을 위한 최대 25% 더 많은 compute die area, 최대 15% 낮은 HBM 전력 사용량이다. NVIDIA는 또한 이 설계가 JEDEC HBM4e와 비교해 PHY 및 지원 영역을 최대 67% 줄여 계산 또는 다른 가속기 로직을 위한 패키지 공간을 더 확보한다고 밝혔다.
이 수치가 중요한 이유는 현대 AI 시스템이 산술 처리량만이 아니라 데이터 이동에 자주 제한되기 때문이다. 대형 모델 추론은 낮은 지연 시간으로 사용자에게 응답하면서 모델 가중치와 KV cache를 반복해서 읽는다. 훈련과 에이전트형 워크로드는 특히 mixture-of-experts 모델에서 expert parallelism을 사용할 때 활성값을 장치 사이로 이동시킨다. 더 큰 메모리 대역폭은 계산 엔진에 데이터를 계속 공급하고, 낮은 메모리 전력은 대규모 랙의 전력 및 냉각 압박을 줄인다.
NVIDIA는 NVHBM을 커스텀 실리콘 팀에 더 많은 설계 유연성을 주는 도구로도 설명한다. 가속기 설계자는 제한된 면적을 matrix engine, vector unit, cache, SRAM, memory interface, networking, control logic 사이에 배분해야 한다. 메모리 인터페이스 면적을 줄이면 같은 물리 패키지 안에서 워크로드 전용 기능에 더 많은 공간을 줄 수 있다. 추론 최적화 XPU를 만드는 클라우드 사업자에게는 이런 유연성이 원시 대역폭만큼 중요할 수 있다.
랙 규모 연결 논리도 핵심이다. NVIDIA는 NVLink Fusion이 chiplet 기반 연결을 사용해 커스텀 XPU를 NVLink domain에 브리지하고, 가속기들이 공유 scale-up fabric에서 통신하며 NVLink-C2C로 CPU에 연결될 수 있다고 설명한다. Mixture-of-experts 서빙에서는 토큰이 서로 다른 장치의 전문가로 라우팅될 수 있으므로, 이런 fabric은 시스템이 하나의 조정된 기계처럼 움직이는지 병목이 있는 칩 묶음에 그치는지를 좌우한다.
이번 발표는 방어적 의미도 있다. NVIDIA는 GPU로 AI 훈련과 추론을 지배하지만, 일부 최대 고객은 비용, 공급, 워크로드 특화를 위해 자체 칩을 설계하고 있다. NVLink Fusion과 NVHBM은 랙 안에 비GPU 실리콘이 늘어나더라도 NVIDIA가 인프라 계층으로 남을 수 있는 길을 제공한다. 고객은 가격, 가용성, 메모리 공급사 지원, 소프트웨어 성숙도, 통합 난이도, 실제 워크로드 성능으로 평가하겠지만 방향은 분명하다. AI 인프라는 GPU, 커스텀 XPU, CPU, 고대역폭 메모리, 네트워킹이 함께 설계되는 이기종 랙으로 이동하고 있다.