Infraestructura de IA

NVIDIA une NVLink Fusion y NVHBM para atraer a los creadores de aceleradores de IA

NVIDIA detalló cómo NVLink Fusion y NVHBM buscan ayudar a hyperscalers y empresas de IA a desplegar XPUs personalizadas en infraestructura a escala de rack.

Publicado Actualizado
NVIDIANVLink FusionHardware de IA

NVIDIA detalló un nuevo impulso de infraestructura dirigido a empresas que construyen aceleradores de IA personalizados, combinando NVLink Fusion con una tecnología de memoria llamada NVHBM. La publicación técnica del 26 de agosto apunta a una tensión central del mercado de hardware de IA. Los hyperscalers y las compañías nativas de IA quieren XPUs específicas para sus cargas, pero esos chips necesitan memoria de alto ancho de banda, comunicación a escala de rack, soporte de software e integración operativa para competir con una infraestructura GPU madura.

NVLink Fusion es la tecnología de conexión de NVIDIA para llevar XPUs y CPUs personalizadas a su plataforma de infraestructura de IA. La idea es permitir que aceleradores semipersonalizados usen la pila scale-up y scale-out de NVIDIA, la arquitectura de racks MGX y su ecosistema, en vez de obligar a cada comprador a construir una ruta aislada. Esto importa porque el mercado de chips de IA se fragmenta: grandes laboratorios y proveedores cloud quieren silicio especializado, pero esos chips aún deben participar en entrenamiento, inferencia y cargas de expert parallelism que dependen de comunicación rápida entre dispositivos.

NVHBM aborda el problema a nivel de paquete. NVIDIA lo describe como una tecnología de base die HBM personalizada, diseñada y validada con grandes proveedores de memoria. Los beneficios anunciados son relevantes: hasta 30% más ancho de banda de memoria que HBM4e estándar, hasta 25% más área de die de cómputo para funciones adicionales de XPU y hasta 15% menos consumo de HBM. NVIDIA también afirma que reduce el área de PHY y soporte hasta 67% frente a JEDEC HBM4e, liberando más espacio para cómputo u otra lógica de aceleración.

Esos números importan porque los sistemas modernos de IA suelen estar limitados por movimiento de datos, no solo por rendimiento aritmético. La inferencia de grandes modelos lee repetidamente pesos y KV cache mientras atiende usuarios con objetivos estrictos de latencia. El entrenamiento y las cargas agentic mueven activaciones entre dispositivos, especialmente cuando los modelos mixture-of-experts usan expert parallelism. Más ancho de banda mantiene alimentados los motores de cómputo; menor consumo de memoria mejora rendimiento por vatio y reduce presión térmica.

NVIDIA también presenta NVHBM como una forma de dar más flexibilidad a equipos de silicio personalizado. El área de paquete es una de las restricciones más difíciles en diseño de aceleradores, porque los ingenieros deben repartir espacio entre motores matriciales, unidades vectoriales, caché, SRAM, interfaces de memoria, red y lógica de control. Al reducir la huella de la interfaz de memoria, NVHBM podría permitir más área para funciones específicas de carga dentro del mismo tamaño físico.

El argumento de rack es igual de importante. NVIDIA dice que NVLink Fusion usa conectividad basada en chiplets para unir XPUs personalizadas a dominios NVLink, permitiendo comunicación en un fabric scale-up común y conexión ascendente a CPUs mediante NVLink-C2C. En inferencia mixture-of-experts, donde tokens pueden ser enviados a expertos en distintos dispositivos, ese fabric puede decidir si el sistema se comporta como una máquina coordinada o como un conjunto de chips con cuellos de botella.

El anuncio también es defensivo. NVIDIA domina entrenamiento e inferencia de IA con GPUs, pero algunos de sus mayores clientes diseñan chips propios para controlar costos, suministro y especialización. NVLink Fusion y NVHBM le dan una ruta para seguir siendo la capa de infraestructura incluso cuando un rack incluye más silicio no GPU. Los clientes juzgarán precio, disponibilidad, soporte de memoria, madurez de software, esfuerzo de integración y rendimiento real, pero la dirección es clara: la infraestructura de IA se mueve hacia racks heterogéneos co-diseñados.