Infraestructura de IA

NVIDIA lleva Groq 3 LPX a producción mientras los agentes de IA exigen más que GPUs

NVIDIA dijo que Groq 3 LPX ya está en producción completa y extiende Vera Rubin con generación de tokens más rápida para cargas de IA agentiva y de largo contexto.

Publicado Actualizado
NVIDIAInferencia de IAIA agentiva

NVIDIA llevó Groq 3 LPX a producción completa y usó la conferencia Hot Chips para presentar la inferencia como el próximo gran límite de la fábrica de IA. La compañía dijo el 24 de agosto que el acelerador interactivo extiende su plataforma Vera Rubin NVL72 al aumentar de forma notable la velocidad de generación de tokens para sistemas agentivos. El mensaje es claro: la próxima fase de infraestructura de IA no se medirá solo por entrenar modelos más grandes, sino por hacer que los modelos desplegados lean contexto largo, razonen y respondan sin demoras.

Groq 3 LPX apunta a un problema concreto de la inferencia moderna. Los agentes de IA pueden trabajar a través de cientos o miles de pasos: leer archivos, llamar herramientas, comprobar resultados, escribir código, revisar planes y repetir el ciclo. Cada paso consume tokens, sobre todo cuando el modelo mantiene una ventana de contexto extensa. Las GPUs siguen siendo fuertes en muchas partes del trabajo, pero NVIDIA sostiene que la fase de generación necesita aceleración especializada cuando la capacidad de respuesta y el costo por token se vuelven cuellos de botella comerciales.

En los resultados citados por NVIDIA, Groq 3 LPX alcanzó unos 3.400 tokens de salida por segundo ejecutando el modelo abierto Gemma 4 31B con un contexto de 100.000 tokens. La empresa lo describió como el rendimiento más rápido registrado para ese modelo y afirmó que ofrece cerca de cuatro veces más respuesta que la alternativa más cercana en cargas sensibles a la latencia. Los benchmarks de proveedor requieren cautela, pero muestran por qué la inferencia se separa como problema de diseño distinto al entrenamiento.

El producto también muestra la estrategia de NVIDIA después de licenciar tecnología de inferencia de Groq y contratar talento relacionado con esa compañía. Groq 3 LPX está pensado para trabajar junto a los racks Vera Rubin, no para reemplazar las GPUs. La arquitectura refleja una idea de desagregación: el procesamiento de contexto largo, la generación de tokens, la red y el almacenamiento se asignan a componentes optimizados para cada fase y se diseñan como un solo sistema.

Nebius fue nombrado por NVIDIA como el primer proveedor de nube de IA que adoptará la plataforma, con planes de llevar Groq 3 LPX a su servicio Token Factory. Groq también aparece entre los primeros adoptantes previstos. Esa disponibilidad en la nube importa porque convierte un anuncio de chip en algo que los desarrolladores pueden probar. Si las empresas acceden a inferencia de agentes más rápida mediante APIs conocidas, los primeros efectos podrían verse en agentes de programación, asistentes de investigación, soporte automatizado y herramientas de flujo de trabajo.

La noticia llega en un momento de mayor escrutinio sobre el gasto en IA. Las empresas han invertido enormes sumas en clústeres de entrenamiento y centros de datos, pero muchas cargas prácticas se ejecutan de forma continua después del despliegue. Cada pregunta de un usuario y cada paso de un agente generan costo. Menor latencia y menor precio por token son por tanto cuestiones de negocio, no solo de ingeniería. La producción de Groq 3 LPX indica que la competencia de hardware de IA está pasando de construir cerebros más grandes a hacer que la inteligencia desplegada sea lo bastante rápida para usarse todo el día.