Infrastructure IA
NVIDIA met Groq 3 LPX en production alors que les agents IA dépassent le seul GPU
NVIDIA affirme que Groq 3 LPX est désormais en production complète, avec une génération de tokens plus rapide pour les charges d’IA agentique et de long contexte.
NVIDIA a annoncé la mise en production complète de Groq 3 LPX et a utilisé la conférence Hot Chips pour présenter l’inférence comme la prochaine grande contrainte de l’usine d’IA. Le 24 août, l’entreprise a expliqué que cet accélérateur d’inférence interactif étendait sa plateforme Vera Rubin NVL72 en augmentant fortement la vitesse de génération de tokens pour les systèmes agentiques. Le message est clair: la prochaine phase de l’infrastructure IA ne se jugera pas seulement à la capacité d’entraîner de plus grands modèles, mais à la rapidité des modèles déployés.
Groq 3 LPX vise une douleur précise de l’inférence moderne. Les agents IA peuvent parcourir des centaines ou milliers d’étapes: lire des fichiers, appeler des outils, vérifier des résultats, écrire du code, réviser un plan et recommencer. Ces boucles produisent d’énormes volumes de tokens, surtout lorsque le modèle conserve un long contexte actif. Les GPU restent puissants pour de nombreuses parties de la charge, mais NVIDIA estime que la phase de génération exige une accélération dédiée quand la réactivité et le coût par token deviennent des limites commerciales.
Dans les résultats cités par NVIDIA, Groq 3 LPX a atteint environ 3.400 tokens de sortie par seconde avec le modèle open source Gemma 4 31B dans un contexte de 100.000 tokens. L’entreprise décrit cette performance comme la plus rapide enregistrée pour ce modèle et revendique une réactivité environ quatre fois supérieure à la plateforme concurrente la plus proche sur les charges sensibles à la latence. Les benchmarks d’un fournisseur demandent toujours vérification, mais ils illustrent pourquoi l’inférence devient un problème distinct de l’entraînement.
Le produit montre aussi la stratégie de NVIDIA après la licence de technologies d’inférence de Groq et l’arrivée de talents liés à cette société. Groq 3 LPX n’est pas conçu pour remplacer les GPU, mais pour fonctionner avec les racks Vera Rubin. L’architecture suit une logique de désagrégation: traitement du long contexte, génération de tokens, réseau et stockage sont confiés à des composants optimisés, puis conçus comme un système intégré. Pour les clouds IA et les entreprises, cette cohérence peut compter autant que la performance d’une puce isolée.
Nebius est le premier fournisseur de cloud IA cité par NVIDIA comme adoptant la plateforme, avec l’objectif d’intégrer Groq 3 LPX à son service Token Factory. Groq figure aussi parmi les premiers adoptants prévus. La disponibilité cloud est essentielle, car elle transforme une annonce matérielle en technologie que les développeurs peuvent essayer. Une inférence d’agents plus rapide via des API connues pourrait d’abord toucher les agents de codage, les assistants de recherche, le support automatisé et les workflows complexes.
L’annonce intervient alors que les dépenses d’IA sont davantage scrutées. Les entreprises ont investi massivement dans les clusters d’entraînement et les centres de données, mais les coûts de long terme s’accumulent souvent après le déploiement. Chaque question et chaque action d’agent consomment des ressources. Réduire la latence et le coût par token est donc une question économique autant que technique. Groq 3 LPX montre que la course matérielle de l’IA passe de la construction de cerveaux plus grands à une intelligence déployée assez rapide pour être utilisée en continu.