Infrastructure IA
Les résultats de Jalapeño placent le silicium d’OpenAI au cœur de l’infrastructure IA
OpenAI a publié les premiers résultats mesurés de Jalapeño, sa puce d’inférence, avec des gains annoncés de performance par watt et de latence sur plusieurs modèles publics.
OpenAI a publié les premiers résultats mesurés de Jalapeño, sa première puce d’inférence personnalisée, faisant passer un effort matériel longtemps observé du registre stratégique à celui des données de performance. L’entreprise a déclaré le 25 août que Jalapeño offrait une meilleure combinaison de débit, latence et efficacité énergétique que des systèmes comparables sur le benchmark InferenceX de SemiAnalysis. Pour une industrie sous pression afin de justifier ses dépenses massives de calcul, l’annonce dépasse la simple mise à jour matérielle.
Jalapeño vise l’inférence, la phase de production où les modèles répondent aux utilisateurs, exécutent des agents et génèrent des tokens un par un. OpenAI dit avoir testé l’accélérateur sur GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, montrant que l’architecture ne se limite pas à ses propres modèles. Sur les trois, l’entreprise rapporte 1,5 à 1,9 fois plus de travail IA par watt au débit maximal et une latence de bout en bout 1,7 à 3,6 fois plus faible.
L’accent mis sur la performance par watt reflète l’évolution économique de l’IA générative. Les laboratoires de frontière ont beaucoup investi dans l’entraînement, mais l’inférence est le coût qui revient à chaque utilisation d’un produit. Les agents accentuent cette pression, car ils lisent des fichiers, appellent des outils, inspectent des résultats et répètent de nombreuses étapes. Un faible délai ou coût énergétique peut se cumuler sur une longue tâche et peser sur l’expérience comme sur les marges.
OpenAI affirme avoir conçu Jalapeño autour de ces charges plutôt que de l’adapter depuis une architecture générale. Le système cherche à réduire les déplacements de données en gardant l’état du modèle, notamment le KV cache utilisé pendant la génération, près des ressources de calcul et de réseau. L’inférence des modèles de langage passe par des phases distinctes: traiter un long prompt exige du calcul, tandis que générer des tokens dépend davantage de la mémoire et de la communication.
L’entreprise présente aussi Jalapeño comme une preuve de sa stratégie de pile complète. Des modèles plus anciens ont aidé à concevoir et démarrer la puce, tandis que des modèles récents assistent l’optimisation et la programmation. OpenAI indique que certaines implémentations générées par IA pour des blocs d’attention et de mixture-of-experts ont été 1,5 à 1,8 fois plus rapides que des versions humaines précédentes, tout en précisant que ces chiffres ne concernent pas des modèles entiers.
OpenAI prévoit de commencer à déployer Jalapeño dans sa propre infrastructure de calcul d’ici la fin de l’année, tout en poursuivant qualification de production et maturation logicielle. Les deuxième et troisième générations sont déjà en développement. Les résultats devront être validés à grande échelle, mais la direction est claire. La prochaine phase de l’infrastructure IA ne consistera pas seulement à construire le plus grand modèle, mais à faire fonctionner des modèles puissants avec assez de vitesse, d’efficacité et de coût maîtrisé pour un usage continu.