Modèles d’IA
NVIDIA lance Nemotron 3.5 Lightning et NeMo Switchyard pour les agents multimodèles
NVIDIA publie un modèle ouvert efficace pour les tâches d’agents spécialisées et une bibliothèque de routage ouverte conçue pour équilibrer qualité, vitesse et coût des modèles.
NVIDIA a enrichi sa gamme de modèles ouverts avec Nemotron 3.5 Lightning et publié NeMo Switchyard, une bibliothèque de routage destinée à aider les systèmes d’agents à choisir entre plusieurs modèles au lieu d’envoyer chaque requête au même. Le lancement du 11 août associe un modèle relativement compact pour des tâches spécialisées à grand volume à un logiciel capable d’orienter chaque étape du flux de travail d’un agent selon des exigences telles que la précision, la latence et le coût. Ensemble, les produits montrent que le secteur passe d’une compétition entre modèles individuels à des systèmes dans lesquels les modèles jouent des rôles différents.
Nemotron 3.5 Lightning est un modèle à mélange d’experts de 30 milliards de paramètres. Dans cette architecture, seule une partie du réseau est activée pour une requête donnée, ce qui permet au modèle d’offrir une capacité totale supérieure sans utiliser tous les paramètres pour chaque token. NVIDIA présente Lightning comme un exécutant au sein d’un système d’agents plus vaste, et non comme le modèle qui doit planifier et résoudre chaque partie d’une tâche. L’entreprise cite la revue de code, l’utilisation d’outils, la surveillance des alertes de sécurité et les questions de facturation parmi les tâches spécialisées qu’il est destiné à prendre en charge, tandis qu’un modèle frontière plus grand peut coordonner le flux de travail global.
Selon l’entreprise, Lightning peut produire des résultats jusqu’à quatre fois plus rapidement et achever des tâches agentiques 30% plus vite que les autres modèles de sa catégorie. Ces chiffres proviennent de NVIDIA et des évaluations décrites dans son annonce; les acheteurs devront donc encore tester le modèle sur leurs propres charges de travail. La version a été développée avec des contributions de la Nemotron Coalition, et NVIDIA publie un jeu de données d’apprentissage par renforcement agentique utilisé pour le post-entraînement d’agents de programmation. Les organisations peuvent également adapter le modèle avec NVIDIA NeMo à l’aide de leurs propres données sectorielles, outils et méthodes de travail.
La souplesse du déploiement est au cœur de l’argumentaire. NVIDIA indique que le modèle peut fonctionner localement sur des PC RTX, DGX Spark, DGX Station et des systèmes Jetson, ainsi que sur des stations de travail, dans des centres de données, sur des appareils en périphérie et dans des services cloud. Une exploitation locale ou sur site peut compter lorsqu’une tâche génère un grand volume de requêtes, exige des réponses rapides ou porte sur des informations qu’une organisation ne souhaite pas envoyer au point de terminaison d’un modèle tiers. Lightning est accessible via Hugging Face, ModelScope, OpenRouter et les services de NVIDIA, dont un microservice NVIDIA NIM.
NeMo Switchyard s’attaque à une autre source de coûts. Un modèle frontière performant peut être utile pour une étape de raisonnement difficile, mais inutilement cher pour une classification ou une recherche courante. La bibliothèque open source permet aux développeurs de créer un routeur qui envoie des prompts à différents modèles ouverts, propriétaires ou NVIDIA sans réécrire l’application environnante. Sa logique de routage peut être modifiée pour refléter l’équilibre privilégié par une équipe entre qualité, temps de réponse et dépense. NVIDIA affirme que ses tests internes ont conservé une précision de niveau frontière tout en ramenant le coût d’achèvement des tâches à près d’un tiers de celui de la seule utilisation d’Opus 4.8.
Les résultats des partenaires présentés dans l’annonce illustrent à la fois les promesses et les limites des affirmations sur le routage. LangChain a fait état d’un coût inférieur de 74% sur 145 tâches multitours Deep Agents lorsque seuls 7% des appels ont été dirigés vers un modèle frontière, mais aussi d’un compromis de 6% sur la précision. Ramp a déclaré avoir égalé les performances d’un modèle frontière tout en réduisant le coût de 58% et le temps d’exécution de 33% dans son évaluation d’ingénierie logicielle. Cognition a signalé une baisse de 28% du coût moyen pour un routeur par étapes utilisé avec Devin Desktop dans l’environnement interne de NVIDIA. Il s’agit de mesures de fournisseurs et de partenaires, et non d’une garantie universelle.
Cette publication fait du choix du modèle une décision d’ingénierie explicite au sein des produits d’agents. Un routeur peut réduire le gaspillage, mais il introduit aussi un composant supplémentaire à évaluer: un mauvais aiguillage peut économiser de l’argent tout en dégradant la réponse ou en envoyant un travail sensible dans le mauvais environnement. La mise à l’épreuve concrète de Nemotron 3.5 Lightning et Switchyard consistera à déterminer si les équipes peuvent mesurer les décisions de routage, détecter les régressions de qualité et passer outre le système lorsqu’une tâche exige un modèle précis. Si cette couche opérationnelle tient ses promesses, les agents multimodèles pourraient moins dépendre d’une unique option coûteuse par défaut et ressembler davantage à d’autres systèmes logiciels distribués, où des services spécialisés sont choisis pour les tâches qu’ils accomplissent le mieux.