Modelos de IA

NVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para agentes multimodelo

NVIDIA ha publicado un modelo abierto eficiente para tareas especializadas de agentes y una biblioteca abierta de enrutamiento diseñada para equilibrar calidad, velocidad y coste.

Publicado Actualizado
NVIDIANemotron 3.5 LightningNeMo Switchyard

NVIDIA ha ampliado su catálogo de modelos abiertos con Nemotron 3.5 Lightning y ha publicado NeMo Switchyard, una biblioteca de enrutamiento destinada a ayudar a los sistemas de agentes a elegir entre varios modelos en vez de enviar todas las solicitudes al mismo. El lanzamiento del 11 de agosto combina un modelo relativamente compacto para trabajos especializados de gran volumen con software capaz de dirigir cada paso de un flujo de trabajo de agentes según requisitos como precisión, latencia y coste. Juntos, los productos muestran cómo el sector está pasando de la competencia entre modelos individuales a sistemas en los que cada modelo desempeña funciones diferentes.

Nemotron 3.5 Lightning es un modelo de mezcla de expertos con 30.000 millones de parámetros. En esta arquitectura solo se activa una parte de la red para cada solicitud, lo que permite ofrecer una mayor capacidad total sin utilizar todos los parámetros para cada token. NVIDIA presenta Lightning como un trabajador dentro de un sistema de agentes más amplio, no como el modelo que debe planificar y resolver todas las partes de una tarea. La empresa menciona la revisión de código, el uso de herramientas, la supervisión de alertas de seguridad y las consultas de facturación entre las tareas especializadas que debe gestionar, mientras un modelo frontera de mayor tamaño puede coordinar el flujo de trabajo general.

La empresa afirma que Lightning puede generar resultados hasta cuatro veces más rápido y completar tareas de agentes un 30% más deprisa que otros modelos de su categoría. Esas cifras proceden de NVIDIA y de las evaluaciones descritas en su anuncio, por lo que los compradores todavía tendrán que probar el modelo con sus propias cargas de trabajo. El lanzamiento se desarrolló con aportaciones de Nemotron Coalition, y NVIDIA publicará un conjunto de datos de aprendizaje por refuerzo para agentes utilizado en el posentrenamiento de agentes de programación. Las organizaciones también pueden adaptar el modelo con NVIDIA NeMo mediante sus propios datos de dominio, herramientas y patrones de trabajo.

La flexibilidad de despliegue ocupa un lugar central en la propuesta. NVIDIA sostiene que el modelo puede ejecutarse localmente en ordenadores RTX, DGX Spark, DGX Station y sistemas Jetson, además de utilizarse en estaciones de trabajo, centros de datos, dispositivos periféricos y servicios en la nube. La operación local o en instalaciones propias puede ser importante cuando una tarea tiene un gran volumen de solicitudes, exige respuestas rápidas o utiliza información que una organización no quiere enviar al endpoint de un modelo de terceros. Lightning está disponible a través de Hugging Face, ModelScope, OpenRouter y servicios de NVIDIA, incluido un microservicio NVIDIA NIM.

NeMo Switchyard aborda una fuente de costes diferente. Un modelo frontera capaz puede ser útil para un paso de razonamiento difícil, pero innecesariamente caro para una clasificación o consulta rutinaria. La biblioteca de código abierto permite a los desarrolladores crear un enrutador que envía prompts a distintos modelos abiertos, propietarios o de NVIDIA sin reescribir la aplicación circundante. Su lógica de enrutamiento puede modificarse para reflejar el equilibrio que prefiera un equipo entre calidad, tiempo de respuesta y gasto. NVIDIA afirma que sus pruebas internas conservaron una precisión de nivel frontera y, al mismo tiempo, redujeron el coste de completar tareas a casi un tercio del que supone utilizar únicamente Opus 4.8.

Los resultados de socios incluidos en el anuncio ilustran tanto las posibilidades como los límites de las afirmaciones sobre el enrutamiento. LangChain comunicó un coste un 74% menor en 145 tareas multiturno de Deep Agents cuando solo el 7% de las llamadas se dirigieron a un modelo frontera, aunque también registró una reducción de precisión del 6%. Ramp afirmó que igualó el rendimiento de un modelo frontera mientras reducía el coste un 58% y el tiempo de ejecución un 33% en su prueba de ingeniería de software. Cognition informó de una reducción del 28% en el coste medio de un enrutador por etapas utilizado con Devin Desktop en el entorno interno de NVIDIA. Son mediciones de proveedores y socios, no una garantía universal.

El lanzamiento convierte la selección de modelos en una decisión explícita de ingeniería dentro de los productos de agentes. Un enrutador puede reducir el desperdicio, pero también introduce otro componente que debe evaluarse: una ruta mal elegida puede ahorrar dinero a costa de degradar la respuesta o enviar trabajo sensible al entorno equivocado. La prueba práctica para Nemotron 3.5 Lightning y Switchyard será si los equipos pueden medir las decisiones de enrutamiento, detectar pérdidas de calidad y anular el sistema cuando una tarea requiera un modelo específico. Si esa capa operativa se mantiene, los agentes multimodelo podrían depender menos de una única opción predeterminada y cara, y parecerse más a otros sistemas de software distribuido, con servicios especializados elegidos para el trabajo que mejor realizan.