Modelos de IA
NVIDIA lança Nemotron 3.5 Lightning e NeMo Switchyard para agentes multimodelo
A NVIDIA lançou um modelo aberto eficiente para tarefas especializadas de agentes e uma biblioteca aberta de roteamento criada para equilibrar qualidade, velocidade e custo dos modelos.
A NVIDIA ampliou sua linha de modelos abertos com o Nemotron 3.5 Lightning e lançou o NeMo Switchyard, uma biblioteca de roteamento destinada a ajudar sistemas de agentes a escolher entre vários modelos, em vez de enviar todas as solicitações ao mesmo modelo. O lançamento de 11 de agosto combina um modelo relativamente compacto para trabalho especializado em grande volume com um software capaz de direcionar cada etapa do fluxo de trabalho de um agente segundo requisitos como precisão, latência e custo. Juntos, os produtos mostram como o setor está passando da competição entre modelos individuais para sistemas nos quais os modelos desempenham papéis diferentes.
O Nemotron 3.5 Lightning é um modelo de mistura de especialistas com 30 bilhões de parâmetros. Nessa arquitetura, apenas uma parte da rede é ativada para uma determinada solicitação, o que permite oferecer maior capacidade total sem usar todos os parâmetros para cada token. A NVIDIA posiciona o Lightning como um executor dentro de um sistema de agentes maior, e não como o modelo que precisa planejar e resolver todas as partes de uma tarefa. A empresa cita revisão de código, uso de ferramentas, monitoramento de alertas de segurança e perguntas de faturamento entre as tarefas especializadas que ele deve executar, enquanto um modelo de fronteira maior pode coordenar o fluxo de trabalho mais amplo.
A empresa afirma que o Lightning pode fornecer resultados até quatro vezes mais rápidos e concluir tarefas de agentes 30% mais rapidamente do que outros modelos de sua categoria. Esses números vêm da NVIDIA e das avaliações descritas em seu anúncio, portanto os compradores ainda terão de testar o modelo em suas próprias cargas de trabalho. O lançamento foi desenvolvido com contribuições da Nemotron Coalition, e a NVIDIA está publicando um conjunto de dados de aprendizagem por reforço para agentes usado no pós-treinamento de agentes de programação. As organizações também podem adaptar o modelo com o NVIDIA NeMo, usando seus próprios dados de domínio, ferramentas e padrões de trabalho.
A flexibilidade de implantação é uma parte central da proposta. A NVIDIA diz que o modelo pode funcionar localmente em PCs RTX, DGX Spark, DGX Station e sistemas Jetson, além de operar em estações de trabalho, data centers, dispositivos de borda e serviços de nuvem. A operação local ou nas próprias instalações pode ser importante quando uma tarefa tem grande volume de solicitações, exige respostas rápidas ou envolve informações que uma organização não quer enviar para o endpoint de um modelo de terceiros. O Lightning está disponível por meio de Hugging Face, ModelScope, OpenRouter e serviços da NVIDIA, incluindo um microsserviço NVIDIA NIM.
O NeMo Switchyard trata de uma fonte diferente de custo. Um modelo de fronteira capaz pode ser útil para uma etapa difícil de raciocínio, mas desnecessariamente caro para uma classificação ou consulta rotineira. A biblioteca de código aberto permite aos desenvolvedores criar um roteador que envia prompts a diferentes modelos abertos, proprietários ou da NVIDIA sem reescrever a aplicação ao redor. Sua lógica de roteamento pode ser modificada para refletir o equilíbrio preferido por uma equipe entre qualidade, tempo de resposta e despesa. A NVIDIA diz que seus testes internos mantiveram uma precisão de nível de fronteira enquanto reduziram o custo de conclusão das tarefas para quase um terço do custo de usar apenas o Opus 4.8.
Os resultados de parceiros no anúncio ilustram tanto a promessa quanto os limites das afirmações de roteamento. A LangChain relatou custo 74% menor em 145 tarefas multiturno do Deep Agents quando apenas 7% das chamadas foram encaminhadas a um modelo de fronteira, mas também registrou uma perda de 6% na precisão. A Ramp disse que igualou o desempenho de um modelo de fronteira enquanto reduziu o custo em 58% e o tempo de execução em 33% em seu teste de engenharia de software. A Cognition informou uma redução de 28% no custo médio de um roteador em estágios usado com o Devin Desktop no ambiente interno da NVIDIA. Essas são medições de fornecedores e parceiros, não uma garantia universal.
O lançamento torna a seleção de modelos uma decisão explícita de engenharia dentro dos produtos de agentes. Um roteador pode reduzir o desperdício, mas também introduz outro componente que precisa ser avaliado: uma rota mal escolhida pode economizar dinheiro enquanto piora a resposta ou envia trabalho sensível ao ambiente errado. O teste prático para o Nemotron 3.5 Lightning e o Switchyard será saber se as equipes conseguem medir decisões de roteamento, detectar regressões de qualidade e substituir a escolha do sistema quando uma tarefa exige um modelo específico. Se essa camada operacional se sustentar, agentes multimodelo poderão se tornar menos dependentes de um único padrão caro e mais parecidos com outros sistemas de software distribuído, com serviços especializados escolhidos para o trabalho que executam melhor.