Infraestrutura de IA

NVIDIA coloca Groq 3 LPX em produção enquanto agentes de IA exigem mais que GPUs

A NVIDIA afirmou que o Groq 3 LPX entrou em produção completa, ampliando o Vera Rubin com geração de tokens mais rápida para IA agentiva e contextos longos.

Publicado Atualizado
NVIDIAInferência de IAIA agentiva

A NVIDIA colocou o Groq 3 LPX em produção completa e usou a conferência Hot Chips para apresentar a inferência como a próxima grande restrição da fábrica de IA. A empresa disse em 24 de agosto que o acelerador interativo amplia a plataforma Vera Rubin NVL72 ao aumentar drasticamente a velocidade de geração de tokens para sistemas agentivos. A mensagem é que a próxima fase da infraestrutura de IA não será medida apenas pela capacidade de treinar modelos maiores, mas pela rapidez com que modelos em produção conseguem ler contextos longos, raciocinar e responder.

O Groq 3 LPX mira uma dor específica da inferência moderna. Agentes de IA podem percorrer centenas ou milhares de etapas: ler arquivos, acionar ferramentas, verificar resultados, escrever código, revisar planos e repetir o ciclo. Essas etapas geram enormes volumes de tokens, especialmente quando o modelo precisa manter uma janela de contexto longa. GPUs continuam fortes em muitas partes do trabalho, mas a NVIDIA argumenta que a fase de geração exige aceleração especializada quando responsividade e custo por token viram gargalos comerciais.

Nos resultados citados pela NVIDIA, o Groq 3 LPX entregou cerca de 3.400 tokens de saída por segundo executando o modelo aberto Gemma 4 31B com contexto de 100.000 tokens. A empresa descreveu esse desempenho como o mais rápido já registrado para o modelo e afirmou que a plataforma oferece resposta cerca de quatro vezes mais rápida em cargas sensíveis a latência. Benchmarks de fornecedor precisam de validação no mundo real, mas os números explicam por que inferência virou um problema separado do treinamento.

O produto também mostra a estratégia da NVIDIA depois de licenciar tecnologia de inferência da Groq e contratar talentos ligados à empresa. O Groq 3 LPX foi criado para trabalhar com racks Vera Rubin, não para substituir GPUs. A arquitetura segue a tendência de desagregação, atribuindo processamento de contexto longo, geração de tokens, rede e armazenamento a componentes otimizados para cada fase e desenhados como um sistema único.

A Nebius foi apontada como a primeira nuvem de IA a adotar a plataforma, com planos de levar o Groq 3 LPX ao seu serviço Token Factory. A Groq também aparece entre os primeiros adotantes previstos. A disponibilidade em nuvem é importante porque transforma anúncio de chip em algo que desenvolvedores podem testar. Se empresas acessarem inferência de agentes mais rápida por APIs conhecidas, os impactos iniciais podem aparecer em agentes de programação, assistentes de pesquisa, suporte automatizado e ferramentas de fluxo de trabalho.

O anúncio chega enquanto os gastos com IA são analisados com mais rigor. Empresas investiram muito em clusters de treinamento e data centers, mas muitas cargas práticas rodam continuamente após a implantação. Cada pergunta de usuário e cada ação de agente gera custo. Menor latência e menor custo por token são questões de negócio, não apenas conquistas técnicas. A produção do Groq 3 LPX mostra que a corrida de hardware de IA está passando de construir cérebros maiores para tornar a inteligência implantada rápida o suficiente para uso constante.