Modelos de IA
Qwen3.8-Flash-Next antecipa Qwen4 enquanto NVIDIA valida inferência no GB300
A Qwen lançou pesos abertos do Qwen3.8-Flash-Next, modelo MoE multimodal de longo contexto, enquanto a NVIDIA destacou suporte Day 0 e validação no GB300 NVL72.
A equipe Qwen, da Alibaba, lançou o Qwen3.8-Flash-Next, um modelo multimodal mixture-of-experts com pesos abertos que funciona como uma prévia inicial da arquitetura planejada para a família Qwen4. O anúncio de 26 de agosto não é apenas mais um checkpoint. A Qwen está expondo mudanças arquitetônicas antes da próxima geração completa, permitindo que desenvolvedores, pesquisadores e equipes de infraestrutura testem se essas escolhas funcionam em produção.
O modelo combina uma rede principal de 125 bilhões de parâmetros com 51 bilhões adicionais em embeddings N-gram e ativa cerca de 6 bilhões de parâmetros por token. A Qwen diz que o modelo suporta nativamente uma janela de contexto de 262.144 tokens e pode ser estendido para um milhão com YaRN. Isso o torna relevante para codificação com agentes, análise documental e fluxos empresariais nos quais o contexto útil inclui repositórios, contratos, logs, e-mails e rastros de ferramentas.
A mudança central é um híbrido de Gated DeltaNet e Qwen Sparse Attention. Três de cada quatro camadas usam Gated DeltaNet para comprimir o contexto histórico em um estado recorrente de tamanho fixo, enquanto a camada restante recupera informações do contexto completo. Qwen Sparse Attention adiciona um indexador leve que agrupa o contexto em microblocos e seleciona as regiões mais importantes, em vez de varrer cada token com o mesmo custo. Segundo a Qwen, isso reduz tanto o cálculo de atenção quanto o custo de indexação.
Benchmarks da própria Qwen afirmam que, em um milhão de tokens, Qwen Sparse Attention entrega até 7,6 vezes mais velocidade em prefill e 4,9 vezes em decode em comparação com full attention. Em um cenário de serviço com 90% de acerto em prefix cache, Qwen3.8-Flash-Next atingiu 8,6 vezes o throughput de prefill do Qwen3.7-Plus. A equipe também diz que o treinamento custou cerca de um nono do Qwen3.7-Plus, com melhoria em codificação e tarefas de escritório. As afirmações precisam de testes independentes, mas miram o problema central dos modelos de longo contexto: servir com latência e custo aceitáveis.
A NVIDIA rapidamente posicionou o modelo dentro de sua pilha de computação acelerada. Em uma publicação técnica no mesmo dia, a empresa afirmou oferecer suporte funcional Day 0 de melhor esforço por SGLang, vLLM e TensorRT-LLM, validação no GB300 NVL72 e receitas de pós-treinamento com NeMo AutoModel e NeMo RL. A NVIDIA relatou que o Qwen3.8-Flash-Next no GB300 NVL72 entregou mais de 16 mil tokens por segundo por GPU e mais de 200 tokens por segundo por usuário.
Essa validação de hardware importa porque pesos abertos não garantem adoção prática. Desenvolvedores precisam de arquivos de modelo, receitas de inferência, caminhos de ajuste fino e orientação de serviço em produção. A Qwen diz que os pesos estão disponíveis no Hugging Face e no ModelScope, enquanto a versão gerenciada de produção é servida como Qwen3.8-Flash no QwenCloud. O preço listado é de 0,16 dólar por milhão de tokens de entrada e 0,47 dólar por milhão de tokens de saída, com API prevista para pouco depois da publicação.
O lançamento mostra a direção da corrida de modelos abertos. A competição não é mais apenas por pontuações em contexto comum. Importa se um modelo consegue carregar grande memória de trabalho, raciocinar sobre artefatos longos e rodar barato o suficiente para agentes que fazem muitas chamadas durante uma tarefa. Qwen3.8-Flash-Next oferece uma nova arquitetura para inspeção, e o suporte imediato da NVIDIA sinaliza que inferência de longo contexto já é tratada como carga de produção.