Modelos de IA
Qwen3.8-Flash-Next adelanta Qwen4 mientras NVIDIA valida inferencia en GB300
Qwen publicó los pesos abiertos de Qwen3.8-Flash-Next, un modelo MoE multimodal de largo contexto, y NVIDIA destacó soporte Day 0 y validación en GB300 NVL72.
El equipo Qwen de Alibaba publicó Qwen3.8-Flash-Next, un modelo multimodal mixture-of-experts con pesos abiertos que funciona como anticipo temprano de la arquitectura prevista para la familia Qwen4. El anuncio del 26 de agosto no es solo otro checkpoint. Qwen está exponiendo cambios arquitectónicos antes de la próxima generación completa, dando a desarrolladores, investigadores y equipos de infraestructura una oportunidad de probar si esas decisiones sirven para producción.
El modelo combina una red principal de 125.000 millones de parámetros con 51.000 millones adicionales en embeddings N-gram y activa alrededor de 6.000 millones de parámetros por token. Qwen dice que soporta de forma nativa una ventana de contexto de 262.144 tokens y que puede extenderse a un millón con YaRN. Esto lo vuelve relevante para programación con agentes, análisis documental y flujos empresariales donde el contexto útil incluye repositorios, contratos, registros, correos y trazas de herramientas.
El cambio central es un híbrido entre Gated DeltaNet y Qwen Sparse Attention. Tres de cada cuatro capas usan Gated DeltaNet para comprimir el contexto histórico en un estado recurrente de tamaño fijo, mientras la capa restante recupera información en todo el contexto. Qwen Sparse Attention agrega un indexador ligero que agrupa el contexto en microbloques y selecciona las regiones más importantes, en vez de procesar cada token con el mismo costo. Qwen afirma que esto reduce tanto el cálculo de atención como el costo del indexado.
Según benchmarks de Qwen, a un millón de tokens Qwen Sparse Attention ofrece hasta 7,6 veces más velocidad en prefill y 4,9 veces en decode frente a full attention. En un escenario de servicio con 90% de acierto en prefix cache, Qwen3.8-Flash-Next alcanzó 8,6 veces el throughput de prefill de Qwen3.7-Plus. El equipo también dice que el entrenamiento costó cerca de una novena parte del de Qwen3.7-Plus y mejoró capacidades en codificación y tareas de oficina. Las cifras necesitarán pruebas independientes, pero atacan el problema clave de los modelos de largo contexto: servirlos con latencia y costo aceptables.
NVIDIA se movió rápido para situar el modelo dentro de su pila de cómputo acelerado. En una publicación técnica del mismo día, la empresa dijo que ofrece soporte funcional Day 0 de mejor esfuerzo mediante SGLang, vLLM y TensorRT-LLM, validación en GB300 NVL72 y recetas de post-entrenamiento con NeMo AutoModel y NeMo RL. NVIDIA reportó que Qwen3.8-Flash-Next en GB300 NVL72 superó los 16.000 tokens por segundo por GPU y los 200 tokens por segundo por usuario.
Esa validación de hardware importa porque los pesos abiertos no garantizan adopción práctica. Los desarrolladores necesitan archivos de modelo, recetas de inferencia, rutas de fine-tuning y guías de servicio en producción. Qwen dice que los pesos están disponibles en Hugging Face y ModelScope, mientras que la versión gestionada se sirve como Qwen3.8-Flash en QwenCloud. La empresa listó precios de 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida, con API prevista poco después de la publicación.
El lanzamiento muestra hacia dónde va la carrera de modelos abiertos. Ya no se trata solo de puntajes con contexto estándar. Importa si un modelo puede llevar memoria de trabajo grande, razonar sobre artefactos largos y ejecutarse con costo suficiente para agentes que llaman al modelo muchas veces durante una tarea. Qwen3.8-Flash-Next ofrece una arquitectura nueva para inspeccionar, y el soporte inmediato de NVIDIA indica que la inferencia de largo contexto ya se trata como carga de producción.