Modèles d’IA
Qwen3.8-Flash-Next préfigure Qwen4, NVIDIA valide l’inférence sur GB300
Qwen a publié les poids ouverts de Qwen3.8-Flash-Next, un modèle MoE multimodal à long contexte, tandis que NVIDIA met en avant un support Day 0 sur GB300 NVL72.
L’équipe Qwen d’Alibaba a publié Qwen3.8-Flash-Next, un modèle multimodal mixture-of-experts à poids ouverts qui sert aussi d’aperçu précoce de l’architecture prévue pour la famille Qwen4. L’annonce du 26 août n’est pas seulement un nouveau checkpoint. Qwen expose des changements d’architecture avant la prochaine génération complète, afin que développeurs, chercheurs et équipes d’infrastructure puissent tester ces choix en conditions proches de la production.
Le modèle combine un réseau principal de 125 milliards de paramètres avec 51 milliards de paramètres supplémentaires dans des embeddings N-gram, et active environ 6 milliards de paramètres par token. Qwen indique qu’il prend en charge nativement une fenêtre de contexte de 262 144 tokens, extensible à un million avec YaRN. Cela vise directement le codage agentique, l’analyse documentaire et les workflows d’entreprise, où le contexte utile peut inclure des dépôts, contrats, journaux, e-mails et traces d’outils.
Le changement central est un hybride entre Gated DeltaNet et Qwen Sparse Attention. Trois couches sur quatre utilisent Gated DeltaNet pour compresser le contexte historique dans un état récurrent de taille fixe; la couche d’attention restante récupère précisément l’information dans le contexte complet. Qwen Sparse Attention ajoute un indexeur léger qui regroupe le contexte en micro-blocs et sélectionne les régions importantes au lieu de traiter chaque token au même coût. Qwen affirme ainsi réduire le calcul d’attention et le coût d’indexation.
Selon les benchmarks de Qwen, à un million de tokens, Qwen Sparse Attention offre jusqu’à 7,6 fois plus de vitesse en prefill et 4,9 fois en decode que l’attention complète. Dans un scénario de service avec 90% de réussite du prefix cache, Qwen3.8-Flash-Next atteint 8,6 fois le débit de prefill de Qwen3.7-Plus. L’équipe dit aussi que l’entraînement coûte environ un neuvième de celui de Qwen3.7-Plus tout en améliorant les tâches de codage et de bureau. Ces chiffres devront être vérifiés indépendamment, mais ils attaquent le vrai problème du long contexte: latence et coût acceptables.
NVIDIA a rapidement placé le modèle dans sa pile de calcul accéléré. Dans un billet technique publié le même jour, l’entreprise dit fournir un support fonctionnel Day 0 en best effort via SGLang, vLLM et TensorRT-LLM, une validation sur GB300 NVL72 et des recettes de post-entraînement via NeMo AutoModel et NeMo RL. NVIDIA rapporte que Qwen3.8-Flash-Next sur GB300 NVL72 dépasse 16 000 tokens par seconde par GPU et 200 tokens par seconde par utilisateur.
Cette validation matérielle compte, car les poids ouverts ne suffisent pas à garantir l’adoption. Les développeurs ont besoin de fichiers modèle, de recettes d’inférence, de voies de fine-tuning et de conseils de production. Qwen indique que les poids sont disponibles sur Hugging Face et ModelScope, tandis que la version gérée est servie comme Qwen3.8-Flash sur QwenCloud. Le prix annoncé est de 0,16 dollar par million de tokens d’entrée et 0,47 dollar par million de tokens de sortie, avec une API prévue peu après la publication.
Le lancement montre l’évolution de la course aux modèles ouverts. Il ne s’agit plus seulement de scores sur des contextes ordinaires. Il faut savoir si un modèle peut porter une grande mémoire de travail, raisonner sur de longs artefacts et fonctionner à un coût compatible avec des agents qui appellent le modèle de nombreuses fois. Qwen3.8-Flash-Next offre une nouvelle architecture à examiner, et le soutien immédiat de NVIDIA montre que l’inférence long contexte devient une charge de production.