AI 模型
Qwen3.8-Flash-Next 开源权重,NVIDIA 验证 GB300 长上下文推理
通义千问发布 Qwen3.8-Flash-Next 开源权重,这一多模态 MoE 模型预览 Qwen4 架构,NVIDIA 同步强调 GB300 NVL72 支持。
阿里通义千问团队发布 Qwen3.8-Flash-Next,这是一款开源权重的多模态混合专家模型,也被视为 Qwen4 系列计划采用架构的早期预览。8 月 26 日的发布并不只是又一个模型检查点。Qwen 选择在下一代完整模型到来前公开架构变化,让开发者、研究人员和基础设施团队可以提前测试这些设计是否适合真实生产。
该模型由 1250 亿参数主网络、额外 510 亿 N-gram embedding 参数组成,每个 token 激活约 60 亿参数。Qwen 表示模型原生支持 262,144 token 上下文,并可通过 YaRN 扩展到 100 万 token。这使它直接面向智能体编程、文档分析和企业工作流,因为这些场景的有效上下文往往包含代码库、合同、日志、邮件和工具轨迹,而不是简短提示词。
核心架构变化是 Gated DeltaNet 与 Qwen Sparse Attention 的混合。每四层中有三层使用 Gated DeltaNet,把历史上下文压缩为固定大小的循环状态,剩余的注意力层负责从完整上下文中精确检索。Qwen Sparse Attention 使用轻量级索引器,把上下文聚合为 micro-block,再选择最重要的区域,而不是以同等成本扫描每个 token。Qwen 称这种方式尤其能在上下文接近百万 token 时降低注意力计算和索引开销。
Qwen 自家基准显示,在 100 万 token 下,Qwen Sparse Attention 相比全注意力实现最高 7.6 倍 prefill 加速和 4.9 倍 decode 加速。在 90% 前缀缓存命中率的服务场景中,Qwen3.8-Flash-Next 的 prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。团队还称训练成本约为 Qwen3.7-Plus 的九分之一,同时在编程和办公任务上提升能力。这些结论仍需要更广泛独立测试,但它们指向了长上下文模型最实际的问题:只有延迟和成本可接受,超长上下文才有产品价值。
NVIDIA 同日发布技术文章,把该模型放入自身加速计算栈。NVIDIA 表示将通过 SGLang、vLLM 和 TensorRT-LLM 提供尽力而为的 Day 0 功能支持,并在 GB300 NVL72 平台上完成验证,同时通过 NeMo AutoModel 和 NeMo RL 提供后训练配方。NVIDIA 报告称,Qwen3.8-Flash-Next 在 GB300 NVL72 上可实现每 GPU 超过 16,000 token/s,以及每用户超过 200 token/s。
硬件验证很关键,因为开源权重本身并不能保证采用。开发者还需要模型文件、推理配方、微调路径和生产服务指导。Qwen 表示权重已在 Hugging Face 和 ModelScope 提供,托管生产版本则以 Qwen3.8-Flash 形式在 QwenCloud 服务。公司列出的价格为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元,并称 API 会在文章发布后不久开放。
这次发布显示开放模型竞争正在转向。竞争不再只是普通上下文长度下的基准分数,而是模型能否携带大规模工作记忆、处理长文档,并以足够低成本支撑智能体反复调用。Qwen3.8-Flash-Next 给开发者提供了可检查的新架构,NVIDIA 的即时支持则表明,基础设施厂商已经把长上下文推理视为生产负载,而非研究展示。