AI 모델
Qwen3.8-Flash-Next 공개…Qwen4 미리보기와 NVIDIA GB300 검증
Qwen이 장문맥 멀티모달 MoE 모델 Qwen3.8-Flash-Next의 오픈 웨이트를 공개했고 NVIDIA는 GB300 NVL72 검증과 Day 0 지원을 강조했다.
알리바바 Qwen 팀이 오픈 웨이트 멀티모달 mixture-of-experts 모델인 Qwen3.8-Flash-Next를 공개했다. 이 모델은 향후 Qwen4 제품군에 쓰일 아키텍처의 초기 미리보기 역할도 한다. 8월 26일 발표가 중요한 이유는 단순한 새 체크포인트가 아니라 다음 세대 전체 모델이 나오기 전에 설계 변화를 공개해 개발자, 연구자, 인프라 팀이 실제 운영 가능성을 시험할 수 있게 했다는 점이다.
이 모델은 1,250억 파라미터의 주 네트워크와 추가 510억 N-gram 임베딩 파라미터를 결합하며, 토큰당 약 60억 파라미터를 활성화한다. Qwen은 기본 262,144토큰 컨텍스트를 지원하고 YaRN으로 100만 토큰까지 확장할 수 있다고 밝혔다. 이는 에이전트 코딩, 문서 분석, 기업 워크플로에 직접 관련된다. 이런 작업에서는 짧은 프롬프트가 아니라 코드베이스, 계약서, 로그, 이메일, 도구 실행 기록까지 함께 다뤄야 하기 때문이다.
핵심 변화는 Gated DeltaNet과 Qwen Sparse Attention의 하이브리드 구조다. 네 층 중 세 층은 Gated DeltaNet으로 과거 컨텍스트를 고정 크기 recurrent state로 압축하고, 나머지 attention 층은 전체 컨텍스트에서 정보를 정밀하게 검색한다. Qwen Sparse Attention은 가벼운 인덱서를 사용해 컨텍스트를 micro-block으로 묶고 중요한 영역을 선택한다. 모든 토큰을 동일한 비용으로 훑지 않아도 되므로, 컨텍스트가 100만 토큰에 가까워질수록 계산과 인덱싱 부담을 줄일 수 있다.
Qwen 자체 벤치마크에 따르면 100만 토큰에서 Qwen Sparse Attention은 full attention 대비 prefill 최대 7.6배, decode 최대 4.9배 속도를 냈다. 90% prefix cache hit rate를 가정한 서빙 환경에서는 Qwen3.8-Flash-Next가 Qwen3.7-Plus보다 8.6배 높은 prefill 처리량을 기록했다고 밝혔다. 또한 훈련 비용은 Qwen3.7-Plus의 약 9분의 1이면서 코딩과 오피스 작업 능력은 향상됐다고 설명했다. 독립 검증은 필요하지만, 장문맥 모델이 실용적이려면 지연 시간과 비용을 낮춰야 한다는 핵심 문제를 겨냥한 결과다.
NVIDIA는 같은 날 이 모델을 자사 가속 컴퓨팅 스택 안에 배치했다. 회사는 SGLang, vLLM, TensorRT-LLM을 통한 best-effort Day 0 기능 지원, GB300 NVL72 플랫폼 검증, NeMo AutoModel과 NeMo RL을 통한 후훈련 레시피를 제공한다고 밝혔다. NVIDIA는 GB300 NVL72에서 Qwen3.8-Flash-Next가 GPU당 초당 16,000토큰 이상, 사용자당 초당 200토큰 이상을 달성했다고 보고했다.
하드웨어 검증은 오픈 웨이트 채택에 중요하다. 모델 파일만으로는 충분하지 않고, 추론 레시피, 미세조정 경로, 프로덕션 서빙 지침이 필요하다. Qwen은 가중치가 Hugging Face와 ModelScope에서 제공되며, 관리형 프로덕션 버전은 QwenCloud에서 Qwen3.8-Flash 이름으로 서비스된다고 밝혔다. 가격은 입력 100만 토큰당 0.16달러, 출력 100만 토큰당 0.47달러로 제시됐고 API는 게시 직후 제공될 예정이라고 설명했다.
이번 공개는 오픈 모델 경쟁의 방향을 보여준다. 경쟁은 더 이상 일반 컨텍스트 길이의 벤치마크 점수만이 아니다. 모델이 큰 작업 기억을 유지하고 긴 산출물을 읽으며 에이전트가 반복 호출해도 감당 가능한 비용으로 실행될 수 있는지가 중요하다. Qwen3.8-Flash-Next는 개발자가 점검할 새 구조를 제공했고, NVIDIA의 즉각 지원은 장문맥 추론이 연구용 시연이 아니라 생산 워크로드로 이동하고 있음을 보여준다.