모델 출시
Qwen 팀, 새 구조를 적용한 Qwen3.8-Flash-Next 공개 가중치로 출시
- Qwen 팀이 Qwen3.8-Flash-Next를 공개 가중치로 내놨다.
- 총 125B 가운데 6B만 활성되는 구조에 Gated DeltaNet과 QSA를 섞었고, 컨텍스트는 262,144토큰을 기본으로 최대 100만 토큰까지 늘릴 수 있다.
| 모델 | Qwen3.8-Flash-Next |
|---|---|
| 저장소 | Qwen/Qwen3.8-Flash-Next |
| 모델 | Qwen3.8-Flash-Next-FP8 |
| 저장소 | Qwen/Qwen3.8-Flash-Next-FP8 |
| 개방성 | 오픈형 |
| 파라미터 | 125B |
| 라이선스 | qwen-community-1.0 |
무엇이 나왔나
- Qwen 팀이 Qwen3.8-Flash-Next를 공개했다.
- 저장소에는 사후 학습(post-training)까지 마친 모델의 가중치와 설정 파일이 Hugging Face Transformers 형식으로 담겨 있고, Transformers·vLLM·SGLang·TokenSpeed 등에서 쓸 수 있다고 회사는 밝혔다.
- FP8 판(Qwen3.8-Flash-Next-FP8)도 함께 올라갔다.
- 회사는 이 모델을 Qwen4의 바탕이 될 구조를 미리 실험해 보는 판(experimental preview)이라고 설명했다.
- 파이프라인 종류는 image-text-to-text로, 글과 함께 이미지·영상을 입력으로 받는다.
- 라이선스는 qwen-community-1.0이다.
- 회사는 프로덕션이나 처리량이 큰 상황에서는 SGLang·KTransformers·vLLM 같은 전용 서빙 엔진을 쓰기를 권했고, 손쉬운 연동을 원하면 API로 쓰기를 권했다.
- 또한 Qwen Cloud의 Qwen3.8-Flash가 Qwen3.8-Flash-Next를 바탕으로 한 공식 판이며 기본 100만 토큰 컨텍스트와 공식 내장 도구 같은 기능이 더 붙는다고 밝혔다.
규모와 구조
- 종류: 비전 인코더가 붙은 인과적 언어 모델
- 파라미터: 총 125B 가운데 6B 활성, 여기에 n-gram 임베딩 51B와 MTP 4B가 더 있다
- 레이어 48개, 히든 차원 2560, 토큰 임베딩 248320(패딩), LM 출력 248320(패딩)
- 레이어 배치: 12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))
- n-gram 임베딩: 2,000만 개(레이어 2에서 바이그램/트라이그램)
- Gated DeltaNet: 선형 어텐션 헤드 V 48개·QK 16개, 헤드 차원 128
- Qwen Sparse Attention: Q 헤드 24개·KV 헤드 2개, 헤드 차원 256, 로터리 위치 임베딩 차원 64, 인덱서는 쿼리 헤드 4개와 공유 키 헤드 1개의 MQA, 인덱서 헤드 차원 128, 예산은 512블록 또는 2048토큰
- MoE: 전문가 512개 중 라우팅 10개 + 공유 1개 활성, 전문가 중간 차원 640
- Gated Residual: 브랜치 4개, 보틀넥 랭크 320
- MTP: 1개 레이어, 다단계로 학습
- 컨텍스트 길이: 기본 262,144토큰이며 100만 토큰까지 확장할 수 있다. 262,144토큰을 넘는 작업에는 YaRN 같은 RoPE 스케일링을 쓰라고 회사는 권했다.
구조에서 달라진 점
회사가 이번 구조의 핵심으로 든 것은 네 가지다.
- Hybrid Attention with QSA: 기존의 Gated DeltaNet + Gated Attention 짝을 Gated DeltaNet + Qwen Sparse Attention(QSA)으로 바꿨다. QSA는 토큰을 하나씩 고르는 대신 마이크로 블록 단위로 동작하며, 이로써 긴 컨텍스트에서의 지연이 크게 줄었다고 회사는 밝혔다.
- Gated Residual: 넓힌 잔차 스트림을 지나는 정보를 원소 단위의 데이터 의존 읽기 게이트와 브랜치별 스칼라 쓰기 게이트로 조절한다. 학습 안정성을 지키고 추론 부담은 낮게 두면서 레이어별 표현력을 더 세밀하게 했다는 설명이다.
- N-gram Embedding: 임베딩은 MoE보다 계산이 적게 들고 오프로딩에 잘 맞는 파라미터 확장 축이라고 회사는 설명했다. 짧은 n-gram으로 색인해 메모리가 빡빡한 가속기에서도 파라미터를 효율적으로 늘릴 수 있다고 밝혔다.
- 학습 처방: Muon과 AdamW 옵티마이저를 가중치 종류별로 나눠 적용했다. 다시 맞춘 스케일링 법칙에 따라 배치 크기 워밍업을 없애고 목표 배치 크기에서 바로 시작해, 전체 옵티마이저 스텝 수를 크게 줄이면서 더 큰 학습률을 쓸 수 있게 했다고 회사는 밝혔다.
사고 모드 조절
- 이 모델은 기본으로 사고 모드로 동작해, 최종 답 앞에
<think>\n...</think>\n\n으로 감싼 사고 내용을 낸다. - 사고 동작은
enable_thinking,preserve_thinking,reasoning_effort로 조절할 수 있고,reasoning_effort는 기본값이 xhigh이며 xhigh·medium·low를 지원한다.
- 기본으로는 대화 속 모든 지난 메시지의 사고 블록을 그대로 남긴다(preserve_thinking). 회사는 이 방식이 맥락이 끊기지 않게 해 결정의 일관성이 중요하고 중복 추론을 줄여야 하는 에이전트 상황에 특히 도움이 되며, KV 캐시 활용도도 높인다고 밝혔다.
- 가장 최근 사용자 메시지의 사고 블록만 남기려면
preserve_thinking을 False로 두면 된다. - Qwen Cloud의 API를 쓸 때는
enable_thinking과preserve_thinking을chat_template_kwargs로 감싸지 않고 바로 넘겨야 한다.
- 또한 여러 차례 오가는 에이전트 작업에서는 추론 노력을 낮추는 것이 늘 전체 소요 시간을 줄여주지는 않는다고 회사는 덧붙였다.
- 한 차례 응답은 빨라지더라도 분석이 모자라 실패와 재시도가 늘어 총 지연과 토큰 소모가 커질 수 있다는 설명이다.
벤치마크
| 벤치마크 | 무엇을 재나 | Qwen3.8-Flash-Next (125B) | Qwen3.7-Plus (397B) | Qwen3.8-27B (27B) | Claude-Opus-4.6 (Max) (—) |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 에이전트 코딩 | 58.7 | 16.5 | 42.2 | -- |
| SWE-bench Pro | 에이전트 코딩 | 62.5 | 55.8 | 61.7 | 53.4 |
| SWE-bench Multilingual | 다언어 소프트웨어 개발 | 81.0 | 75.8 | 73.8 | 77.5 |
| NL2Repo-Bench | 저장소 단위 코드 생성 | 48.1 | 41.1 | 42.3 | 47.6 |
| CoWorkBench | 장기 사무 업무 수행 | 73.9 | 65.1 | 70.7 | 68.2 |
| JobBench | 전문 직무 과제 | 55.7 | 27.6 | 33.4 | 36.6 |
| Agents' Last Exam | 고난도 에이전트 과제 | Pass@1 24.3 / Score 51.2 | Pass@1 13.2 / Score 33.6 | Pass@1 20.4 / Score 42.9 | -- |
| Toolathlon Verified (Pass@1) | 실제 도구 사용 | 73.5 | 50.6 | 67.1 | -- |
| IFBench | 지시 따르기 | 81.3 | 79.1 | 79.5 | 62.5 |
| GPQA Diamond | 과학 추론 | 91.7 | 90.3 | 89.2 | 91.3 |
| HLE | 여러 분야 추론 | 35.9 | 34.7 | 30.8 | 40.0 |
| LiveCodeBench v6 | 경쟁 프로그래밍 | 91.9 | 89.6 | 90.3 | 88.8 |
| ClawEval-MM | 멀티모달 도구 사용 | Pass@3 64.4 / 평균 60.4 | Pass@3 57.4 / 평균 60.1 | Pass@3 57.4 / 평균 56.9 | Pass@3 52.5 / 평균 54.7 |
| RecreationBench | 애플리케이션 재현 | 49.9 | 30.2 | 47.1 | -- |
| AndroidWorld | 모바일 조작 | 84.5 | 81.0 | 81.9 | 62.0 |
| OSWorld 2.0 | 컴퓨터 조작 | Binary 19.4 / Partial 52.3 | Binary 2.8 / Partial 21.5 | Binary 19.4 / Partial 48.0 | -- |
| Vision2Web | 화면 보고 웹 개발 | 64.0 | 42.1 | 62.9 | -- |
| ERQA | 신체화 지능 | 72.3 | 69.8 | 65.5 | 40.8 |
| LVBench | 긴 영상 이해 | 76.6 | 76.2 | 72.4 | 63.0 |
| RealWorldQA | 실제 장면 인식 | 88.5 | 86.9 | 85.9 | 73.9 |
| MathVision | 이미지 수학 문제 풀이 | CI 없음 90.6 / CI 있음 95.7 | CI 없음 90.3 / CI 있음 88.7 | CI 없음 90.0 / CI 있음 94.6 | CI 없음 65.5 |
| CharXiv (RQ) | 과학 도표 분석 | CI 없음 84.6 / CI 있음 90.6 | CI 없음 85.8 / CI 있음 85.9 | CI 없음 83.7 / CI 있음 90.2 | CI 없음 66.0 |
- 측정 조건: 코딩 항목은 Claude Code 또는 mini-SWE-agent 하네스에서 temp=1.0, top_p=0.95, 256K 컨텍스트로 재었고, SWE-bench Pro의 Claude-Opus-4.6 (Max) 점수는 공식 발표치이며, HLE는 GPT-4o가 채점했고 Vision2Web은 gpt-5.4-2026-03-05가 채점했다.
- CoWorkBench와 RecreationBench는 회사 자체 벤치마크다.