llmfeed

Qwen 팀, 새 구조를 적용한 Qwen3.8-Flash-Next 공개 가중치로 출시

큐원
  • Qwen 팀이 Qwen3.8-Flash-Next를 공개 가중치로 내놨다.
  • 총 125B 가운데 6B만 활성되는 구조에 Gated DeltaNet과 QSA를 섞었고, 컨텍스트는 262,144토큰을 기본으로 최대 100만 토큰까지 늘릴 수 있다.
모델Qwen3.8-Flash-Next
저장소Qwen/Qwen3.8-Flash-Next
모델Qwen3.8-Flash-Next-FP8
저장소Qwen/Qwen3.8-Flash-Next-FP8
개방성오픈형
파라미터 125B
라이선스 qwen-community-1.0

무엇이 나왔나

  • Qwen 팀이 Qwen3.8-Flash-Next를 공개했다.
  • 저장소에는 사후 학습(post-training)까지 마친 모델의 가중치와 설정 파일이 Hugging Face Transformers 형식으로 담겨 있고, Transformers·vLLM·SGLang·TokenSpeed 등에서 쓸 수 있다고 회사는 밝혔다.
  • FP8 판(Qwen3.8-Flash-Next-FP8)도 함께 올라갔다.
  • 회사는 이 모델을 Qwen4의 바탕이 될 구조를 미리 실험해 보는 판(experimental preview)이라고 설명했다.
  • 파이프라인 종류는 image-text-to-text로, 글과 함께 이미지·영상을 입력으로 받는다.
  • 라이선스는 qwen-community-1.0이다.
  • 회사는 프로덕션이나 처리량이 큰 상황에서는 SGLang·KTransformers·vLLM 같은 전용 서빙 엔진을 쓰기를 권했고, 손쉬운 연동을 원하면 API로 쓰기를 권했다.
  • 또한 Qwen Cloud의 Qwen3.8-Flash가 Qwen3.8-Flash-Next를 바탕으로 한 공식 판이며 기본 100만 토큰 컨텍스트와 공식 내장 도구 같은 기능이 더 붙는다고 밝혔다.

규모와 구조

  • 종류: 비전 인코더가 붙은 인과적 언어 모델
  • 파라미터: 총 125B 가운데 6B 활성, 여기에 n-gram 임베딩 51B와 MTP 4B가 더 있다
  • 레이어 48개, 히든 차원 2560, 토큰 임베딩 248320(패딩), LM 출력 248320(패딩)
  • 레이어 배치: 12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))
  • n-gram 임베딩: 2,000만 개(레이어 2에서 바이그램/트라이그램)
  • Gated DeltaNet: 선형 어텐션 헤드 V 48개·QK 16개, 헤드 차원 128
  • Qwen Sparse Attention: Q 헤드 24개·KV 헤드 2개, 헤드 차원 256, 로터리 위치 임베딩 차원 64, 인덱서는 쿼리 헤드 4개와 공유 키 헤드 1개의 MQA, 인덱서 헤드 차원 128, 예산은 512블록 또는 2048토큰
  • MoE: 전문가 512개 중 라우팅 10개 + 공유 1개 활성, 전문가 중간 차원 640
  • Gated Residual: 브랜치 4개, 보틀넥 랭크 320
  • MTP: 1개 레이어, 다단계로 학습
  • 컨텍스트 길이: 기본 262,144토큰이며 100만 토큰까지 확장할 수 있다. 262,144토큰을 넘는 작업에는 YaRN 같은 RoPE 스케일링을 쓰라고 회사는 권했다.

구조에서 달라진 점

회사가 이번 구조의 핵심으로 든 것은 네 가지다.

  • Hybrid Attention with QSA: 기존의 Gated DeltaNet + Gated Attention 짝을 Gated DeltaNet + Qwen Sparse Attention(QSA)으로 바꿨다. QSA는 토큰을 하나씩 고르는 대신 마이크로 블록 단위로 동작하며, 이로써 긴 컨텍스트에서의 지연이 크게 줄었다고 회사는 밝혔다.
  • Gated Residual: 넓힌 잔차 스트림을 지나는 정보를 원소 단위의 데이터 의존 읽기 게이트와 브랜치별 스칼라 쓰기 게이트로 조절한다. 학습 안정성을 지키고 추론 부담은 낮게 두면서 레이어별 표현력을 더 세밀하게 했다는 설명이다.
  • N-gram Embedding: 임베딩은 MoE보다 계산이 적게 들고 오프로딩에 잘 맞는 파라미터 확장 축이라고 회사는 설명했다. 짧은 n-gram으로 색인해 메모리가 빡빡한 가속기에서도 파라미터를 효율적으로 늘릴 수 있다고 밝혔다.
  • 학습 처방: Muon과 AdamW 옵티마이저를 가중치 종류별로 나눠 적용했다. 다시 맞춘 스케일링 법칙에 따라 배치 크기 워밍업을 없애고 목표 배치 크기에서 바로 시작해, 전체 옵티마이저 스텝 수를 크게 줄이면서 더 큰 학습률을 쓸 수 있게 했다고 회사는 밝혔다.

사고 모드 조절

  • 이 모델은 기본으로 사고 모드로 동작해, 최종 답 앞에 <think>\n...</think>\n\n으로 감싼 사고 내용을 낸다.
  • 사고 동작은 enable_thinking, preserve_thinking, reasoning_effort로 조절할 수 있고, reasoning_effort는 기본값이 xhigh이며 xhigh·medium·low를 지원한다.
  • 기본으로는 대화 속 모든 지난 메시지의 사고 블록을 그대로 남긴다(preserve_thinking). 회사는 이 방식이 맥락이 끊기지 않게 해 결정의 일관성이 중요하고 중복 추론을 줄여야 하는 에이전트 상황에 특히 도움이 되며, KV 캐시 활용도도 높인다고 밝혔다.
  • 가장 최근 사용자 메시지의 사고 블록만 남기려면 preserve_thinking을 False로 두면 된다.
  • Qwen Cloud의 API를 쓸 때는 enable_thinking과 preserve_thinking을 chat_template_kwargs로 감싸지 않고 바로 넘겨야 한다.
  • 또한 여러 차례 오가는 에이전트 작업에서는 추론 노력을 낮추는 것이 늘 전체 소요 시간을 줄여주지는 않는다고 회사는 덧붙였다.
  • 한 차례 응답은 빨라지더라도 분석이 모자라 실패와 재시도가 늘어 총 지연과 토큰 소모가 커질 수 있다는 설명이다.

벤치마크

벤치마크 무엇을 재나 Qwen3.8-Flash-Next (125B) Qwen3.7-Plus (397B) Qwen3.8-27B (27B) Claude-Opus-4.6 (Max) (—)
DeepSWE 1.1 에이전트 코딩 58.7 16.5 42.2 --
SWE-bench Pro 에이전트 코딩 62.5 55.8 61.7 53.4
SWE-bench Multilingual 다언어 소프트웨어 개발 81.0 75.8 73.8 77.5
NL2Repo-Bench 저장소 단위 코드 생성 48.1 41.1 42.3 47.6
CoWorkBench 장기 사무 업무 수행 73.9 65.1 70.7 68.2
JobBench 전문 직무 과제 55.7 27.6 33.4 36.6
Agents' Last Exam 고난도 에이전트 과제 Pass@1 24.3 / Score 51.2 Pass@1 13.2 / Score 33.6 Pass@1 20.4 / Score 42.9 --
Toolathlon Verified (Pass@1) 실제 도구 사용 73.5 50.6 67.1 --
IFBench 지시 따르기 81.3 79.1 79.5 62.5
GPQA Diamond 과학 추론 91.7 90.3 89.2 91.3
HLE 여러 분야 추론 35.9 34.7 30.8 40.0
LiveCodeBench v6 경쟁 프로그래밍 91.9 89.6 90.3 88.8
ClawEval-MM 멀티모달 도구 사용 Pass@3 64.4 / 평균 60.4 Pass@3 57.4 / 평균 60.1 Pass@3 57.4 / 평균 56.9 Pass@3 52.5 / 평균 54.7
RecreationBench 애플리케이션 재현 49.9 30.2 47.1 --
AndroidWorld 모바일 조작 84.5 81.0 81.9 62.0
OSWorld 2.0 컴퓨터 조작 Binary 19.4 / Partial 52.3 Binary 2.8 / Partial 21.5 Binary 19.4 / Partial 48.0 --
Vision2Web 화면 보고 웹 개발 64.0 42.1 62.9 --
ERQA 신체화 지능 72.3 69.8 65.5 40.8
LVBench 긴 영상 이해 76.6 76.2 72.4 63.0
RealWorldQA 실제 장면 인식 88.5 86.9 85.9 73.9
MathVision 이미지 수학 문제 풀이 CI 없음 90.6 / CI 있음 95.7 CI 없음 90.3 / CI 있음 88.7 CI 없음 90.0 / CI 있음 94.6 CI 없음 65.5
CharXiv (RQ) 과학 도표 분석 CI 없음 84.6 / CI 있음 90.6 CI 없음 85.8 / CI 있음 85.9 CI 없음 83.7 / CI 있음 90.2 CI 없음 66.0
  • 측정 조건: 코딩 항목은 Claude Code 또는 mini-SWE-agent 하네스에서 temp=1.0, top_p=0.95, 256K 컨텍스트로 재었고, SWE-bench Pro의 Claude-Opus-4.6 (Max) 점수는 공식 발표치이며, HLE는 GPT-4o가 채점했고 Vision2Web은 gpt-5.4-2026-03-05가 채점했다.
  • CoWorkBench와 RecreationBench는 회사 자체 벤치마크다.

같은 발표의 다른 판

원문