모델 출시
Qwen 팀, 이미지·영상을 이해하는 27B 모델 Qwen3.8-27B 공개
- Qwen 팀이 27B 규모 비전·언어 모델 Qwen3.8-27B를 Apache 2.0 라이선스로 공개했다.
- 이미지와 영상을 이해하고, 기본으로 켜진 사고 모드를 요청마다 끄거나 reasoning_effort로 깊이를 조절할 수 있다.
| 모델 | Qwen3.8-27B |
|---|---|
| 저장소 | Qwen/Qwen3.8-27B |
| 개방성 | 오픈형 |
무엇이 나왔나
- Qwen 팀이 Qwen3.8 세대의 모델인 Qwen3.8-27B를 공개했다.
- 후속 학습까지 마친 가중치와 설정 파일이 Hugging Face Transformers 형식으로 배포되며, 라이선스는 Apache 2.0이다.
- 회사는 이 가중치가 Hugging Face Transformers, vLLM, SGLang, TokenSpeed 등에서 동작한다고 밝혔다.
- FP8 버전인 Qwen/Qwen3.8-27B-FP8도 함께 배포됐다.
- 회사는 Qwen3.8이 Qwen3.5의 구조를 바탕으로 만들어졌으며, 코딩·전문 업무·연구·장기 에이전트 작업 전반에서 개선이 있었다고 설명했다.
- Qwen3.8-27B는 그 개선을 규모가 작은 밀집(dense) 모델에 담은 것으로, 이미지와 영상을 함께 이해하는 비전·언어 모델이다.
모델 구성
회사가 밝힌 사양은 다음과 같다.
- 종류: 비전 인코더가 붙은 인과적 언어 모델
- 학습 단계: 사전 학습과 후속 학습
- 파라미터 수: 27B, 은닉 차원 5120, 층 수 64
- 토큰 임베딩과 출력 층: 각각 248,320(패딩 포함)
- 은닉 배치: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
- Gated DeltaNet: 선형 어텐션 헤드가 V 48개, QK 16개, 헤드 차원 128
- Gated Attention: Q 24개, KV 4개, 헤드 차원 256, 회전 위치 임베딩 차원 64
- 피드포워드 중간 차원: 17,408
- MTP(Multi-Token Prediction)를 여러 단계로 학습
- 컨텍스트 길이: 기본 262,144토큰이며 최대 1,000,000토큰까지 확장 가능
사고 모드와 API 동작
- 사고 모드는 기본으로 켜져 있고, 요청마다 끌 수 있다.
- 추론 깊이는
reasoning_effort로 조절하며xhigh(기본값),medium,low세 단계를 지원한다고 회사는 밝혔다.
- 또한
preserve_thinking이 모든 작업에서 기본으로 켜져 있어, 대화의 이전 메시지에 담긴 추론 내용이 그대로 유지된다. - 회사는 이 방식이 대화 전체의 맥락을 이어 주어 결정의 일관성이 중요한 에이전트 상황에 유리하고, KV 캐시 활용도도 높인다고 설명했다.
- 가장 최근 사용자 메시지의 사고 블록만 남기고 싶으면
preserve_thinking을False로 설정하면 된다. - Qwen Cloud의 API를 쓸 때는 이 값을
chat_template_kwargs로 감싸지 말고 그대로 전달해야 하며, 사고 모드를 끌 때도 마찬가지로enable_thinking을 직접 넘겨야 한다.
회사는 다중 턴 에이전트 작업에서는 추론 깊이를 낮춘다고 해서 전체 작업 시간이 늘 줄어드는 것은 아니며, 분석이 부족해져 실패와 재시도가 늘면 오히려 전체 지연과 토큰 소모가 커질 수 있다고 덧붙였다.
활용과 권장 용도
- 회사는 이미지와 영상 이해를 STEM 도표와 문서부터 한 시간 단위의 긴 영상까지 아우른다고 소개했다.
- 또 자율적인 계획 수립과 환경 피드백 처리가 강해져 여러 단계로 이어지는 작업을 끝까지 마치는 데 더 안정적이며, 널리 쓰이는 도구와 개발 환경 지원 범위도 넓어졌다고 밝혔다.
- 운영 환경이나 처리량이 큰 상황에서는 SGLang, vLLM, TokenSpeed 같은 전용 서빙 엔진을 쓰라고 권했다.
- 인프라를 직접 관리하지 않으려는 사용자를 위해서는 Qwen Cloud의 API 서비스가 제공되며, Qwen3.8-27B는 기본 1M 컨텍스트 길이와 공식 내장 도구 등을 갖춘 호스팅 버전으로 곧 제공될 예정이라고 회사는 밝혔다.
- 입력과 출력을 합한 길이가 262,144토큰을 넘는 장기 작업에는 YaRN 같은 RoPE 확장 기법을 쓰라고 권했다.
- 다만 주요 오픈소스 프레임워크가 구현한 정적 YaRN은 입력 길이와 무관하게 배율이 고정되어 짧은 글에서는 성능에 영향을 줄 수 있으므로, 긴 문맥이 필요할 때만 설정을 바꾸라고 안내했다.
벤치마크
| 벤치마크 | 무엇을 재나 | Qwen3.8-27B (27B) | Qwen3.6-27B (—) | Muse Glimmer-30B (—) | Opus4.6 Max (—) |
|---|---|---|---|---|---|
| Terminal Bench 2.1 (Terminus) | 터미널에서의 에이전트 코딩 | 73.0 | 63.4 | 51.7 | 78.2 |
| SWE-bench Pro | 에이전트 코딩 | 61.7 | 53.5 | 51.2 | 53.4 |
| NL2Repo-Bench | 저장소 단위 코드 생성 | 42.3 | 36.2 | — | 47.6 |
| DeepSWE 1.1 | 에이전트 코딩 | 42.2 | 13.3 | — | — |
| QwenSWEBench | 소프트웨어 공학 능력 | 79.0 | 49.3 | — | 63.8 |
| CoWorkBench | 장기 사무 업무 수행 | 70.7 | 61.0 | — | 68.2 |
| JobBench | 전문 직무 과제 | 33.4 | 21.8 | — | — |
| Agents' Last Exam | 고난도 에이전트 과제 | 20.4(Pass@1) / 42.9(Score) | 10.6(Pass@1) / 27.3(Score) | — | — |
| IFBench | 지시 따르기 | 79.5 | 69.1 | 77.0 | 62.5 |
| GPQA Diamond | 과학 추론 | 89.2 | 87.8 | 83.5 | 91.3 |
| HLE | 여러 분야에 걸친 추론 | 30.8 | 24.0 | 22.0 | 40.0 |
| LiveCodeBench v6 | 경쟁 프로그래밍 | 90.3 | 83.9 | — | 88.8 |
| OSWorld-Verified | 컴퓨터 조작 | 84.3 | 63.9 | 65.9 | 72.7 |
| WebArena-Verified | 브라우저 조작 | 64.8 | 48.8 | — | — |
| AndroidWorld | 모바일 기기 조작 | 81.9 | 70.3 | — | 62.0 |
| RecreationBench | 애플리케이션 재현 | 47.1 | 29.8 | — | — |
| ClawEval-MM | 멀티모달 도구 사용 | 57.4(Pass@3) / 56.9(평균) | 42.6(Pass@3) / 50.4(평균) | — | 52.5(Pass@3) / 54.7(평균) |
| SWE-MM | 멀티모달 소프트웨어 공학 | 38.6 | 25.7 | — | 27.1 |
| Vision2Web | 화면 기반 웹 개발 | 62.9 | 45.0 | — | — |
| MathVision | 이미지 기반 수학 풀이 | 90.0(CI 없음) / 94.6(CI 사용) | 85.1(CI 없음) | — | 65.5(CI 없음) |
| BabyVision | 일반 시각 추론 | 65.7(CI 없음) / 85.6(CI 사용) | 28.9(CI 없음) | — | 12.6(CI 없음) |
| CharXiv (RQ) | 과학 도표 분석 | 83.7(CI 없음) / 90.2(CI 사용) | 78.4(CI 없음) | 78.8 | 66.0(CI 없음) |
| OmniDocBench 1.5 | 문서 이해 | 91.1 | 89.4 | 75.8 | 86.6 |
| RealWorldQA | 실제 환경 인식 | 85.9 | 84.1 | — | 73.9 |
| ERQA | 체화 지능 | 65.5 | 62.5 | — | 40.8 |
- 회사는 SWE-bench Pro·DeepSWE 1.1·QwenSWEBench·Vision2Web·SWE-MM 등을 Claude Code 하네스로 측정했고, SWE-bench Pro는 Opus4.6 Max만 공식 발표 점수를 썼으며 나머지는 temp=1.0, top_p=0.95, 256K 컨텍스트로 재측정했다고 밝혔다.
- 빈칸(—)은 결과가 아직 없거나 해당되지 않는 경우다.