llmfeed

Qwen 팀, 이미지·영상을 이해하는 27B 모델 Qwen3.8-27B 공개

큐원
  • Qwen 팀이 27B 규모 비전·언어 모델 Qwen3.8-27B를 Apache 2.0 라이선스로 공개했다.
  • 이미지와 영상을 이해하고, 기본으로 켜진 사고 모드를 요청마다 끄거나 reasoning_effort로 깊이를 조절할 수 있다.
모델Qwen3.8-27B
저장소Qwen/Qwen3.8-27B
개방성오픈형

무엇이 나왔나

  • Qwen 팀이 Qwen3.8 세대의 모델인 Qwen3.8-27B를 공개했다.
  • 후속 학습까지 마친 가중치와 설정 파일이 Hugging Face Transformers 형식으로 배포되며, 라이선스는 Apache 2.0이다.
  • 회사는 이 가중치가 Hugging Face Transformers, vLLM, SGLang, TokenSpeed 등에서 동작한다고 밝혔다.
  • FP8 버전인 Qwen/Qwen3.8-27B-FP8도 함께 배포됐다.
  • 회사는 Qwen3.8이 Qwen3.5의 구조를 바탕으로 만들어졌으며, 코딩·전문 업무·연구·장기 에이전트 작업 전반에서 개선이 있었다고 설명했다.
  • Qwen3.8-27B는 그 개선을 규모가 작은 밀집(dense) 모델에 담은 것으로, 이미지와 영상을 함께 이해하는 비전·언어 모델이다.

모델 구성

회사가 밝힌 사양은 다음과 같다.

  • 종류: 비전 인코더가 붙은 인과적 언어 모델
  • 학습 단계: 사전 학습과 후속 학습
  • 파라미터 수: 27B, 은닉 차원 5120, 층 수 64
  • 토큰 임베딩과 출력 층: 각각 248,320(패딩 포함)
  • 은닉 배치: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
  • Gated DeltaNet: 선형 어텐션 헤드가 V 48개, QK 16개, 헤드 차원 128
  • Gated Attention: Q 24개, KV 4개, 헤드 차원 256, 회전 위치 임베딩 차원 64
  • 피드포워드 중간 차원: 17,408
  • MTP(Multi-Token Prediction)를 여러 단계로 학습
  • 컨텍스트 길이: 기본 262,144토큰이며 최대 1,000,000토큰까지 확장 가능

사고 모드와 API 동작

  • 사고 모드는 기본으로 켜져 있고, 요청마다 끌 수 있다.
  • 추론 깊이는 reasoning_effort로 조절하며 xhigh(기본값), medium, low 세 단계를 지원한다고 회사는 밝혔다.
  • 또한 preserve_thinking이 모든 작업에서 기본으로 켜져 있어, 대화의 이전 메시지에 담긴 추론 내용이 그대로 유지된다.
  • 회사는 이 방식이 대화 전체의 맥락을 이어 주어 결정의 일관성이 중요한 에이전트 상황에 유리하고, KV 캐시 활용도도 높인다고 설명했다.
  • 가장 최근 사용자 메시지의 사고 블록만 남기고 싶으면 preserve_thinking을 False로 설정하면 된다.
  • Qwen Cloud의 API를 쓸 때는 이 값을 chat_template_kwargs로 감싸지 말고 그대로 전달해야 하며, 사고 모드를 끌 때도 마찬가지로 enable_thinking을 직접 넘겨야 한다.

회사는 다중 턴 에이전트 작업에서는 추론 깊이를 낮춘다고 해서 전체 작업 시간이 늘 줄어드는 것은 아니며, 분석이 부족해져 실패와 재시도가 늘면 오히려 전체 지연과 토큰 소모가 커질 수 있다고 덧붙였다.

활용과 권장 용도

  • 회사는 이미지와 영상 이해를 STEM 도표와 문서부터 한 시간 단위의 긴 영상까지 아우른다고 소개했다.
  • 또 자율적인 계획 수립과 환경 피드백 처리가 강해져 여러 단계로 이어지는 작업을 끝까지 마치는 데 더 안정적이며, 널리 쓰이는 도구와 개발 환경 지원 범위도 넓어졌다고 밝혔다.
  • 운영 환경이나 처리량이 큰 상황에서는 SGLang, vLLM, TokenSpeed 같은 전용 서빙 엔진을 쓰라고 권했다.
  • 인프라를 직접 관리하지 않으려는 사용자를 위해서는 Qwen Cloud의 API 서비스가 제공되며, Qwen3.8-27B는 기본 1M 컨텍스트 길이와 공식 내장 도구 등을 갖춘 호스팅 버전으로 곧 제공될 예정이라고 회사는 밝혔다.
  • 입력과 출력을 합한 길이가 262,144토큰을 넘는 장기 작업에는 YaRN 같은 RoPE 확장 기법을 쓰라고 권했다.
  • 다만 주요 오픈소스 프레임워크가 구현한 정적 YaRN은 입력 길이와 무관하게 배율이 고정되어 짧은 글에서는 성능에 영향을 줄 수 있으므로, 긴 문맥이 필요할 때만 설정을 바꾸라고 안내했다.

벤치마크

벤치마크 무엇을 재나 Qwen3.8-27B (27B) Qwen3.6-27B (—) Muse Glimmer-30B (—) Opus4.6 Max (—)
Terminal Bench 2.1 (Terminus) 터미널에서의 에이전트 코딩 73.0 63.4 51.7 78.2
SWE-bench Pro 에이전트 코딩 61.7 53.5 51.2 53.4
NL2Repo-Bench 저장소 단위 코드 생성 42.3 36.2 — 47.6
DeepSWE 1.1 에이전트 코딩 42.2 13.3 — —
QwenSWEBench 소프트웨어 공학 능력 79.0 49.3 — 63.8
CoWorkBench 장기 사무 업무 수행 70.7 61.0 — 68.2
JobBench 전문 직무 과제 33.4 21.8 — —
Agents' Last Exam 고난도 에이전트 과제 20.4(Pass@1) / 42.9(Score) 10.6(Pass@1) / 27.3(Score) — —
IFBench 지시 따르기 79.5 69.1 77.0 62.5
GPQA Diamond 과학 추론 89.2 87.8 83.5 91.3
HLE 여러 분야에 걸친 추론 30.8 24.0 22.0 40.0
LiveCodeBench v6 경쟁 프로그래밍 90.3 83.9 — 88.8
OSWorld-Verified 컴퓨터 조작 84.3 63.9 65.9 72.7
WebArena-Verified 브라우저 조작 64.8 48.8 — —
AndroidWorld 모바일 기기 조작 81.9 70.3 — 62.0
RecreationBench 애플리케이션 재현 47.1 29.8 — —
ClawEval-MM 멀티모달 도구 사용 57.4(Pass@3) / 56.9(평균) 42.6(Pass@3) / 50.4(평균) — 52.5(Pass@3) / 54.7(평균)
SWE-MM 멀티모달 소프트웨어 공학 38.6 25.7 — 27.1
Vision2Web 화면 기반 웹 개발 62.9 45.0 — —
MathVision 이미지 기반 수학 풀이 90.0(CI 없음) / 94.6(CI 사용) 85.1(CI 없음) — 65.5(CI 없음)
BabyVision 일반 시각 추론 65.7(CI 없음) / 85.6(CI 사용) 28.9(CI 없음) — 12.6(CI 없음)
CharXiv (RQ) 과학 도표 분석 83.7(CI 없음) / 90.2(CI 사용) 78.4(CI 없음) 78.8 66.0(CI 없음)
OmniDocBench 1.5 문서 이해 91.1 89.4 75.8 86.6
RealWorldQA 실제 환경 인식 85.9 84.1 — 73.9
ERQA 체화 지능 65.5 62.5 — 40.8
  • 회사는 SWE-bench Pro·DeepSWE 1.1·QwenSWEBench·Vision2Web·SWE-MM 등을 Claude Code 하네스로 측정했고, SWE-bench Pro는 Opus4.6 Max만 공식 발표 점수를 썼으며 나머지는 temp=1.0, top_p=0.95, 256K 컨텍스트로 재측정했다고 밝혔다.
  • 빈칸(—)은 결과가 아직 없거나 해당되지 않는 경우다.

같은 발표의 다른 판

원문