llmfeed

dots studio, 오픈 웨이트 멀티모달 MoE 모델 dots3-note preview 공개

dots studio
  • dots studio가 dots3 계열의 첫 오픈 웨이트 모델 dots3-note preview를 공개했다.
  • 전체 280B·활성 16B 파라미터의 MoE 구조로 최대 512K 토큰 컨텍스트를 지원하며, 텍스트·이미지·영상·음성을 입력받아 텍스트를 낸다.
  • 라이선스는 Apache 2.0이다.
모델dots3-note-prev
저장소dots-studio/dots3-note-prev
모델dots3-note-prev-fp8
저장소dots-studio/dots3-note-prev-fp8
개방성오픈형
컨텍스트 512K
파라미터 280B
라이선스 Apache-2.0

무엇이 나왔나

  • dots studio가 dots3 계열의 첫 오픈 웨이트 모델인 dots3-note preview를 공개했다.
  • 회사는 이 모델이 전체 파라미터 280B, 활성 파라미터 16B의 Mixture-of-Experts 모델이며 최대 512K 토큰의 컨텍스트 길이를 지원한다고 밝혔다.
  • 텍스트, 이미지, 영상, 음성을 이해하고 텍스트를 출력한다.

회사는 dots3 계열을 성능과 지연 시간, 추론 비용 사이의 균형이 서로 다른 모델들로 구성할 계획이며, dots3-note preview는 그중 가장 가벼운 구성원이라고 설명했다.

회사가 밝힌 구조

  • 구조: 멀티모달 MoE
  • 전체 파라미터 280B, 활성 파라미터 16B
  • MTP: 공유 레이어 1개, 1.13B
  • 레이어 수: dense 1개 + MoE 45개
  • 히든 크기 5120, FFN 히든 크기는 dense 13824·전문가당 1536
  • 전문가: 라우팅 256개 + 공유 1개, top-8
  • 어텐션: DSA 13개 + SWA 33개(약 1:3), DSA는 Top-2048
  • 컨텍스트 길이 512K, 어휘 크기 152K
  • 비전 인코더: MoE ViT, 전체 7B·활성 1.2B
  • 오디오 인코더: dense, 800M
  • 지원 정밀도: BF16, FP8
  • 입력은 텍스트·이미지·영상·음성, 출력은 텍스트

영상 입력은 오디오 트랙이 있으면 함께 처리된다.

회사가 권한 용도

  • 회사는 이 모델이 다음과 같은 작업에 맞춰 최적화되었다고 밝혔다.
  • 일반 지식과 지시 따르기, 수학·논리 추론, 도구 사용과 여러 단계에 걸친 에이전트 작업, 탐색·기억 갱신·적응이 필요한 상호작용 작업, 코드 생성과 코드 기반 문제 해결, 이미지·문서·차트·음성·영상 이해, 긴 컨텍스트 정보 처리다.

배포 형태

  • 가중치는 Hugging Face와 ModelScope에 공개됐다.
  • 기본 체크포인트인 dots3-note-prev와 FP8로 양자화한 dots3-note-prev-fp8 두 가지가 있다.
  • vLLM은 main 브랜치에서 이 모델을 기본 지원한다.
  • Transformers와 SGLang 쪽 지원은 아직 검토 중인 상태여서, 병합되기 전까지는 해당 변경분을 직접 가져다 써야 한다.
  • SGLang에서는 MTP/NEXTN 방식의 추측 디코딩을 선택적으로 켤 수 있는데, 회사는 이를 통해 TPOT를 50% 넘게 줄일 수 있다고 밝혔다.
  • 다만 프리필 단계의 CUDA 그래프는 아직 지원되지 않는다.
  • 언어 모델만 불러오는 선택지와, OpenAI 호환 도구 호출을 켜는 선택지도 제공된다.

라이선스

  • 저장소의 모델 가중치와 모델링 코드는 Apache License 2.0을 따른다.
  • 저작권은 샤오홍슈에 있고, 개발과 공개는 dots studio가 맡았다.

원문