모델 출시
dots studio, 오픈 웨이트 멀티모달 MoE 모델 dots3-note preview 공개
- dots studio가 dots3 계열의 첫 오픈 웨이트 모델 dots3-note preview를 공개했다.
- 전체 280B·활성 16B 파라미터의 MoE 구조로 최대 512K 토큰 컨텍스트를 지원하며, 텍스트·이미지·영상·음성을 입력받아 텍스트를 낸다.
- 라이선스는 Apache 2.0이다.
| 모델 | dots3-note-prev |
|---|---|
| 저장소 | dots-studio/dots3-note-prev |
| 모델 | dots3-note-prev-fp8 |
| 저장소 | dots-studio/dots3-note-prev-fp8 |
| 개방성 | 오픈형 |
| 컨텍스트 | 512K |
| 파라미터 | 280B |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- dots studio가 dots3 계열의 첫 오픈 웨이트 모델인 dots3-note preview를 공개했다.
- 회사는 이 모델이 전체 파라미터 280B, 활성 파라미터 16B의 Mixture-of-Experts 모델이며 최대 512K 토큰의 컨텍스트 길이를 지원한다고 밝혔다.
- 텍스트, 이미지, 영상, 음성을 이해하고 텍스트를 출력한다.
회사는 dots3 계열을 성능과 지연 시간, 추론 비용 사이의 균형이 서로 다른 모델들로 구성할 계획이며, dots3-note preview는 그중 가장 가벼운 구성원이라고 설명했다.
회사가 밝힌 구조
- 구조: 멀티모달 MoE
- 전체 파라미터 280B, 활성 파라미터 16B
- MTP: 공유 레이어 1개, 1.13B
- 레이어 수: dense 1개 + MoE 45개
- 히든 크기 5120, FFN 히든 크기는 dense 13824·전문가당 1536
- 전문가: 라우팅 256개 + 공유 1개, top-8
- 어텐션: DSA 13개 + SWA 33개(약 1:3), DSA는 Top-2048
- 컨텍스트 길이 512K, 어휘 크기 152K
- 비전 인코더: MoE ViT, 전체 7B·활성 1.2B
- 오디오 인코더: dense, 800M
- 지원 정밀도: BF16, FP8
- 입력은 텍스트·이미지·영상·음성, 출력은 텍스트
영상 입력은 오디오 트랙이 있으면 함께 처리된다.
회사가 권한 용도
- 회사는 이 모델이 다음과 같은 작업에 맞춰 최적화되었다고 밝혔다.
- 일반 지식과 지시 따르기, 수학·논리 추론, 도구 사용과 여러 단계에 걸친 에이전트 작업, 탐색·기억 갱신·적응이 필요한 상호작용 작업, 코드 생성과 코드 기반 문제 해결, 이미지·문서·차트·음성·영상 이해, 긴 컨텍스트 정보 처리다.
배포 형태
- 가중치는 Hugging Face와 ModelScope에 공개됐다.
- 기본 체크포인트인 dots3-note-prev와 FP8로 양자화한 dots3-note-prev-fp8 두 가지가 있다.
- vLLM은
main브랜치에서 이 모델을 기본 지원한다. - Transformers와 SGLang 쪽 지원은 아직 검토 중인 상태여서, 병합되기 전까지는 해당 변경분을 직접 가져다 써야 한다.
- SGLang에서는 MTP/NEXTN 방식의 추측 디코딩을 선택적으로 켤 수 있는데, 회사는 이를 통해 TPOT를 50% 넘게 줄일 수 있다고 밝혔다.
- 다만 프리필 단계의 CUDA 그래프는 아직 지원되지 않는다.
- 언어 모델만 불러오는 선택지와, OpenAI 호환 도구 호출을 켜는 선택지도 제공된다.
라이선스
- 저장소의 모델 가중치와 모델링 코드는 Apache License 2.0을 따른다.
- 저작권은 샤오홍슈에 있고, 개발과 공개는 dots studio가 맡았다.