모델 출시
Ling-3.0-tiny, 7.9B 파라미터의 경량 하이브리드 추론 MoE 모델로 공개
- Ling-3.0-tiny는 총 7.9B 파라미터, 토큰당 활성화 1.3B 파라미터를 가진 경량 하이브리드 추론 MoE 모델로 공개됐다.
- NVIDIA DGX Spark, Apple Silicon 등에서 검증됐다.
| 모델 | Ling-3.0-tiny |
|---|---|
| 저장소 | inclusionAI/Ling-3.0-tiny |
| 개방성 | 오픈형 |
| 라이선스 | MIT |
- 우리는 Ling-3.0-tiny를 소개한다.
- 이는 총 7.9B 파라미터와 토큰당 활성화되는 1.3B 파라미터만을 가진 경량 하이브리드 추론 MoE 모델이다.
- 이는 낮은 추론 비용으로 강력한 추론 및 에이전틱 능력을 제공하도록 설계되어, 로컬 및 자원이 제한된 배포 환경에서 고급 모델 능력을 더 쉽게 이용할 수 있게 한다.
- BF16, FP8, INT4 가중치가 다양한 하드웨어 및 배포 환경을 위해 제공된다.
- Ling-3.0-tiny는 KDA와 MLA를 3:1 비율로 교차 배치하는 방식을 통합했다.
- 4개 레이어 블록마다 3개의 Kimi Delta Attention 레이어 다음에 1개의 Multi-Head Latent Attention 레이어가 배치되며, 128개의 라우팅된 전문가로 구성된 희소 MoE FFN을 포함한다.
- Ling-3.0-tiny는 빠른 응답과 다단계 추론을 모두 지원하며, enable_thinking을 통해 요청별로 사고 모드를 설정할 수 있다.
- 효율적인 로컬 배포를 위해 설계된 Ling-3.0-tiny는 NVIDIA DGX Spark, Apple Silicon MacBook, Mac mini에서 검증되어, 데이터센터급 GPU 없이도 뛰어난 추론 및 에이전틱 작업을 수행할 수 있다고 회사가 밝혔다.