llmfeed

Ling-3.0-flash, 하이브리드 선형 어텐션과 폐루프 에이전트 실행을 갖춘 차세대 추론 모델로 공개

inclusionAI
  • Ling-3.0-flash는 124B 파라미터와 5.1B 활성 파라미터로 이전 1T급 모델과 동등하거나 더 뛰어난 성능을 내며, KDA와 MLA를 결합한 하이브리드 아키텍처와 계층형 캐싱으로 TTFT를 60%에서 80% 이상 단축했다.
모델Ling-3.0-flash
저장소inclusionAI/Ling-3.0-flash
개방성오픈형
라이선스 MIT
  • 저희는 차세대 네이티브 하이브리드 추론 모델인 Ling-3.0-flash를 소개합니다.
  • 총 124B 파라미터와 5.1B 활성 파라미터(이전 1T급 플래그십 모델인 Ring-2.6-1T의 약 12.4%와 약 8.1%)로 작동하는 Ling-3.0-flash는 주요 벤치마크에서 이전 모델과 동등하거나 더 뛰어난 성능을 보인다.
  • Ling-3.0은 사전학습 초기 단계부터 네이티브 하이브리드 선형 어텐션 아키텍처(Kimi Delta Attention(KDA)와 MLA를 5:1 비율로 교대로 쌓은 구조)를 채택했으며, KDA 세밀한 대각 게이팅과 1/64 희소 MoE로 업그레이드되었다.
  • 토큰당 5.1B 파라미터만 활성화하면서도, 뛰어난 추론 능력, 지시 이행 능력, 장문맥 처리 능력을 제공하여 프로덕션 환경에서 복잡한 에이전틱 워크플로우를 뒷받침한다.
  • 실제 생산성 워크플로우에 맞춰, 이 모델은 10,000개 이상의 상호작용 훈련 환경을 통합하여 코딩, 일반, 심층 리서치 에이전트 작업 전반에서 종단 간 폐루프 실행을 달성한다.
  • 이 모델은 SGLang HiCache + Mooncake 계층형 캐싱 아키텍처(물리적 이중 풀과 클러스터 공유 L3 캐시를 특징으로 함)를 네이티브로 통합하여, 장시간 상호작용 중 중복 재계산을 제거하고 장문 입력 시나리오에서 최초 토큰 생성 시간(TTFT)을 60%에서 80% 이상까지 단축한다.

회사가 밝힌 수치

Architecture Hybrid-linear MoE
Parameter Scale Total 124B, Activated 5.1B
Transformer Layers 35 KDA + 7 Gated MLA (5:1)
Number of Dense Layers 2
Number of Routed Experts 512
Number of Shared Experts 1
Number of Activated Experts 8
Attention Heads 32
Hidden Size 2560
Expert Intermediate Size 768
Dense Intermediate Size 6144
Vocabulary Size 157184
Context Training Schedule 8K -> 32K -> 256K

원문