총 124B 파라미터와 5.1B 활성 파라미터(이전 1T급 플래그십 모델인 Ring-2.6-1T의 약 12.4%와 약 8.1%)로 작동하는 Ling-3.0-flash는 주요 벤치마크에서 이전 모델과 동등하거나 더 뛰어난 성능을 보인다.
Ling-3.0은 사전학습 초기 단계부터 네이티브 하이브리드 선형 어텐션 아키텍처(Kimi Delta Attention(KDA)와 MLA를 5:1 비율로 교대로 쌓은 구조)를 채택했으며, KDA 세밀한 대각 게이팅과 1/64 희소 MoE로 업그레이드되었다.
토큰당 5.1B 파라미터만 활성화하면서도, 뛰어난 추론 능력, 지시 이행 능력, 장문맥 처리 능력을 제공하여 프로덕션 환경에서 복잡한 에이전틱 워크플로우를 뒷받침한다.
실제 생산성 워크플로우에 맞춰, 이 모델은 10,000개 이상의 상호작용 훈련 환경을 통합하여 코딩, 일반, 심층 리서치 에이전트 작업 전반에서 종단 간 폐루프 실행을 달성한다.
이 모델은 SGLang HiCache + Mooncake 계층형 캐싱 아키텍처(물리적 이중 풀과 클러스터 공유 L3 캐시를 특징으로 함)를 네이티브로 통합하여, 장시간 상호작용 중 중복 재계산을 제거하고 장문 입력 시나리오에서 최초 토큰 생성 시간(TTFT)을 60%에서 80% 이상까지 단축한다.