LongCat-2.0 공개, 1.6 trillion 파라미터 MoE 모델에 AI ASIC 기반 학습 적용
LongCat-2.0은 1.6 trillion 파라미터의 MoE 언어 모델로 공개됐다. AI ASIC superpods 기반으로 35 trillion 토큰 학습이 진행됐으며, LongCat Sparse Attention 등 아키텍처 개선이 적용됐다.
| LongCat-2.0 |
LongCat-2.0
meituan-longcat/LongCat-2.0
|
|---|
| 라이선스 | mit |
|---|
대규모 MoE 언어 모델인 LongCat-2.0이 소개됐다. 이 모델은 총 1.6 trillion개의 파라미터를 가지며 토큰당 약 48 billion개가 활성화되는데, 이는 이전 LongCat 모델들에 비해 크게 향상된 것이며 여러 아키텍처 개선을 동반한다. 전체 학습 과정과 대규모 배포 모두 AI ASIC superpods 위에서 완전히 구축된다. 사전학습은 35 trillion개가 넘는 토큰에 걸쳐 수백만 가속기-일 규모로 진행되었으며, 롤백이나 회복 불가능한 손실 급등 없이 이루어졌다. 이는 대체 하드웨어 플랫폼에서도 프런티어 규모의 학습을 수행할 능력을 갖추고 있음을 보여준다고 밝혔다. 장기 과제 처리 능력을 강화하기 위해 LongCat Sparse Attention이 도입되었고, 수천억 개의 1M-context 데이터 토큰으로 LongCat-2.0이 학습되었다. LongCat-2.0은 Claude Code, OpenClaw, Hermes와 같은 주류 하네스와 깊이 통합되어, 코드 이해, 저장소 수준 편집, 자동화된 작업 실행, 에이전틱 워크플로우 전반에서 뛰어난 성능을 발휘하며, 개발자에게 더 안정적이고 효율적인 협업 경험을 제공한다고 밝혔다. LongCat-2.0은 LongCat-Flash-Lite로부터 N-gram Embedding을 계승하여, MoE와 직교하는 희소 차원에서 파라미터를 확장함으로써 파라미터 활용 효율을 높였다.