모델 출시
LongCat-2.0 공개, 1.6 trillion 파라미터 MoE 모델에 AI ASIC 기반 학습 적용
- LongCat-2.0은 1.6 trillion 파라미터의 MoE 언어 모델로 공개됐다.
- AI ASIC superpods 기반으로 35 trillion 토큰 학습이 진행됐으며, LongCat Sparse Attention 등 아키텍처 개선이 적용됐다.
| 모델 | LongCat-2.0 |
|---|---|
| 저장소 | meituan-longcat/LongCat-2.0 |
| 개방성 | 오픈형 |
| 라이선스 | MIT |
- 대규모 MoE 언어 모델인 LongCat-2.0이 소개됐다.
- 이 모델은 총 1.6 trillion개의 파라미터를 가지며 토큰당 약 48 billion개가 활성화되는데, 이는 이전 LongCat 모델들에 비해 크게 향상된 것이며 여러 아키텍처 개선을 동반한다.
- 전체 학습 과정과 대규모 배포 모두 AI ASIC superpods 위에서 완전히 구축된다.
- 사전학습은 35 trillion개가 넘는 토큰에 걸쳐 수백만 가속기-일 규모로 진행되었으며, 롤백이나 회복 불가능한 손실 급등 없이 이루어졌다.
- 이는 대체 하드웨어 플랫폼에서도 프런티어 규모의 학습을 수행할 능력을 갖추고 있음을 보여준다고 밝혔다.
- 장기 과제 처리 능력을 강화하기 위해 LongCat Sparse Attention이 도입되었고, 수천억 개의 1M-context 데이터 토큰으로 LongCat-2.0이 학습되었다.
- LongCat-2.0은 Claude Code, OpenClaw, Hermes와 같은 주류 하네스와 깊이 통합되어, 코드 이해, 저장소 수준 편집, 자동화된 작업 실행, 에이전틱 워크플로우 전반에서 뛰어난 성능을 발휘하며, 개발자에게 더 안정적이고 효율적인 협업 경험을 제공한다고 밝혔다.
- LongCat-2.0은 LongCat-Flash-Lite로부터 N-gram Embedding을 계승하여, MoE와 직교하는 희소 차원에서 파라미터를 확장함으로써 파라미터 활용 효율을 높였다.