AMD, 완전 개방형 혼합전문가 언어모델 Instella-MoE 공개
AMD가 사전학습부터 RL까지 전 과정을 거쳐 학습한 완전 개방형 혼합전문가 언어모델 Instella-MoE를 공개했다. 16 billion 파라미터에 2.8 billion 활성 파라미터를 가지며, 학습 프레임워크와 데이터, 체크포인트를 모두 공개했다.
| Instella-MoE-16B-A3B-Think |
Instella-MoE-16B-A3B-Think
amd/Instella-MoE-16B-A3B-Think
|
|---|
| 라이선스 | researchrail |
|---|
Instella-MoE는 사전학습부터 RL까지 전 과정에 걸쳐 학습된, 총 16 billion 파라미터와 2.8 billion 개의 활성 파라미터를 갖춘 최첨단의 완전 개방형 혼합전문가(MoE) 언어 모델이다. AMD Instinct™ MI300X 및 MI325X GPU에서 AMD의 Primus 프레임워크를 사용해 처음부터 학습된 Instella-MoE는 희소하게 활성화되는 MoE 설계와 Gated Multi-head Latent Attention(Gated MLA), FarSkip-Collective와 같은 아키텍처 혁신을 결합했다. Instella-MoE 모델 체크포인트 공개는 사전학습, 중간학습, 긴 컨텍스트 확장, SFT, DPO, RL을 포함한 모델 학습 파이프라인의 모든 단계를 아우른다. Primus 학습 프레임워크와 Miles RL 프레임워크 위에 AMD ROCm™ 소프트웨어 스택을 기반으로 완전히 구축된 Instella-MoE는 Gated Multi-head Latent Attention(Gated MLA)과 FarSkip-Collective를 통한 극한의 통신-연산 오버랩을 포함한 최첨단 아키텍처 및 시스템 혁신을 결합하여, AMD 하드웨어에서 효율적인 대규모 학습과 추론을 지원한다고 밝혔다. 회사는 학습 프레임워크, 데이터 혼합, 중간 체크포인트, 추론 코드를 포함한 모든 학습 단계에 걸친 완전한 학습 레시피를 제공한다고 밝혔다. 학습은 사전학습, 중간학습, 긴 컨텍스트 확장, SFT, DPO, RL로 이어지는 다단계 파이프라인을 통해 진행되며, 각 단계는 모델의 역량을 점진적으로 강화한다.