모델 출시
AMD, 완전 개방형 혼합전문가 언어모델 Instella-MoE 공개
- AMD가 사전학습부터 RL까지 전 과정을 거쳐 학습한 완전 개방형 혼합전문가 언어모델 Instella-MoE를 공개했다.
- 16 billion 파라미터에 2.8 billion 활성 파라미터를 가지며, 학습 프레임워크와 데이터, 체크포인트를 모두 공개했다.
| 모델 | Instella-MoE-16B-A3B-Think |
|---|---|
| 저장소 | amd/Instella-MoE-16B-A3B-Think |
| 개방성 | 오픈형 |
| 라이선스 | researchrail |
- Instella-MoE는 사전학습부터 RL까지 전 과정에 걸쳐 학습된, 총 16 billion 파라미터와 2.8 billion 개의 활성 파라미터를 갖춘 최첨단의 완전 개방형 혼합전문가(MoE) 언어 모델이다.
- AMD Instinct™ MI300X 및 MI325X GPU에서 AMD의 Primus 프레임워크를 사용해 처음부터 학습된 Instella-MoE는 희소하게 활성화되는 MoE 설계와 Gated Multi-head Latent Attention(Gated MLA), FarSkip-Collective와 같은 아키텍처 혁신을 결합했다.
- Instella-MoE 모델 체크포인트 공개는 사전학습, 중간학습, 긴 컨텍스트 확장, SFT, DPO, RL을 포함한 모델 학습 파이프라인의 모든 단계를 아우른다.
- Primus 학습 프레임워크와 Miles RL 프레임워크 위에 AMD ROCm™ 소프트웨어 스택을 기반으로 완전히 구축된 Instella-MoE는 Gated Multi-head Latent Attention(Gated MLA)과 FarSkip-Collective를 통한 극한의 통신-연산 오버랩을 포함한 최첨단 아키텍처 및 시스템 혁신을 결합하여, AMD 하드웨어에서 효율적인 대규모 학습과 추론을 지원한다고 밝혔다.
- 회사는 학습 프레임워크, 데이터 혼합, 중간 체크포인트, 추론 코드를 포함한 모든 학습 단계에 걸친 완전한 학습 레시피를 제공한다고 밝혔다.
- 학습은 사전학습, 중간학습, 긴 컨텍스트 확장, SFT, DPO, RL로 이어지는 다단계 파이프라인을 통해 진행되며, 각 단계는 모델의 역량을 점진적으로 강화한다.