모델 출시
오픈소스 삼진법 가중치 추론 모델 Maple-Preview 공개
- 20B-A1B 삼진법 가중치 추론 대규모 언어 모델 Maple-Preview가 공개됐다.
- IMO 수준 문제를 풀고 Mac mini M4에서 200+ tokens/sec로 동작하며 Gemma 4, Qwen3.5, gpt-oss보다 5–16× 빠르다.
| 모델 | Maple-Preview |
|---|---|
| API 이름 | maple-preview |
| 저장소 | deepgrove/maple-preview |
| 개방성 | 오픈형 |
| 라이선스 | MIT |
- 오늘 오픈소스 20B-A1B 삼진법 가중치 추론 대규모 언어 모델인 Maple-Preview가 소개됐다.
- 이는 IMO 수준의 문제를 해결하며, Mac mini M4에서 200+ tokens/sec로 실행되어 Gemma 4, Qwen3.5, gpt-oss와 같은 효율적인 모델보다 5–16× 더 빠르다.
- Maple-Preview는 처음부터 효율적인 온디바이스 추론을 위해 설계된 20B-A1B 추론 모델이다.
- 이는 3:1 SWA-512:GA 어텐션을 갖춘 24계층, 256전문가(8개 활성) 구성을 활용한다.
- 그러나 이번 프리뷰는 주로 순수 추론에 초점을 맞추고 있으며, 따라서 에이전트형 벤치마크에서는 성능이 낮을 수 있음을 유의해야 한다.
- 이번 프리뷰는 에이전트형 작업에 대한 후속 학습을 최소한으로만 받았으며, 소규모의 일반적인 강화학습만 거쳤다.