모델 출시
얀덱스, 러시아어·영어 기반 모델 AliceAI-Foundation-80B-A3B-Base 공개
- 얀덱스가 AliceAI-Foundation-80B-A3B-Base를 아파치 2.0으로 공개했다.
- 총 80B 중 토큰당 3B를 쓰는 MoE 하이브리드 모델로 컨텍스트는 26만 2144토큰이다.
- 사후 정렬을 거치지 않은 사전학습 단계 모델이다.
| 모델 | AliceAI-Foundation-80B-A3B-Base |
|---|---|
| 저장소 | yandex/AliceAI-Foundation-80B-A3B-Base |
| 개방성 | 오픈형 |
| 컨텍스트 | 262144 |
| 파라미터 | 80B-A3B |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- 얀덱스가 기반 언어 모델 AliceAI-Foundation-80B-A3B-Base를 공개했다.
- 하이브리드 구조에 MoE 층을 쓴 자기회귀 언어 모델이고, 처음부터 전부 새로 학습했다고 회사가 밝혔다.
- 지원 언어는 러시아어와 영어이며 라이선스는 아파치 2.0이다.
- 이 모델은 사후 학습(post-training)이나 정렬 단계를 거치지 않은 사전학습 단계의 모델로, 있는 그대로 제공된다.
- 회사는 연구와 실험, 추가 개발용으로 만든 것이라고 밝혔고, 사용자 제품이나 서비스에 바로 넣어 쓸 수 있는 완성된 해법은 아니라고 했다.
- 운영 환경에 넣기 전에는 직접 시험해 보고, 쓰임새에 맞춰 추가 학습과 동작 통제 단계를 마련할 것을 권했다.
가중치와 함께 러시아어 맥락에 맞춘 사실 지식 벤치마크 WikiWebFacts와 HardMultiQA, 그리고 그 평가 절차도 공개했다.
- 기반 모델이라 대화 형식이 하나로 정해져 있지 않다는 이유로, 저장소에 들어 있는 대화 템플릿을 tokenizer_config.json의 chat_template으로 지정하지는 않았다고 회사가 밝혔다.
- 이 템플릿은 추가 학습용 데이터를 만들 때 쓰라는 것이다.
규모와 구조
- 전체 파라미터 80B, 토큰당 활성 파라미터 3B
- 컨텍스트 길이 26만 2144토큰
- 은닉 상태 크기 2048, 어휘 크기 129024, 층 수 48
- 층 배치: 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))
- KDA: query 헤드 32개, KV 헤드 32개, query 헤드 차원 128, KV 헤드 차원 128, 합성곱 커널 크기 4
- Gated Attention: query 헤드 16개, KV 헤드 2개, query 헤드 차원 256
- MoE: 전문가 512개, Top-K 10개에 공용 전문가 1개, 전문가 중간 차원 512
- MTP 1개 층
회사가 밝힌 수치
- 회사는 학습 말뭉치를 새로 모으고 구조와 하이퍼파라미터를 고른 뒤, 복잡한 추론과 도구 사용을 위한 데이터를 따로 준비했다고 밝혔다.
- 주요 선택은 각각 2조 토큰 규모로 처음부터 학습하는 실험을 여러 번 돌려 검증했다고 한다.
수학과 프로그래밍 등 추론 과제에서 더 큰 오픈소스 모델과 비슷한 수준을 보이고, 러시아어 사실 지식 과제에서 특히 강하다는 것이 회사의 설명이다.
벤치마크
| 벤치마크 | 무엇을 재나 | AliceAI-Foundation-80B-A3B-Base (80B-A3B) | Qwen3.5-35B-A3B-Base (35B-A3B) | Nemotron-3-Super-120B-A12B-Base (120B-A12B) |
|---|---|---|---|---|
| WikiWebFacts | 러시아어 사실 지식 | 86.5 | 62.4 | 72.8 |
| HardMultiQA | 러시아어 사실 지식 | 67.9 | 47.2 | 54.5 |
| CultCat | 문화 관련 사실 지식 | 86.5 | 59.2 | 66.3 |
| TriviaQA | 영어 사실 지식 | 79.0 | 71.4 | 89.8 |
| EduBench Russian | 러시아어 교육 문제 | 74.2 | 42.9 | 44.0 |
| EduBench Literature | 문학 교육 문제 | 73.8 | 51.8 | 55.8 |
| EduBench History | 역사 교육 문제 | 82.0 | 65.9 | 70.2 |
| EduBench English | 영어 교육 문제 | 76.1 | 71.7 | 71.3 |
| ExpertFactsQA Medicine | 의학 분야 사실 지식 | 63.6 | 59.0 | 42.3 |
| ExpertFactsQA Law | 법률 분야 사실 지식 | 49.6 | 27.9 | 24.3 |
| EGE CoT | 러시아 통합국가시험 문제 | 90.5 | 84.7 | 84.3 |
| MMLU-Pro CoT | 여러 과목 지식과 추론 | 66.8 | 63.2 | 69.9 |
| SuperGPQA CoT | 전문가가 낸 학술 문제 | 44.3 | 43.6 | 46.6 |
| MATH-500 | 수학 문제 풀이 | 91.1 | 81.9 | 84.8 |
| EduBench Math | 수학 교육 문제 | 79.3 | 80.0 | 69.7 |
| EduBench Math University | 대학 수준 수학 문제 | 70.1 | 69.9 | 67.4 |
| BigCodeBench 1-shot pass@1 | 코드 작성 | 48.3 | 43.5 | 48.8 |
| LiveCodeBench v5-6 CoT 1-shot pass@1 | 알고리즘 코딩 | 50.5 | 50.4 | 50.4 |
| FinQA 128k | 긴 재무 보고서 분석 | 74.1 | 73.5 | 71.7 |
| LongMemEval 128k | 긴 대화 기록에서 정보 찾기 | 64.6 | 55.6 | 64.8 |
| AIME 2026 pass@32 | 수학 경시 문제 | 96.7 | 96.7 | 90.0 |
| HMMT 2026 Feb pass@32 | 수학 경시 문제 | 96.9 | 87.9 | 66.7 |
| IMO Answerbench pass@8 | 수학 올림피아드 문제 | 88.7 | 84.5 | 64.5 |
| CodeForces CPP pass@8 | C++ 경쟁 프로그래밍 | 68.9 | 73.7 | 56.6 |
| LiveCodeBench v5-6 pass@1 | 알고리즘 코딩 | 60.4 | 51.9 | 34.7 |
| LiveCodeBench v5-6 pass@8 | 알고리즘 코딩 | 82.9 | 82.1 | 59.8 |
- 회사는 모든 측정을 사내 측정 인프라에서 vLLM으로 돌렸다고 밝혔다.
- LongMemEval 128k까지는 모든 모델에 t=0을 썼고, AIME 2026 이하 여섯 줄은 t=1과 반복 페널티(repetition_penalty=1, presence_penalty=1.5)를 썼다.