llmfeed

얀덱스, 러시아어·영어 기반 모델 AliceAI-Foundation-80B-A3B-Base 공개

얀덱스
  • 얀덱스가 AliceAI-Foundation-80B-A3B-Base를 아파치 2.0으로 공개했다.
  • 총 80B 중 토큰당 3B를 쓰는 MoE 하이브리드 모델로 컨텍스트는 26만 2144토큰이다.
  • 사후 정렬을 거치지 않은 사전학습 단계 모델이다.
모델AliceAI-Foundation-80B-A3B-Base
저장소yandex/AliceAI-Foundation-80B-A3B-Base
개방성오픈형
컨텍스트 262144
파라미터 80B-A3B
라이선스 Apache-2.0

무엇이 나왔나

  • 얀덱스가 기반 언어 모델 AliceAI-Foundation-80B-A3B-Base를 공개했다.
  • 하이브리드 구조에 MoE 층을 쓴 자기회귀 언어 모델이고, 처음부터 전부 새로 학습했다고 회사가 밝혔다.
  • 지원 언어는 러시아어와 영어이며 라이선스는 아파치 2.0이다.
  • 이 모델은 사후 학습(post-training)이나 정렬 단계를 거치지 않은 사전학습 단계의 모델로, 있는 그대로 제공된다.
  • 회사는 연구와 실험, 추가 개발용으로 만든 것이라고 밝혔고, 사용자 제품이나 서비스에 바로 넣어 쓸 수 있는 완성된 해법은 아니라고 했다.
  • 운영 환경에 넣기 전에는 직접 시험해 보고, 쓰임새에 맞춰 추가 학습과 동작 통제 단계를 마련할 것을 권했다.

가중치와 함께 러시아어 맥락에 맞춘 사실 지식 벤치마크 WikiWebFacts와 HardMultiQA, 그리고 그 평가 절차도 공개했다.

  • 기반 모델이라 대화 형식이 하나로 정해져 있지 않다는 이유로, 저장소에 들어 있는 대화 템플릿을 tokenizer_config.json의 chat_template으로 지정하지는 않았다고 회사가 밝혔다.
  • 이 템플릿은 추가 학습용 데이터를 만들 때 쓰라는 것이다.

규모와 구조

  • 전체 파라미터 80B, 토큰당 활성 파라미터 3B
  • 컨텍스트 길이 26만 2144토큰
  • 은닉 상태 크기 2048, 어휘 크기 129024, 층 수 48
  • 층 배치: 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))
  • KDA: query 헤드 32개, KV 헤드 32개, query 헤드 차원 128, KV 헤드 차원 128, 합성곱 커널 크기 4
  • Gated Attention: query 헤드 16개, KV 헤드 2개, query 헤드 차원 256
  • MoE: 전문가 512개, Top-K 10개에 공용 전문가 1개, 전문가 중간 차원 512
  • MTP 1개 층

회사가 밝힌 수치

  • 회사는 학습 말뭉치를 새로 모으고 구조와 하이퍼파라미터를 고른 뒤, 복잡한 추론과 도구 사용을 위한 데이터를 따로 준비했다고 밝혔다.
  • 주요 선택은 각각 2조 토큰 규모로 처음부터 학습하는 실험을 여러 번 돌려 검증했다고 한다.

수학과 프로그래밍 등 추론 과제에서 더 큰 오픈소스 모델과 비슷한 수준을 보이고, 러시아어 사실 지식 과제에서 특히 강하다는 것이 회사의 설명이다.

벤치마크

벤치마크 무엇을 재나 AliceAI-Foundation-80B-A3B-Base (80B-A3B) Qwen3.5-35B-A3B-Base (35B-A3B) Nemotron-3-Super-120B-A12B-Base (120B-A12B)
WikiWebFacts 러시아어 사실 지식 86.5 62.4 72.8
HardMultiQA 러시아어 사실 지식 67.9 47.2 54.5
CultCat 문화 관련 사실 지식 86.5 59.2 66.3
TriviaQA 영어 사실 지식 79.0 71.4 89.8
EduBench Russian 러시아어 교육 문제 74.2 42.9 44.0
EduBench Literature 문학 교육 문제 73.8 51.8 55.8
EduBench History 역사 교육 문제 82.0 65.9 70.2
EduBench English 영어 교육 문제 76.1 71.7 71.3
ExpertFactsQA Medicine 의학 분야 사실 지식 63.6 59.0 42.3
ExpertFactsQA Law 법률 분야 사실 지식 49.6 27.9 24.3
EGE CoT 러시아 통합국가시험 문제 90.5 84.7 84.3
MMLU-Pro CoT 여러 과목 지식과 추론 66.8 63.2 69.9
SuperGPQA CoT 전문가가 낸 학술 문제 44.3 43.6 46.6
MATH-500 수학 문제 풀이 91.1 81.9 84.8
EduBench Math 수학 교육 문제 79.3 80.0 69.7
EduBench Math University 대학 수준 수학 문제 70.1 69.9 67.4
BigCodeBench 1-shot pass@1 코드 작성 48.3 43.5 48.8
LiveCodeBench v5-6 CoT 1-shot pass@1 알고리즘 코딩 50.5 50.4 50.4
FinQA 128k 긴 재무 보고서 분석 74.1 73.5 71.7
LongMemEval 128k 긴 대화 기록에서 정보 찾기 64.6 55.6 64.8
AIME 2026 pass@32 수학 경시 문제 96.7 96.7 90.0
HMMT 2026 Feb pass@32 수학 경시 문제 96.9 87.9 66.7
IMO Answerbench pass@8 수학 올림피아드 문제 88.7 84.5 64.5
CodeForces CPP pass@8 C++ 경쟁 프로그래밍 68.9 73.7 56.6
LiveCodeBench v5-6 pass@1 알고리즘 코딩 60.4 51.9 34.7
LiveCodeBench v5-6 pass@8 알고리즘 코딩 82.9 82.1 59.8
  • 회사는 모든 측정을 사내 측정 인프라에서 vLLM으로 돌렸다고 밝혔다.
  • LongMemEval 128k까지는 모든 모델에 t=0을 썼고, AIME 2026 이하 여섯 줄은 t=1과 반복 페널티(repetition_penalty=1, presence_penalty=1.5)를 썼다.

원문