llmfeed

업스테이지 Solar Open 2 공개 — 250B-A15B 오픈 웨이트

업스테이지
  • 업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다.
  • 전체 250B 가운데 토큰당 15B 만 쓰는 전문가 혼합 구조이고 컨텍스트는 1M 이다.
  • 영어·한국어·일본어를 지원하며 자체 라이선스(Upstage Solar License)로 배포한다.
모델Solar Open 2
API 이름Solar-Open2-250B
저장소upstage/Solar-Open2-250B
개방성오픈형
컨텍스트 1M
파라미터 250B-A15B
라이선스 upstage-solar-license
  • 업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다.
  • 저장소 이름은 upstage/Solar-Open2-250B 다.
  • 전문가 혼합 구조다.
  • 전체 파라미터는 250B 인데 토큰 하나를 처리할 때 실제로 쓰는 것은 15B 다.
  • 전문가는 321개(라우팅 320 + 공유 1)이고 그중 9개(라우팅 8 + 공유 1)가 활성화된다.
  • 업스테이지는 이 점을 두고 추론 비용이 적다고 밝혔다.
  • 어텐션은 소프트맥스와 선형을 섞은 하이브리드 방식이고, 회전 위치 인코딩을 쓰지 않는 NoPE 다.
  • 컨텍스트는 1M 이다.
  • 지원 언어는 영어·한국어·일본어 셋이다.
  • 사전학습에 약 12조 토큰을 썼고 NVIDIA B200 GPU 로 2M GPU 시간을 들였다고 카드에 적혀 있다.
  • 라이선스는 아파치나 MIT 같은 통용 라이선스가 아니라 자체 라이선스인 Upstage Solar License 다.
  • 쓰기 전에 조건을 직접 확인해야 한다.

돌리려면 H200 이 최소 4장, 권장 8장이다.

회사가 밝힌 수치

원문 모델 카드의 Model Overview 표를 그대로 옮긴 것이다.

Field Value
Model Name Solar Open 2 (250B-A15B)
Architecture Hybrid-Attention Mixture-of-Experts (MoE)
Total Parameters 250B (250,287,794,944)
Active Parameters 15B (per token)
Layers 48
Hidden Size 4096
Attention Hybrid — Softmax + Linear Attention, pattern [Softmax, Linear×3] × 12
Position Encoding NoPE (no rotary positional encoding)
Number of Attention Heads (GQA) (Softmax) 64 query / 8 KV, (Linear) 64 query
Number of Experts 321 (320 routed + 1 shared)
Number of Activated Experts 8 routed (top-8) + 1 shared
Vocabulary 196,608
Context Length 1M
Pre-training Tokens ~12 Trillion
Supported Languages English, Korean, Japanese
Training Hardware NVIDIA B200 GPUs
Training GPU Time 2M GPU Hours
License Upstage Solar License
Hardware Requirements Minimum: H200 * 4ea / Recommended: H200 * 8ea
  • 벤치마크 표(영어 67행·한국어)는 분량이 커서 여기 옮기지 않았다.
  • 수집기가 스냅샷에서 기계로 옮긴다 → snapshots/2026-07-22-upstage-solar-open2-250b-card.md

원문