업스테이지 Solar Open 2 공개 — 250B-A15B 오픈 웨이트
업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다. 전체 250B 가운데 토큰당 15B 만 쓰는 전문가 혼합 구조이고 컨텍스트는 1M 이다. 영어·한국어·일본어를 지원하며 자체 라이선스(Upstage Solar License)로 배포한다.
| Solar Open 2 |
Solar-Open2-250B
upstage/Solar-Open2-250B
|
|---|
| 컨텍스트 | 1M |
|---|---|
| 라이선스 | upstage-solar-license |
| 파라미터 | 250B-A15B |
업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다. 저장소 이름은 upstage/Solar-Open2-250B 다.
전문가 혼합 구조다. 전체 파라미터는 250B 인데 토큰 하나를 처리할 때 실제로 쓰는 것은 15B 다. 전문가는 321개(라우팅 320 + 공유 1)이고 그중 9개(라우팅 8 + 공유 1)가 활성화된다. 업스테이지는 이 점을 두고 추론 비용이 적다고 밝혔다.
어텐션은 소프트맥스와 선형을 섞은 하이브리드 방식이고, 회전 위치 인코딩을 쓰지 않는 NoPE 다. 컨텍스트는 1M 이다.
지원 언어는 영어·한국어·일본어 셋이다. 사전학습에 약 12조 토큰을 썼고 NVIDIA B200 GPU 로 2M GPU 시간을 들였다고 카드에 적혀 있다.
라이선스는 아파치나 MIT 같은 통용 라이선스가 아니라 자체 라이선스인 Upstage Solar License 다. 쓰기 전에 조건을 직접 확인해야 한다.
돌리려면 H200 이 최소 4장, 권장 8장이다.
회사가 밝힌 수치
원문 모델 카드의 Model Overview 표를 그대로 옮긴 것이다.
| Field | Value |
|---|---|
| Model Name | Solar Open 2 (250B-A15B) |
| Architecture | Hybrid-Attention Mixture-of-Experts (MoE) |
| Total Parameters | 250B (250,287,794,944) |
| Active Parameters | 15B (per token) |
| Layers | 48 |
| Hidden Size | 4096 |
| Attention | Hybrid — Softmax + Linear Attention, pattern [Softmax, Linear×3] × 12 |
| Position Encoding | NoPE (no rotary positional encoding) |
| Number of Attention Heads (GQA) | (Softmax) 64 query / 8 KV, (Linear) 64 query |
| Number of Experts | 321 (320 routed + 1 shared) |
| Number of Activated Experts | 8 routed (top-8) + 1 shared |
| Vocabulary | 196,608 |
| Context Length | 1M |
| Pre-training Tokens | ~12 Trillion |
| Supported Languages | English, Korean, Japanese |
| Training Hardware | NVIDIA B200 GPUs |
| Training GPU Time | 2M GPU Hours |
| License | Upstage Solar License |
| Hardware Requirements | Minimum: H200 * 4ea / Recommended: H200 * 8ea |
벤치마크 표(영어 67행·한국어)는 분량이 커서 여기 옮기지 않았다. 수집기가 스냅샷에서 기계로 옮긴다 → snapshots/2026-07-22-upstage-solar-open2-250b-card.md