modellog

LLM 새 모델·변경 소식을 회사 공식 발표에서 모아 한국어로 정리한다

업스테이지 모델 출시 오픈형

업스테이지 Solar Open 2 공개 — 250B-A15B 오픈 웨이트

업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다. 전체 250B 가운데 토큰당 15B 만 쓰는 전문가 혼합 구조이고 컨텍스트는 1M 이다. 영어·한국어·일본어를 지원하며 자체 라이선스(Upstage Solar License)로 배포한다.

Solar Open 2 Solar-Open2-250B upstage/Solar-Open2-250B
컨텍스트 1M
라이선스 upstage-solar-license
파라미터 250B-A15B

업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다. 저장소 이름은 upstage/Solar-Open2-250B 다.

전문가 혼합 구조다. 전체 파라미터는 250B 인데 토큰 하나를 처리할 때 실제로 쓰는 것은 15B 다. 전문가는 321개(라우팅 320 + 공유 1)이고 그중 9개(라우팅 8 + 공유 1)가 활성화된다. 업스테이지는 이 점을 두고 추론 비용이 적다고 밝혔다.

어텐션은 소프트맥스와 선형을 섞은 하이브리드 방식이고, 회전 위치 인코딩을 쓰지 않는 NoPE 다. 컨텍스트는 1M 이다.

지원 언어는 영어·한국어·일본어 셋이다. 사전학습에 약 12조 토큰을 썼고 NVIDIA B200 GPU 로 2M GPU 시간을 들였다고 카드에 적혀 있다.

라이선스는 아파치나 MIT 같은 통용 라이선스가 아니라 자체 라이선스인 Upstage Solar License 다. 쓰기 전에 조건을 직접 확인해야 한다.

돌리려면 H200 이 최소 4장, 권장 8장이다.

회사가 밝힌 수치

원문 모델 카드의 Model Overview 표를 그대로 옮긴 것이다.

Field Value
Model Name Solar Open 2 (250B-A15B)
Architecture Hybrid-Attention Mixture-of-Experts (MoE)
Total Parameters 250B (250,287,794,944)
Active Parameters 15B (per token)
Layers 48
Hidden Size 4096
Attention Hybrid — Softmax + Linear Attention, pattern [Softmax, Linear×3] × 12
Position Encoding NoPE (no rotary positional encoding)
Number of Attention Heads (GQA) (Softmax) 64 query / 8 KV, (Linear) 64 query
Number of Experts 321 (320 routed + 1 shared)
Number of Activated Experts 8 routed (top-8) + 1 shared
Vocabulary 196,608
Context Length 1M
Pre-training Tokens ~12 Trillion
Supported Languages English, Korean, Japanese
Training Hardware NVIDIA B200 GPUs
Training GPU Time 2M GPU Hours
License Upstage Solar License
Hardware Requirements Minimum: H200 * 4ea / Recommended: H200 * 8ea

벤치마크 표(영어 67행·한국어)는 분량이 커서 여기 옮기지 않았다. 수집기가 스냅샷에서 기계로 옮긴다 → snapshots/2026-07-22-upstage-solar-open2-250b-card.md

원문