모델 출시
VIDRAFT, 180B 전문가 혼합 추론 모델 Darwin-180B-RSI 공개
f- VIDRAFT가 Qwen3.8-Flash-Next를 바탕으로 한 180B 전문가 혼합 추론 모델 Darwin-180B-RSI를 공개했다.
- 스스로 푼 답 중 검증된 것만 다시 학습하는 방식을 썼고, 이미지와 텍스트를 받아 글을 낸다.
| 모델 | Darwin-180B-RSI |
|---|---|
| 저장소 | FINAL-Bench/Darwin-180B-RSI |
| 개방성 | 오픈형 |
| 컨텍스트 | 262K |
| 파라미터 | 180B |
| 라이선스 | Qwen Community License 1.0 |
무엇이 나왔나
- VIDRAFT가 Darwin 계열의 새 대표 모델 Darwin-180B-RSI를 Hugging Face에 공개했다.
- 이미지와 텍스트를 받아 글로 답하는 추론(thinking) 모델이며, 한국어와 영어를 지원한다.
- Alibaba의 Qwen3.8-Flash-Next를 부모 모델로 삼아 만든 파생 모델이고, Qwen Community License 1.0으로 배포된다.
- Darwin은 공개된 강한 모델을 부모로 두고, 부모가 약한 부분을 측정해 그 부분만 고치는 방식의 모델 계열이다.
- 회사는 Darwin 계열에 공식 모델이 50개 넘게, 커뮤니티 파생 모델이 400개 넘게 있다고 밝혔다.
- 이전 Darwin 세대는 다른 모델에서 성능이 좋은 전문가(expert)·FFN 블록을 옮겨 붙이는 방식을 썼고, 이번 모델은 여기에 모델이 스스로 푼 검증된 풀이를 학습 재료로 더했다고 회사는 설명했다.
규모와 구조
- 전체 180B 규모의 전문가 혼합(MoE) 구조다.
- 전문가는 512개이고 토큰마다 10개가 쓰이며, 공유 전문가가 따로 있다.
- 층은 48개, 은닉 크기는 2,560이다. 선형 어텐션 층 36개와 전체 어텐션 층 12개를 섞은 하이브리드 어텐션을 쓴다.
- 컨텍스트 창은 262,144토큰, 어휘 수는 248,320이다.
- bf16 기준 용량은 약 336GB다.
- 부모 모델의 512개 전문가와 라우터, 비전 인코더는 손대지 않았다고 회사는 밝혔다.
- 별도 저장소로 4비트 GGUF판인 POCKET-Darwin-180B-GGUF(111GB)도 안내됐다.
- 회사는 이 판이 8GB GPU와 32GB 메모리를 갖춘 노트북, 128GB 미니 PC, DGX Spark 한 대에서 돌아가며 CPU만으로 초당 18~21토큰을 낸다고 밝혔다.
- MMLU-Pro 점수는 87.65%로 BF16과 같다고 했다.
학습 방식: RSI
- 이번 세대의 핵심은 재귀적 자기개선(RSI)이다.
- 더 큰 교사 모델을 증류하는 대신, 모델이 연습 문제를 풀고(풀이), 그 답을 정답표나 실행 검사로 확인한 뒤(검증), 맞은 풀이만 다시 학습하고(학습), 개선된 모델이 다음 풀이를 맡는(반복) 순서를 거친다.
- 사람이 쓴 풀이나 추론 기록은 쓰지 않았고 정답 여부는 자동으로 확인했다고 회사는 밝혔다.
- 연습 문제는 보고한 모든 평가 세트와 8-gram 겹침 필터로 중복을 걸렀다고 했다.
- 회사는 이를 모델의 가중치 자체가 나아지는 Model-level RSI라고 부르며, 고정된 모델 주변의 프롬프트·도구·작업 흐름을 고치는 Harness-level RSI와 구별했다.
- 첫 Darwin RSI 모델은 Darwin-27B-RSI였다.
ZTC: 답하기 전에 매기는 확신도
- 모델에는 Zero-Token Confidence(ZTC) 판독기가 함께 실린다.
- 글을 생성하기 전에 모델의 내부 상태를 한 번 읽어, 곧 내놓을 답이 맞을 확률을 돌려준다.
- 토큰을 더 쓰지 않고 두 번째 모델도 필요 없다고 회사는 밝혔다.
- 한 번 호출하면 답과 확신도가 JSON으로 함께 나온다.
- 회사는 확신도가 낮을 때 도구를 부르지 않거나, 사람에게 넘기거나, 「모른다」고 답하게 하는 식으로 행동을 거르는 데 쓰라고 권했다.
- 다만 이번 판은 초기 공개판으로, 회사 검증 데이터에서 AUROC 0.64에 그쳐 라우팅과 검토용의 거친 신호일 뿐 정답 보장은 아니라고 밝혔다.
- 더 많은 데이터로 다시 학습한 판정기로 바꿀 예정이라고 했다.
회사가 밝힌 수치
- RSI로 MMLU-Pro 평균 추론 길이가 부모 모델의 4,320토큰에서 3,833토큰으로 11% 줄었고, 정확도는 88.04%에서 88.12%로 올랐다고 회사는 밝혔다.
- MMLU-Pro 분야별로는 수학 95.0, 생물 94.6, 물리 92.5가 높았고, 법과 역사는 개선 여지가 있다고 했다.
- 회사는 이 모델이 Hugging Face 공식 리더보드 일곱 곳에서 1위이며, GPQA Diamond 상위 3위 안에 Darwin 모델이 둘(Darwin-180B-RSI 1위, Darwin-397B-ZTC 3위) 들었다고 밝혔다. 이 비교는 가중치 공개 모델만 대상으로 했고 비공개 API 모델은 빠졌다.
벤치마크
| 벤치마크 | 무엇을 재나 | Darwin-180B-RSI (180B) | Qwen3-235B-A22B-Thinking-2507 (235B) | Qwen3.5-397B-A17B (397B) |
|---|---|---|---|---|
| AIME 2026 | 경시대회 수학 문제 풀이 | 100 | — | 93.33 |
| HMMT Feb 2026 | 경시대회 수학 문제 풀이 | 100 | — | 87.88 |
| GPQA Diamond | 대학원 수준 과학 추론 | 94.44 | — | 88.4 |
| MMLU-Pro | 여러 분야 지식과 추론 | 88.12 | — | 87.8 |
| MMMU-Pro | 이미지를 낀 전문 분야 추론 | 79.48 | — | — |
| LEXam | 법학 객관식(4지선다) 문제 | 68.94 | 48.19 | — |
| LEXam-hard | 법학 서술형 추론 | 45.72 | — | — |
Darwin-180B-RSI 점수는 회사가 직접 잰 값으로, 대부분 생각 예산 131,072토큰에 여러 표본 다수결(MMLU-Pro·LEXam-hard는 단일 표본, LEXam 계열은 32,768토큰)로 측정했고, 다른 모델 점수는 각 회사가 리더보드에 낸 값이라 측정 조건이 서로 다르다.