llmfeed

VIDRAFT, 180B 전문가 혼합 추론 모델 Darwin-180B-RSI 공개

f
  • VIDRAFT가 Qwen3.8-Flash-Next를 바탕으로 한 180B 전문가 혼합 추론 모델 Darwin-180B-RSI를 공개했다.
  • 스스로 푼 답 중 검증된 것만 다시 학습하는 방식을 썼고, 이미지와 텍스트를 받아 글을 낸다.
모델Darwin-180B-RSI
저장소FINAL-Bench/Darwin-180B-RSI
개방성오픈형
컨텍스트 262K
파라미터 180B
라이선스 Qwen Community License 1.0

무엇이 나왔나

  • VIDRAFT가 Darwin 계열의 새 대표 모델 Darwin-180B-RSI를 Hugging Face에 공개했다.
  • 이미지와 텍스트를 받아 글로 답하는 추론(thinking) 모델이며, 한국어와 영어를 지원한다.
  • Alibaba의 Qwen3.8-Flash-Next를 부모 모델로 삼아 만든 파생 모델이고, Qwen Community License 1.0으로 배포된다.
  • Darwin은 공개된 강한 모델을 부모로 두고, 부모가 약한 부분을 측정해 그 부분만 고치는 방식의 모델 계열이다.
  • 회사는 Darwin 계열에 공식 모델이 50개 넘게, 커뮤니티 파생 모델이 400개 넘게 있다고 밝혔다.
  • 이전 Darwin 세대는 다른 모델에서 성능이 좋은 전문가(expert)·FFN 블록을 옮겨 붙이는 방식을 썼고, 이번 모델은 여기에 모델이 스스로 푼 검증된 풀이를 학습 재료로 더했다고 회사는 설명했다.

규모와 구조

  • 전체 180B 규모의 전문가 혼합(MoE) 구조다.
  • 전문가는 512개이고 토큰마다 10개가 쓰이며, 공유 전문가가 따로 있다.
  • 층은 48개, 은닉 크기는 2,560이다. 선형 어텐션 층 36개와 전체 어텐션 층 12개를 섞은 하이브리드 어텐션을 쓴다.
  • 컨텍스트 창은 262,144토큰, 어휘 수는 248,320이다.
  • bf16 기준 용량은 약 336GB다.
  • 부모 모델의 512개 전문가와 라우터, 비전 인코더는 손대지 않았다고 회사는 밝혔다.
  • 별도 저장소로 4비트 GGUF판인 POCKET-Darwin-180B-GGUF(111GB)도 안내됐다.
  • 회사는 이 판이 8GB GPU와 32GB 메모리를 갖춘 노트북, 128GB 미니 PC, DGX Spark 한 대에서 돌아가며 CPU만으로 초당 18~21토큰을 낸다고 밝혔다.
  • MMLU-Pro 점수는 87.65%로 BF16과 같다고 했다.

학습 방식: RSI

  • 이번 세대의 핵심은 재귀적 자기개선(RSI)이다.
  • 더 큰 교사 모델을 증류하는 대신, 모델이 연습 문제를 풀고(풀이), 그 답을 정답표나 실행 검사로 확인한 뒤(검증), 맞은 풀이만 다시 학습하고(학습), 개선된 모델이 다음 풀이를 맡는(반복) 순서를 거친다.
  • 사람이 쓴 풀이나 추론 기록은 쓰지 않았고 정답 여부는 자동으로 확인했다고 회사는 밝혔다.
  • 연습 문제는 보고한 모든 평가 세트와 8-gram 겹침 필터로 중복을 걸렀다고 했다.
  • 회사는 이를 모델의 가중치 자체가 나아지는 Model-level RSI라고 부르며, 고정된 모델 주변의 프롬프트·도구·작업 흐름을 고치는 Harness-level RSI와 구별했다.
  • 첫 Darwin RSI 모델은 Darwin-27B-RSI였다.

ZTC: 답하기 전에 매기는 확신도

  • 모델에는 Zero-Token Confidence(ZTC) 판독기가 함께 실린다.
  • 글을 생성하기 전에 모델의 내부 상태를 한 번 읽어, 곧 내놓을 답이 맞을 확률을 돌려준다.
  • 토큰을 더 쓰지 않고 두 번째 모델도 필요 없다고 회사는 밝혔다.
  • 한 번 호출하면 답과 확신도가 JSON으로 함께 나온다.
  • 회사는 확신도가 낮을 때 도구를 부르지 않거나, 사람에게 넘기거나, 「모른다」고 답하게 하는 식으로 행동을 거르는 데 쓰라고 권했다.
  • 다만 이번 판은 초기 공개판으로, 회사 검증 데이터에서 AUROC 0.64에 그쳐 라우팅과 검토용의 거친 신호일 뿐 정답 보장은 아니라고 밝혔다.
  • 더 많은 데이터로 다시 학습한 판정기로 바꿀 예정이라고 했다.

회사가 밝힌 수치

  • RSI로 MMLU-Pro 평균 추론 길이가 부모 모델의 4,320토큰에서 3,833토큰으로 11% 줄었고, 정확도는 88.04%에서 88.12%로 올랐다고 회사는 밝혔다.
  • MMLU-Pro 분야별로는 수학 95.0, 생물 94.6, 물리 92.5가 높았고, 법과 역사는 개선 여지가 있다고 했다.
  • 회사는 이 모델이 Hugging Face 공식 리더보드 일곱 곳에서 1위이며, GPQA Diamond 상위 3위 안에 Darwin 모델이 둘(Darwin-180B-RSI 1위, Darwin-397B-ZTC 3위) 들었다고 밝혔다. 이 비교는 가중치 공개 모델만 대상으로 했고 비공개 API 모델은 빠졌다.

벤치마크

벤치마크 무엇을 재나 Darwin-180B-RSI (180B) Qwen3-235B-A22B-Thinking-2507 (235B) Qwen3.5-397B-A17B (397B)
AIME 2026 경시대회 수학 문제 풀이 100 — 93.33
HMMT Feb 2026 경시대회 수학 문제 풀이 100 — 87.88
GPQA Diamond 대학원 수준 과학 추론 94.44 — 88.4
MMLU-Pro 여러 분야 지식과 추론 88.12 — 87.8
MMMU-Pro 이미지를 낀 전문 분야 추론 79.48 — —
LEXam 법학 객관식(4지선다) 문제 68.94 48.19 —
LEXam-hard 법학 서술형 추론 45.72 — —

Darwin-180B-RSI 점수는 회사가 직접 잰 값으로, 대부분 생각 예산 131,072토큰에 여러 표본 다수결(MMLU-Pro·LEXam-hard는 단일 표본, LEXam 계열은 32,768토큰)로 측정했고, 다른 모델 점수는 각 회사가 리더보드에 낸 값이라 측정 조건이 서로 다르다.

원문