llmfeed

Ornith, MoE 모델 Ornith-1.5-35B-A3B 공개

Ornith
  • Ornith 팀이 Ornith-1.5-35B-A3B를 MIT 라이선스로 공개했다.
  • 전체 약 35B 중 토큰당 약 3B만 활성화하는 전문가 혼합 구조이며, 과제 생성과 해법 탐색까지 함께 최적화하는 자기개선 학습을 적용했다고 밝혔다.
모델Ornith-1.5-35B-A3B
저장소ornith-ai/Ornith-1.5-35B-A3B
개방성오픈형
파라미터 35B-A3B
라이선스 MIT

무엇이 나왔나

  • Ornith 팀이 Ornith-1.5 계열의 중간 크기 모델인 Ornith-1.5-35B-A3B를 공개했다.
  • 전문가 혼합(mixture-of-experts) 구조로, 전체 파라미터는 약 35B이고 토큰 하나를 처리할 때 활성화되는 파라미터는 약 3B이다.
  • 라이선스는 MIT이며 가중치는 Hugging Face 저장소(ornith-ai/Ornith-1.5-35B-A3B)로 배포된다.

이전 판과 달라진 점

  • 앞선 Ornith-1.0은 Qwen3.5와 Gemma4를 바탕으로 계속 사전학습, 중간 학습, 사후 학습을 더해 만들었다고 회사는 설명한다.
  • Ornith-1.5는 여기서 자기개선 루프의 범위를 넓혀, 기존에 스캐폴드와 롤아웃 최적화에 머물렀던 것을 과제 생성·스캐폴드 구성·해법 롤아웃을 함께 최적화하는 방식으로 확장했다고 밝혔다.
  • 사람이 고른 고정된 과제 집합과 수동으로 설계한 평가 하니스에 의존하지 않고, 모델이 새로운 학습 과제를 계속 만들어 내고 그것을 푸는 전략을 찾아낸 뒤 강화학습으로 정책을 개선한다는 설명이다.

회사는 이 모델이 비슷한 크기의 Qwen 3.6-35B를 코딩·에이전트 벤치마크 전반에서 앞섰고, Gemma 4-31B와 Muse Glimmer-30B 같은 밀집 모델과는 에이전트형 코딩에서 큰 차이를 보였다고 밝혔다.

동작 방식과 쓰임

  • Ornith-1.5-35B-A3B는 추론 모델로, 기본적으로 답변 앞에 <think> … </think> 블록을 먼저 낸다.
  • 서빙 설정에 따라 사고 과정은 reasoning_content 필드로 따로 반환되고, 모델이 내는 <tool_call> 블록은 OpenAI 형식의 tool_calls로 변환된다.
  • OpenAI 호환 엔드포인트로 띄울 수 있어 일반적인 에이전트 프레임워크와 그대로 맞물리며, 회사는 도구 호출과 에이전트형 코딩, 특히 터미널 기반 코딩 에이전트에 맞춰 다듬었다고 밝혔다.
  • 컨텍스트 창은 최대 262,144토큰을 다룬다.
  • 입력과 출력의 합이 이 한도를 넘어야 하는 작업에는 RoPE 스케일링으로 창을 늘리라고 권하며, 검증한 기법은 YaRN이고 스케일링 계수를 4.0으로 두면 쓸 수 있는 창이 약 100만 토큰까지 늘어난다고 설명했다.
  • 다만 공개 런타임의 YaRN은 요청 길이와 무관하게 같은 계수를 적용하는 정적 방식이라 보통 길이의 입력에서는 품질이 조금 나빠질 수 있으므로, 정말 긴 창이 필요할 때만 켜고 계수도 필요한 만큼만 잡으라고 권했다.
  • bf16 기준 용량은 약 70GB이고, 회사가 제시한 서빙 구성은 256K 컨텍스트 여유를 두기 위해 80GB GPU 2장을 쓴다.
  • GGUF 형태의 빌드(ornith-ai/Ornith-1.5-35B-A3B-GGUF)도 함께 제공된다.

벤치마크

벤치마크 무엇을 재나 Ornith-1.5-35B-A3B (35B-A3B) Ornith-1.0-35B-A3B (35B-A3B) Qwen3.6-35B-A3B (35B-A3B) Qwen3.5-397B (397B)
Terminal-Bench 2.1 (Terminus-2) 터미널 작업 수행 67.8 64.2 52.5 53.5
Terminal-Bench 2.1 (Claude Code) 터미널 작업 수행 68.5 62.8 49.2 48.6
SWE-bench Verified 실제 저장소 이슈 해결 79 75.6 73.4 76.4
SWE-bench Pro 더 어려운 코드 수정 59.6 50.4 49.5 51.6
SWE-bench Multilingual 여러 언어 저장소 이슈 해결 71.4 69.3 67.2 69.3
DeepSWE — 22 0 0 1
Frontier-Bench v0.1 — 5.1 1.4 1.4 1.4
NL2Repo — 46.2 34.6 29.4 36.8
SWE Atlas - QnA — 39.8 37.1 15.5 20.4
HLE (no tools) 전문가 수준 난제 지식 25.6 20.8 21.4 28.7
HLE (with tools) 도구를 쓴 난제 풀이 33.4 30.1 28.9 48.3
GPQA Diamond 대학원 수준 과학 문제 89.2 86.2 86 88.4
MCP-Atlas 도구 호출 능력 70.2 64.4 62.8 72.3
Toolathlon-Verified — 48.7 42.4 41.7 38.3
WideSearch 폭넓은 정보 수집 67.8 63.4 60.1 74
BrowseComp 웹 탐색 정보 찾기 67.6 63.5 62 78.6
ClawEval 실사용 분포의 코딩 과제 72.5 69.8 68.7 70.7
  • Ornith-1.5의 점수는 모두 독립 실행 5회 평균이라고 회사가 밝혔다.
  • HLE는 Claude 4.6 Opus, MCP-Atlas는 Claude 4.8 Opus를 심사 모델로 썼고, MCP-Atlas는 500개 과제 공개 부분집합에서 사고 모드로 측정했다.

원문