모델 출시
Ornith, MoE 모델 Ornith-1.5-35B-A3B 공개
- Ornith 팀이 Ornith-1.5-35B-A3B를 MIT 라이선스로 공개했다.
- 전체 약 35B 중 토큰당 약 3B만 활성화하는 전문가 혼합 구조이며, 과제 생성과 해법 탐색까지 함께 최적화하는 자기개선 학습을 적용했다고 밝혔다.
| 모델 | Ornith-1.5-35B-A3B |
|---|---|
| 저장소 | ornith-ai/Ornith-1.5-35B-A3B |
| 개방성 | 오픈형 |
| 파라미터 | 35B-A3B |
| 라이선스 | MIT |
무엇이 나왔나
- Ornith 팀이 Ornith-1.5 계열의 중간 크기 모델인 Ornith-1.5-35B-A3B를 공개했다.
- 전문가 혼합(mixture-of-experts) 구조로, 전체 파라미터는 약 35B이고 토큰 하나를 처리할 때 활성화되는 파라미터는 약 3B이다.
- 라이선스는 MIT이며 가중치는 Hugging Face 저장소(ornith-ai/Ornith-1.5-35B-A3B)로 배포된다.
이전 판과 달라진 점
- 앞선 Ornith-1.0은 Qwen3.5와 Gemma4를 바탕으로 계속 사전학습, 중간 학습, 사후 학습을 더해 만들었다고 회사는 설명한다.
- Ornith-1.5는 여기서 자기개선 루프의 범위를 넓혀, 기존에 스캐폴드와 롤아웃 최적화에 머물렀던 것을 과제 생성·스캐폴드 구성·해법 롤아웃을 함께 최적화하는 방식으로 확장했다고 밝혔다.
- 사람이 고른 고정된 과제 집합과 수동으로 설계한 평가 하니스에 의존하지 않고, 모델이 새로운 학습 과제를 계속 만들어 내고 그것을 푸는 전략을 찾아낸 뒤 강화학습으로 정책을 개선한다는 설명이다.
회사는 이 모델이 비슷한 크기의 Qwen 3.6-35B를 코딩·에이전트 벤치마크 전반에서 앞섰고, Gemma 4-31B와 Muse Glimmer-30B 같은 밀집 모델과는 에이전트형 코딩에서 큰 차이를 보였다고 밝혔다.
동작 방식과 쓰임
- Ornith-1.5-35B-A3B는 추론 모델로, 기본적으로 답변 앞에
<think> … </think>블록을 먼저 낸다. - 서빙 설정에 따라 사고 과정은
reasoning_content필드로 따로 반환되고, 모델이 내는<tool_call>블록은 OpenAI 형식의tool_calls로 변환된다. - OpenAI 호환 엔드포인트로 띄울 수 있어 일반적인 에이전트 프레임워크와 그대로 맞물리며, 회사는 도구 호출과 에이전트형 코딩, 특히 터미널 기반 코딩 에이전트에 맞춰 다듬었다고 밝혔다.
- 컨텍스트 창은 최대 262,144토큰을 다룬다.
- 입력과 출력의 합이 이 한도를 넘어야 하는 작업에는 RoPE 스케일링으로 창을 늘리라고 권하며, 검증한 기법은 YaRN이고 스케일링 계수를 4.0으로 두면 쓸 수 있는 창이 약 100만 토큰까지 늘어난다고 설명했다.
- 다만 공개 런타임의 YaRN은 요청 길이와 무관하게 같은 계수를 적용하는 정적 방식이라 보통 길이의 입력에서는 품질이 조금 나빠질 수 있으므로, 정말 긴 창이 필요할 때만 켜고 계수도 필요한 만큼만 잡으라고 권했다.
- bf16 기준 용량은 약 70GB이고, 회사가 제시한 서빙 구성은 256K 컨텍스트 여유를 두기 위해 80GB GPU 2장을 쓴다.
- GGUF 형태의 빌드(ornith-ai/Ornith-1.5-35B-A3B-GGUF)도 함께 제공된다.
벤치마크
| 벤치마크 | 무엇을 재나 | Ornith-1.5-35B-A3B (35B-A3B) | Ornith-1.0-35B-A3B (35B-A3B) | Qwen3.6-35B-A3B (35B-A3B) | Qwen3.5-397B (397B) |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | 터미널 작업 수행 | 67.8 | 64.2 | 52.5 | 53.5 |
| Terminal-Bench 2.1 (Claude Code) | 터미널 작업 수행 | 68.5 | 62.8 | 49.2 | 48.6 |
| SWE-bench Verified | 실제 저장소 이슈 해결 | 79 | 75.6 | 73.4 | 76.4 |
| SWE-bench Pro | 더 어려운 코드 수정 | 59.6 | 50.4 | 49.5 | 51.6 |
| SWE-bench Multilingual | 여러 언어 저장소 이슈 해결 | 71.4 | 69.3 | 67.2 | 69.3 |
| DeepSWE | — | 22 | 0 | 0 | 1 |
| Frontier-Bench v0.1 | — | 5.1 | 1.4 | 1.4 | 1.4 |
| NL2Repo | — | 46.2 | 34.6 | 29.4 | 36.8 |
| SWE Atlas - QnA | — | 39.8 | 37.1 | 15.5 | 20.4 |
| HLE (no tools) | 전문가 수준 난제 지식 | 25.6 | 20.8 | 21.4 | 28.7 |
| HLE (with tools) | 도구를 쓴 난제 풀이 | 33.4 | 30.1 | 28.9 | 48.3 |
| GPQA Diamond | 대학원 수준 과학 문제 | 89.2 | 86.2 | 86 | 88.4 |
| MCP-Atlas | 도구 호출 능력 | 70.2 | 64.4 | 62.8 | 72.3 |
| Toolathlon-Verified | — | 48.7 | 42.4 | 41.7 | 38.3 |
| WideSearch | 폭넓은 정보 수집 | 67.8 | 63.4 | 60.1 | 74 |
| BrowseComp | 웹 탐색 정보 찾기 | 67.6 | 63.5 | 62 | 78.6 |
| ClawEval | 실사용 분포의 코딩 과제 | 72.5 | 69.8 | 68.7 | 70.7 |
- Ornith-1.5의 점수는 모두 독립 실행 5회 평균이라고 회사가 밝혔다.
- HLE는 Claude 4.6 Opus, MCP-Atlas는 Claude 4.8 Opus를 심사 모델로 썼고, MCP-Atlas는 500개 과제 공개 부분집합에서 사고 모드로 측정했다.