모델 출시
Ornith AI, 9B 규모 추론 모델 Ornith-1.5-9B 공개
- Ornith AI가 Ornith-1.5 계열 중 가장 작은 9B 밀집 모델 Ornith-1.5-9B를 MIT 라이선스로 공개했다.
- 단일 GPU 구동을 목표로 만들었고, 기본으로 생각 과정을 먼저 출력하는 추론 모델이다.
| 모델 | Ornith-1.5-9B |
|---|---|
| 저장소 | ornith-ai/Ornith-1.5-9B |
| 개방성 | 오픈형 |
| 파라미터 | 9B |
| 라이선스 | MIT |
무엇이 나왔나
- Ornith AI가 Ornith-1.5 계열의 모델 카드를 통해 Ornith-1.5-9B를 공개했다.
- 회사는 이 모델을 Ornith-1.5 계열에서 가장 가벼운 구성원이라고 밝혔으며, 9B 규모의 밀집(dense) 모델로 단일 GPU 배포를 염두에 두고 설계했다고 설명했다.
- 양자화 버전인 Ornith-1.5-9B-Mobile을 통해 모바일 기기에서의 엣지 배포도 가능하다고 밝혔다.
라이선스는 MIT이며, Hugging Face 저장소 ornith-ai/Ornith-1.5-9B로 공개됐다.
이전 판과 달라진 점
- 회사 설명에 따르면 Ornith-1.0은 Qwen3.5와 Gemma4를 기반으로 추가 사전학습, 중간 학습, 사후 학습을 거쳐 개발됐다.
- Ornith-1.5는 여기서 자기 개선 루프의 범위를 넓혀, 기존의 스캐폴드·롤아웃 최적화에서 나아가 과제 생성, 스캐폴드 구성, 해답 롤아웃을 함께 최적화한다고 밝혔다.
- 사람이 고른 고정된 과제 묶음과 수작업으로 설계한 실행 환경에 의존하는 대신, 모델이 새로운 학습 과제를 계속 만들어 내고 그 과제를 푸는 전략을 찾아내며 강화학습으로 정책을 개선한다는 설명이다.
동작 방식과 배포 형태
- Ornith-1.5-9B는 추론 모델로, 기본 설정에서 답변 앞에
<think> … </think>블록을 먼저 내놓는다. - 회사가 안내한 서빙 구성에서는 추론 파서를 켜서 생각 과정이
reasoning_content필드로 따로 반환되고, 도구 호출 파서를 켜면 모델이 내놓는<tool_call>블록이 OpenAI 형식의tool_calls로 노출된다.
- 모델은 bf16 기준 약 19GB로, 80GB GPU 한 장에서 서빙된다고 밝혔다.
- vLLM과 SGLang으로 OpenAI 호환 서버를 띄울 수 있고, 그 뒤에는 OpenAI 호환 SDK나
curl로 같은/v1/chat/completions엔드포인트를 그대로 쓸 수 있다. - 도구 호출을 지원하므로 일반적인 에이전트 프레임워크와 바로 연동된다는 설명이다.
- 컨텍스트는 최대 262,144토큰까지 처리한다.
- 입력과 출력을 합쳐 이 한도를 넘겨야 하는 작업이라면 RoPE 스케일링으로 유효 창을 늘리라고 권했고, 회사가 검증한 기법은 YaRN이며 vLLM과 SGLang에 이미 들어 있다고 밝혔다.
- 스케일링 계수를 4.0으로 두면 쓸 수 있는 창이 약 100만 토큰까지 늘어난다.
- 다만 회사는 오픈소스 런타임이 YaRN을 정적으로 구현해 요청 길이와 무관하게 같은 계수를 적용하기 때문에, 보통 길이의 입력에서는 품질이 조금 나빠질 수 있다고 밝혔다.
- 그래서 긴 창이 정말 필요한 작업에서만
rope_scaling을 켜고 계수도 필요한 만큼만 잡으라고 권했다. - 목표 창은 대략 계수 곱하기 262,144이므로, 요청이 524,288토큰 근처에서 끝난다면 계수 2.0이 더 적절하다는 설명이다.
벤치마크
| 벤치마크 | 무엇을 재나 | Ornith-1.5-9B (9B) | Ornith-1.0-9B (9B) | Qwen3.5-9B (9B) | Qwen3.6-35B-A3B (35B-A3B) |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | 터미널 작업 수행 | 46.2 | 43.1 | 21.3 | 52.5 |
| Terminal-Bench 2.1 (Claude Code) | 터미널 작업 수행 | 47 | 40.6 | 18.9 | 49.2 |
| SWE-bench Verified | 실제 버그 수정 | 70.6 | 69.4 | 53.2 | 73.4 |
| SWE-bench Pro | 실제 버그 수정(고난도) | 47.5 | 42.9 | 31.3 | 49.5 |
| SWE-bench Multilingual | 여러 언어 버그 수정 | 54.4 | 52 | 39.7 | 67.2 |
| NL2Repo | — | 32.4 | 27.2 | 16.2 | 29.4 |
| SWE Atlas - QnA | — | 20.6 | 17.9 | 9.2 | 15.5 |
| HLE (no tools) | 전문가 수준 난제 지식 | 20.2 | 16.8 | 14.7 | 21.4 |
| HLE (with tools) | 도구를 쓴 난제 풀이 | 30.5 | 26.4 | 24.5 | 28.9 |
| GPQA Diamond | 대학원 수준 과학 추론 | 86.4 | 82.5 | 81.7 | 86 |
| MCP-Atlas | MCP 도구 사용 | 54.2 | 49.4 | 46.8 | 62.8 |
| Toolathlon-Verified | — | 41.2 | 33.4 | 29.6 | 41.7 |
| WideSearch | 폭넓은 정보 수집 | 59.5 | 55.8 | 53.6 | 60.1 |
| BrowseComp | 웹 탐색 정보 찾기 | 56.4 | 44.8 | 41.5 | 62 |
| ClawEval | 실사용 코딩 에이전트 작업 | 66.5 | 63.1 | 53.2 | 68.7 |
- Ornith-1.5의 모든 결과는 독립 실행 5회 평균이라고 회사가 밝혔다.
- HLE는 Claude 4.6 Opus를, MCP-Atlas는 Claude 4.8 Opus를 심판 모델로 썼고, MCP-Atlas는 500개 과제 공개 부분집합에서 모든 모델을 사고 모드로 평가했다.