llmfeed

Ornith AI, 9B 규모 추론 모델 Ornith-1.5-9B 공개

Ornith
  • Ornith AI가 Ornith-1.5 계열 중 가장 작은 9B 밀집 모델 Ornith-1.5-9B를 MIT 라이선스로 공개했다.
  • 단일 GPU 구동을 목표로 만들었고, 기본으로 생각 과정을 먼저 출력하는 추론 모델이다.
모델Ornith-1.5-9B
저장소ornith-ai/Ornith-1.5-9B
개방성오픈형
파라미터 9B
라이선스 MIT

무엇이 나왔나

  • Ornith AI가 Ornith-1.5 계열의 모델 카드를 통해 Ornith-1.5-9B를 공개했다.
  • 회사는 이 모델을 Ornith-1.5 계열에서 가장 가벼운 구성원이라고 밝혔으며, 9B 규모의 밀집(dense) 모델로 단일 GPU 배포를 염두에 두고 설계했다고 설명했다.
  • 양자화 버전인 Ornith-1.5-9B-Mobile을 통해 모바일 기기에서의 엣지 배포도 가능하다고 밝혔다.

라이선스는 MIT이며, Hugging Face 저장소 ornith-ai/Ornith-1.5-9B로 공개됐다.

이전 판과 달라진 점

  • 회사 설명에 따르면 Ornith-1.0은 Qwen3.5와 Gemma4를 기반으로 추가 사전학습, 중간 학습, 사후 학습을 거쳐 개발됐다.
  • Ornith-1.5는 여기서 자기 개선 루프의 범위를 넓혀, 기존의 스캐폴드·롤아웃 최적화에서 나아가 과제 생성, 스캐폴드 구성, 해답 롤아웃을 함께 최적화한다고 밝혔다.
  • 사람이 고른 고정된 과제 묶음과 수작업으로 설계한 실행 환경에 의존하는 대신, 모델이 새로운 학습 과제를 계속 만들어 내고 그 과제를 푸는 전략을 찾아내며 강화학습으로 정책을 개선한다는 설명이다.

동작 방식과 배포 형태

  • Ornith-1.5-9B는 추론 모델로, 기본 설정에서 답변 앞에 <think> … </think> 블록을 먼저 내놓는다.
  • 회사가 안내한 서빙 구성에서는 추론 파서를 켜서 생각 과정이 reasoning_content 필드로 따로 반환되고, 도구 호출 파서를 켜면 모델이 내놓는 <tool_call> 블록이 OpenAI 형식의 tool_calls로 노출된다.
  • 모델은 bf16 기준 약 19GB로, 80GB GPU 한 장에서 서빙된다고 밝혔다.
  • vLLM과 SGLang으로 OpenAI 호환 서버를 띄울 수 있고, 그 뒤에는 OpenAI 호환 SDK나 curl로 같은 /v1/chat/completions 엔드포인트를 그대로 쓸 수 있다.
  • 도구 호출을 지원하므로 일반적인 에이전트 프레임워크와 바로 연동된다는 설명이다.
  • 컨텍스트는 최대 262,144토큰까지 처리한다.
  • 입력과 출력을 합쳐 이 한도를 넘겨야 하는 작업이라면 RoPE 스케일링으로 유효 창을 늘리라고 권했고, 회사가 검증한 기법은 YaRN이며 vLLM과 SGLang에 이미 들어 있다고 밝혔다.
  • 스케일링 계수를 4.0으로 두면 쓸 수 있는 창이 약 100만 토큰까지 늘어난다.
  • 다만 회사는 오픈소스 런타임이 YaRN을 정적으로 구현해 요청 길이와 무관하게 같은 계수를 적용하기 때문에, 보통 길이의 입력에서는 품질이 조금 나빠질 수 있다고 밝혔다.
  • 그래서 긴 창이 정말 필요한 작업에서만 rope_scaling을 켜고 계수도 필요한 만큼만 잡으라고 권했다.
  • 목표 창은 대략 계수 곱하기 262,144이므로, 요청이 524,288토큰 근처에서 끝난다면 계수 2.0이 더 적절하다는 설명이다.

벤치마크

벤치마크 무엇을 재나 Ornith-1.5-9B (9B) Ornith-1.0-9B (9B) Qwen3.5-9B (9B) Qwen3.6-35B-A3B (35B-A3B)
Terminal-Bench 2.1 (Terminus-2) 터미널 작업 수행 46.2 43.1 21.3 52.5
Terminal-Bench 2.1 (Claude Code) 터미널 작업 수행 47 40.6 18.9 49.2
SWE-bench Verified 실제 버그 수정 70.6 69.4 53.2 73.4
SWE-bench Pro 실제 버그 수정(고난도) 47.5 42.9 31.3 49.5
SWE-bench Multilingual 여러 언어 버그 수정 54.4 52 39.7 67.2
NL2Repo — 32.4 27.2 16.2 29.4
SWE Atlas - QnA — 20.6 17.9 9.2 15.5
HLE (no tools) 전문가 수준 난제 지식 20.2 16.8 14.7 21.4
HLE (with tools) 도구를 쓴 난제 풀이 30.5 26.4 24.5 28.9
GPQA Diamond 대학원 수준 과학 추론 86.4 82.5 81.7 86
MCP-Atlas MCP 도구 사용 54.2 49.4 46.8 62.8
Toolathlon-Verified — 41.2 33.4 29.6 41.7
WideSearch 폭넓은 정보 수집 59.5 55.8 53.6 60.1
BrowseComp 웹 탐색 정보 찾기 56.4 44.8 41.5 62
ClawEval 실사용 코딩 에이전트 작업 66.5 63.1 53.2 68.7
  • Ornith-1.5의 모든 결과는 독립 실행 5회 평균이라고 회사가 밝혔다.
  • HLE는 Claude 4.6 Opus를, MCP-Atlas는 Claude 4.8 Opus를 심판 모델로 썼고, MCP-Atlas는 500개 과제 공개 부분집합에서 모든 모델을 사고 모드로 평가했다.

원문