모델 출시
Inkling, 가중치 공개형 멀티모달 MoE 모델로 등장
- Inkling은 텍스트·이미지·오디오 입력을 받아 텍스트를 생성하는 범용 멀티모달 모델로, 가중치가 공개된 상태로 배포된다.
- 66-layer MoE 트랜스포머 구조를 갖춘 네이티브 멀티모달 모델이다.
- Inkling은 텍스트, 이미지, 오디오 입력을 받아들이고 텍스트 출력을 생성하는 범용 멀티모달 모델이다.
- 이 모델은 에이전트형 및 도구 사용 시스템, 코딩 어시스턴트, 챗봇, 검색 증강 생성 시스템을 포함한 AI 기반 애플리케이션을 구축하는 개발자들이 사용하도록 설계되었으며, 범용 대화형 사용, 지시 따르기, 기타 자연어 및 멀티모달 작업에 적합하다.
- 이 모델은 다운스트림 개발자들의 연구, 파인튜닝, 서드파티 제품 통합을 지원하기 위해 가중치를 공개한 상태로 배포된다.
- 이 모델은 희소 전문가 혼합 피드포워드 백본을 갖춘 66-layer 디코더 전용 트랜스포머로, 각 토큰은 256개의 전문가 중 6개로 라우팅되며 모든 토큰에 대해 활성화되는 공유 전문가 2개가 추가된다.
- 이 모델은 네이티브 멀티모달 모델로, 이미지와 비디오는 계층적 패치 인코더를 통해 인코딩되고 오디오는 이산 토큰 인코딩을 통해 인코딩되며 모든 모달리티는 공유 은닉 공간으로 투영되어 디코더에 의해 함께 처리된다.
- 학습 데이터에는 텍스트, 이미지, 오디오, 비디오를 포함한 다양한 콘텐츠 유형이 포함된다.
벤치마크
- 회사가 자기 발표에 실은 값이다.
- 비교 대상과 측정 조건은 회사가 정했다.
5. Evaluations
|
|
Inkling |
Nemotron 3 Ultra |
Kimi K2.5 |
Kimi K2.6 |
GLM 5.2 |
DeepSeek V4 Pro |
Gemini 3.1 Pro (high) |
Claude Fable 5 (max) |
GPT 5.6 Sol (xhigh) |
| Reasoning |
|
|
|
|
|
|
|
|
|
|
|
HLE (text only) |
29.7% |
26.6% |
29.4% |
35.9% |
40.1% |
35.9% |
44.7% |
53.3% |
47.2% |
|
HLE (with tools) |
46.0% |
37.4% |
50.2% |
54.0% |
54.7% |
48.2% |
51.4% |
64.5% |
55.0% |
|
AIME 2026 |
97.1% |
94.2% |
95.8% |
96.4% |
99.2% |
96.7% |
98.3% |
– |
99.9% |
|
GPQA Diamond |
87.2% |
86.7% |
87.9% |
91.1% |
89.5% |
88.8% |
94.1% |
92.6% |
94.1% |
| Agentic (coding) |
|
|
|
|
|
|
|
|
|
|
|
SWEBench Verified |
77.6% |
70.7% |
76.8% |
80.2% |
– |
80.6% |
80.6% |
95.0% |
– |
|
SWEBench Pro (Public) |
54.3% |
46.4% |
50.7% |
58.6% |
62.1% |
55.4% |
54.2% |
80.0% |
64.6% |
|
Terminal Bench 2.1 (Best Harness) |
63.8 |
56.4 |
51.3 |
71.3 |
82.7 |
64 |
73.8 |
84.6 |
89.5 |
|
GDPVal-AA v2 |
1233 |
1164 |
1009 |
1190 |
1514 |
1307 |
962 |
1760 |
1748 |
| Agentic (general) |
|
|
|
|
|
|
|
|
|
|
|
MCP Atlas |
74.1% |
44.7% |
64.0% |
68.1% |
77.8% |
73.2% |
78.2% |
83.3% |
81.8% |
|
Tau 3 Banking |
23.7% |
13.8% |
13.2% |
20.6% |
26.8% |
25.8% |
16.5% |
26.8% |
33.0% |
| Factuality |
|
|
|
|
|
|
|
|
|
|
|
BrowseComp (w/ Ctx) |
77.1% |
– |
74.9% |
83.2% |
– |
83.4% |
85.9% |
88.0% |
89.4% |
|
SimpleQA Verified |
43.9% |
32.4% |
36.9% |
38.7% |
38.1% |
57.0% |
77.3% |
68.3% |
71.6% |
|
AA Omniscience |
1.0% |
-1.0% |
-8.0% |
6.0% |
4.0% |
-10.0% |
33.0% |
40.0% |
22.0% |
| Chat |
|
|
|
|
|
|
|
|
|
|
|
IFBench |
79.8% |
81.4% |
70.2% |
76.0% |
73.3% |
76.5% |
77.1% |
63.5% |
72.7% |
|
Global-MMLU-Lite |
88.7% |
85.6% |
84.0% |
88.4% |
89.2% |
89.3% |
92.7% |
93.3% |
91.8% |
| Vision |
|
|
|
|
|
|
|
|
|
|
|
MMMU Pro (Standard 10) |
73.5% |
– |
75.0% |
79.0% |
– |
– |
82.0% |
84.2% |
83.0% |
|
Charxiv RQ |
78.1% |
– |
77.5% |
80.4% |
– |
– |
80.2% |
86.5% |
84.7% |
|
Charxiv RQ (with python) |
82.0% |
– |
78.7% |
86.7% |
– |
– |
89.9% |
89.4% |
87.8% |
| Audio |
|
|
|
|
|
|
|
|
|
|
|
Audio MC |
56.6% |
– |
– |
– |
– |
– |
66.8% |
– |
– |
|
MMAU |
77.2% |
– |
– |
– |
– |
– |
82.5% |
– |
– |
|
VoiceBench |
91.4% |
– |
– |
– |
– |
– |
94.3% |
– |
– |
| Safety |
|
|
|
|
|
|
|
|
|
|
|
FORTRESS (Adversarial) |
78.0% |
77.6% |
54.1% |
65.6% |
71.3% |
36.0% |
65.2% |
96.0% |
82.4% |
|
FORTRESS (Benign) |
95.9% |
90.5% |
98.3% |
97.2% |
90.0% |
98.5% |
98.0% |
55.1% |
98.1% |
|
StrongREJECT |
98.6% |
98.7% |
99.5% |
99.8% |
98.5% |
98.6% |
98.0% |
98.7% |
98.5% |