Inkling, 가중치 공개형 멀티모달 MoE 모델로 등장
Inkling은 텍스트·이미지·오디오 입력을 받아 텍스트를 생성하는 범용 멀티모달 모델로, 가중치가 공개된 상태로 배포된다. 66-layer MoE 트랜스포머 구조를 갖춘 네이티브 멀티모달 모델이다.
| Inkling |
Inkling
thinkingmachines/Inkling
|
|---|
| 라이선스 | apache-2.0 |
|---|
Inkling은 텍스트, 이미지, 오디오 입력을 받아들이고 텍스트 출력을 생성하는 범용 멀티모달 모델이다. 이 모델은 에이전트형 및 도구 사용 시스템, 코딩 어시스턴트, 챗봇, 검색 증강 생성 시스템을 포함한 AI 기반 애플리케이션을 구축하는 개발자들이 사용하도록 설계되었으며, 범용 대화형 사용, 지시 따르기, 기타 자연어 및 멀티모달 작업에 적합하다. 이 모델은 다운스트림 개발자들의 연구, 파인튜닝, 서드파티 제품 통합을 지원하기 위해 가중치를 공개한 상태로 배포된다. 이 모델은 희소 전문가 혼합 피드포워드 백본을 갖춘 66-layer 디코더 전용 트랜스포머로, 각 토큰은 256개의 전문가 중 6개로 라우팅되며 모든 토큰에 대해 활성화되는 공유 전문가 2개가 추가된다. 이 모델은 네이티브 멀티모달 모델로, 이미지와 비디오는 계층적 패치 인코더를 통해 인코딩되고 오디오는 이산 토큰 인코딩을 통해 인코딩되며 모든 모달리티는 공유 은닉 공간으로 투영되어 디코더에 의해 함께 처리된다. 학습 데이터에는 텍스트, 이미지, 오디오, 비디오를 포함한 다양한 콘텐츠 유형이 포함된다.
벤치마크
회사가 자기 발표에 실은 값이다. 비교 대상과 측정 조건은 회사가 정했다.
5. Evaluations
| Inkling | Nemotron 3 Ultra | Kimi K2.5 | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro | Gemini 3.1 Pro (high) | Claude Fable 5 (max) | GPT 5.6 Sol (xhigh) | ||
|---|---|---|---|---|---|---|---|---|---|---|
| Reasoning | ||||||||||
| HLE (text only) | 29.7% | 26.6% | 29.4% | 35.9% | 40.1% | 35.9% | 44.7% | 53.3% | 47.2% | |
| HLE (with tools) | 46.0% | 37.4% | 50.2% | 54.0% | 54.7% | 48.2% | 51.4% | 64.5% | 55.0% | |
| AIME 2026 | 97.1% | 94.2% | 95.8% | 96.4% | 99.2% | 96.7% | 98.3% | – | 99.9% | |
| GPQA Diamond | 87.2% | 86.7% | 87.9% | 91.1% | 89.5% | 88.8% | 94.1% | 92.6% | 94.1% | |
| Agentic (coding) | ||||||||||
| SWEBench Verified | 77.6% | 70.7% | 76.8% | 80.2% | – | 80.6% | 80.6% | 95.0% | – | |
| SWEBench Pro (Public) | 54.3% | 46.4% | 50.7% | 58.6% | 62.1% | 55.4% | 54.2% | 80.0% | 64.6% | |
| Terminal Bench 2.1 (Best Harness) | 63.8 | 56.4 | 51.3 | 71.3 | 82.7 | 64 | 73.8 | 84.6 | 89.5 | |
| GDPVal-AA v2 | 1233 | 1164 | 1009 | 1190 | 1514 | 1307 | 962 | 1760 | 1748 | |
| Agentic (general) | ||||||||||
| MCP Atlas | 74.1% | 44.7% | 64.0% | 68.1% | 77.8% | 73.2% | 78.2% | 83.3% | 81.8% | |
| Tau 3 Banking | 23.7% | 13.8% | 13.2% | 20.6% | 26.8% | 25.8% | 16.5% | 26.8% | 33.0% | |
| Factuality | ||||||||||
| BrowseComp (w/ Ctx) | 77.1% | – | 74.9% | 83.2% | – | 83.4% | 85.9% | 88.0% | 89.4% | |
| SimpleQA Verified | 43.9% | 32.4% | 36.9% | 38.7% | 38.1% | 57.0% | 77.3% | 68.3% | 71.6% | |
| AA Omniscience | 1.0% | -1.0% | -8.0% | 6.0% | 4.0% | -10.0% | 33.0% | 40.0% | 22.0% | |
| Chat | ||||||||||
| IFBench | 79.8% | 81.4% | 70.2% | 76.0% | 73.3% | 76.5% | 77.1% | 63.5% | 72.7% | |
| Global-MMLU-Lite | 88.7% | 85.6% | 84.0% | 88.4% | 89.2% | 89.3% | 92.7% | 93.3% | 91.8% | |
| Vision | ||||||||||
| MMMU Pro (Standard 10) | 73.5% | – | 75.0% | 79.0% | – | – | 82.0% | 84.2% | 83.0% | |
| Charxiv RQ | 78.1% | – | 77.5% | 80.4% | – | – | 80.2% | 86.5% | 84.7% | |
| Charxiv RQ (with python) | 82.0% | – | 78.7% | 86.7% | – | – | 89.9% | 89.4% | 87.8% | |
| Audio | ||||||||||
| Audio MC | 56.6% | – | – | – | – | – | 66.8% | – | – | |
| MMAU | 77.2% | – | – | – | – | – | 82.5% | – | – | |
| VoiceBench | 91.4% | – | – | – | – | – | 94.3% | – | – | |
| Safety | ||||||||||
| FORTRESS (Adversarial) | 78.0% | 77.6% | 54.1% | 65.6% | 71.3% | 36.0% | 65.2% | 96.0% | 82.4% | |
| FORTRESS (Benign) | 95.9% | 90.5% | 98.3% | 97.2% | 90.0% | 98.5% | 98.0% | 55.1% | 98.1% | |
| StrongREJECT | 98.6% | 98.7% | 99.5% | 99.8% | 98.5% | 98.6% | 98.0% | 98.7% | 98.5% |