llmfeed

Inkling, 가중치 공개형 멀티모달 MoE 모델로 등장

씽킹머신스
  • Inkling은 텍스트·이미지·오디오 입력을 받아 텍스트를 생성하는 범용 멀티모달 모델로, 가중치가 공개된 상태로 배포된다.
  • 66-layer MoE 트랜스포머 구조를 갖춘 네이티브 멀티모달 모델이다.
모델Inkling
저장소thinkingmachines/Inkling
개방성오픈형
라이선스 Apache-2.0
  • Inkling은 텍스트, 이미지, 오디오 입력을 받아들이고 텍스트 출력을 생성하는 범용 멀티모달 모델이다.
  • 이 모델은 에이전트형 및 도구 사용 시스템, 코딩 어시스턴트, 챗봇, 검색 증강 생성 시스템을 포함한 AI 기반 애플리케이션을 구축하는 개발자들이 사용하도록 설계되었으며, 범용 대화형 사용, 지시 따르기, 기타 자연어 및 멀티모달 작업에 적합하다.
  • 이 모델은 다운스트림 개발자들의 연구, 파인튜닝, 서드파티 제품 통합을 지원하기 위해 가중치를 공개한 상태로 배포된다.
  • 이 모델은 희소 전문가 혼합 피드포워드 백본을 갖춘 66-layer 디코더 전용 트랜스포머로, 각 토큰은 256개의 전문가 중 6개로 라우팅되며 모든 토큰에 대해 활성화되는 공유 전문가 2개가 추가된다.
  • 이 모델은 네이티브 멀티모달 모델로, 이미지와 비디오는 계층적 패치 인코더를 통해 인코딩되고 오디오는 이산 토큰 인코딩을 통해 인코딩되며 모든 모달리티는 공유 은닉 공간으로 투영되어 디코더에 의해 함께 처리된다.
  • 학습 데이터에는 텍스트, 이미지, 오디오, 비디오를 포함한 다양한 콘텐츠 유형이 포함된다.

벤치마크

  • 회사가 자기 발표에 실은 값이다.
  • 비교 대상과 측정 조건은 회사가 정했다.

5. Evaluations

Inkling Nemotron 3 Ultra Kimi K2.5 Kimi K2.6 GLM 5.2 DeepSeek V4 Pro Gemini 3.1 Pro (high) Claude Fable 5 (max) GPT 5.6 Sol (xhigh)
Reasoning
HLE (text only) 29.7% 26.6% 29.4% 35.9% 40.1% 35.9% 44.7% 53.3% 47.2%
HLE (with tools) 46.0% 37.4% 50.2% 54.0% 54.7% 48.2% 51.4% 64.5% 55.0%
AIME 2026 97.1% 94.2% 95.8% 96.4% 99.2% 96.7% 98.3% – 99.9%
GPQA Diamond 87.2% 86.7% 87.9% 91.1% 89.5% 88.8% 94.1% 92.6% 94.1%
Agentic (coding)
SWEBench Verified 77.6% 70.7% 76.8% 80.2% – 80.6% 80.6% 95.0% –
SWEBench Pro (Public) 54.3% 46.4% 50.7% 58.6% 62.1% 55.4% 54.2% 80.0% 64.6%
Terminal Bench 2.1 (Best Harness) 63.8 56.4 51.3 71.3 82.7 64 73.8 84.6 89.5
GDPVal-AA v2 1233 1164 1009 1190 1514 1307 962 1760 1748
Agentic (general)
MCP Atlas 74.1% 44.7% 64.0% 68.1% 77.8% 73.2% 78.2% 83.3% 81.8%
Tau 3 Banking 23.7% 13.8% 13.2% 20.6% 26.8% 25.8% 16.5% 26.8% 33.0%
Factuality
BrowseComp (w/ Ctx) 77.1% – 74.9% 83.2% – 83.4% 85.9% 88.0% 89.4%
SimpleQA Verified 43.9% 32.4% 36.9% 38.7% 38.1% 57.0% 77.3% 68.3% 71.6%
AA Omniscience 1.0% -1.0% -8.0% 6.0% 4.0% -10.0% 33.0% 40.0% 22.0%
Chat
IFBench 79.8% 81.4% 70.2% 76.0% 73.3% 76.5% 77.1% 63.5% 72.7%
Global-MMLU-Lite 88.7% 85.6% 84.0% 88.4% 89.2% 89.3% 92.7% 93.3% 91.8%
Vision
MMMU Pro (Standard 10) 73.5% – 75.0% 79.0% – – 82.0% 84.2% 83.0%
Charxiv RQ 78.1% – 77.5% 80.4% – – 80.2% 86.5% 84.7%
Charxiv RQ (with python) 82.0% – 78.7% 86.7% – – 89.9% 89.4% 87.8%
Audio
Audio MC 56.6% – – – – – 66.8% – –
MMAU 77.2% – – – – – 82.5% – –
VoiceBench 91.4% – – – – – 94.3% – –
Safety
FORTRESS (Adversarial) 78.0% 77.6% 54.1% 65.6% 71.3% 36.0% 65.2% 96.0% 82.4%
FORTRESS (Benign) 95.9% 90.5% 98.3% 97.2% 90.0% 98.5% 98.0% 55.1% 98.1%
StrongREJECT 98.6% 98.7% 99.5% 99.8% 98.5% 98.6% 98.0% 98.7% 98.5%

원문