modellog

LLM 새 모델·변경 소식을 회사 공식 발표에서 모아 한국어로 정리한다

씽킹머신스 모델 출시 오픈형

Inkling, 가중치 공개형 멀티모달 MoE 모델로 등장

Inkling은 텍스트·이미지·오디오 입력을 받아 텍스트를 생성하는 범용 멀티모달 모델로, 가중치가 공개된 상태로 배포된다. 66-layer MoE 트랜스포머 구조를 갖춘 네이티브 멀티모달 모델이다.

Inkling Inkling thinkingmachines/Inkling
라이선스 apache-2.0

Inkling은 텍스트, 이미지, 오디오 입력을 받아들이고 텍스트 출력을 생성하는 범용 멀티모달 모델이다. 이 모델은 에이전트형 및 도구 사용 시스템, 코딩 어시스턴트, 챗봇, 검색 증강 생성 시스템을 포함한 AI 기반 애플리케이션을 구축하는 개발자들이 사용하도록 설계되었으며, 범용 대화형 사용, 지시 따르기, 기타 자연어 및 멀티모달 작업에 적합하다. 이 모델은 다운스트림 개발자들의 연구, 파인튜닝, 서드파티 제품 통합을 지원하기 위해 가중치를 공개한 상태로 배포된다. 이 모델은 희소 전문가 혼합 피드포워드 백본을 갖춘 66-layer 디코더 전용 트랜스포머로, 각 토큰은 256개의 전문가 중 6개로 라우팅되며 모든 토큰에 대해 활성화되는 공유 전문가 2개가 추가된다. 이 모델은 네이티브 멀티모달 모델로, 이미지와 비디오는 계층적 패치 인코더를 통해 인코딩되고 오디오는 이산 토큰 인코딩을 통해 인코딩되며 모든 모달리티는 공유 은닉 공간으로 투영되어 디코더에 의해 함께 처리된다. 학습 데이터에는 텍스트, 이미지, 오디오, 비디오를 포함한 다양한 콘텐츠 유형이 포함된다.

벤치마크

회사가 자기 발표에 실은 값이다. 비교 대상과 측정 조건은 회사가 정했다.

5. Evaluations

Inkling Nemotron 3 Ultra Kimi K2.5 Kimi K2.6 GLM 5.2 DeepSeek V4 Pro Gemini 3.1 Pro (high) Claude Fable 5 (max) GPT 5.6 Sol (xhigh)
Reasoning
HLE (text only) 29.7% 26.6% 29.4% 35.9% 40.1% 35.9% 44.7% 53.3% 47.2%
HLE (with tools) 46.0% 37.4% 50.2% 54.0% 54.7% 48.2% 51.4% 64.5% 55.0%
AIME 2026 97.1% 94.2% 95.8% 96.4% 99.2% 96.7% 98.3% 99.9%
GPQA Diamond 87.2% 86.7% 87.9% 91.1% 89.5% 88.8% 94.1% 92.6% 94.1%
Agentic (coding)
SWEBench Verified 77.6% 70.7% 76.8% 80.2% 80.6% 80.6% 95.0%
SWEBench Pro (Public) 54.3% 46.4% 50.7% 58.6% 62.1% 55.4% 54.2% 80.0% 64.6%
Terminal Bench 2.1 (Best Harness) 63.8 56.4 51.3 71.3 82.7 64 73.8 84.6 89.5
GDPVal-AA v2 1233 1164 1009 1190 1514 1307 962 1760 1748
Agentic (general)
MCP Atlas 74.1% 44.7% 64.0% 68.1% 77.8% 73.2% 78.2% 83.3% 81.8%
Tau 3 Banking 23.7% 13.8% 13.2% 20.6% 26.8% 25.8% 16.5% 26.8% 33.0%
Factuality
BrowseComp (w/ Ctx) 77.1% 74.9% 83.2% 83.4% 85.9% 88.0% 89.4%
SimpleQA Verified 43.9% 32.4% 36.9% 38.7% 38.1% 57.0% 77.3% 68.3% 71.6%
AA Omniscience 1.0% -1.0% -8.0% 6.0% 4.0% -10.0% 33.0% 40.0% 22.0%
Chat
IFBench 79.8% 81.4% 70.2% 76.0% 73.3% 76.5% 77.1% 63.5% 72.7%
Global-MMLU-Lite 88.7% 85.6% 84.0% 88.4% 89.2% 89.3% 92.7% 93.3% 91.8%
Vision
MMMU Pro (Standard 10) 73.5% 75.0% 79.0% 82.0% 84.2% 83.0%
Charxiv RQ 78.1% 77.5% 80.4% 80.2% 86.5% 84.7%
Charxiv RQ (with python) 82.0% 78.7% 86.7% 89.9% 89.4% 87.8%
Audio
Audio MC 56.6% 66.8%
MMAU 77.2% 82.5%
VoiceBench 91.4% 94.3%
Safety
FORTRESS (Adversarial) 78.0% 77.6% 54.1% 65.6% 71.3% 36.0% 65.2% 96.0% 82.4%
FORTRESS (Benign) 95.9% 90.5% 98.3% 97.2% 90.0% 98.5% 98.0% 55.1% 98.1%
StrongREJECT 98.6% 98.7% 99.5% 99.8% 98.5% 98.6% 98.0% 98.7% 98.5%

원문