모델 출시
TaichuAI, 공간 추론과 에이전트를 앞세운 멀티모달 모델 ZDTaichu5.0-9B 공개
T- TaichuAI가 글·이미지·영상을 함께 받는 9B급 멀티모달 모델 ZDTaichu5.0-9B를 공개했다.
- Qwen3.5-9B 언어 백본과 C-RADIOv4-H 비전 인코더를 결합했고, 컨텍스트는 최대 128K 토큰이다.
| 모델 | ZDTaichu5.0-9B |
|---|---|
| 저장소 | TaichuAI/ZDTaichu5.0-9B |
| 개방성 | 오픈형 |
| 컨텍스트 | 128K |
| 라이선스 | NVIDIA Open Model License Agreement |
무엇이 나왔나
- TaichuAI가 ZDTaichu5.0-9B를 공개했다.
- 일반적인 시각 이해, 공간 추론, 도구를 쓰는 에이전트 작업, 체화 인공지능(embodied AI) 연구를 함께 겨냥한 멀티모달 기반 모델이다.
- 글과 한 장 또는 여러 장의 이미지, 영상을 입력으로 받으며 해상도 제한 없는 시각 입력을 지원한다고 회사는 밝혔다.
- 회사가 권한 용도는 이렇다.
- 일반 이미지·문서·차트·도해 이해와 문자 인식(OCR), 시각 수학과 지식이 필요한 시각 질의응답, 세밀한 2차원 관계 파악과 여러 시점 연결·3차원 장면 이해·관점 전환과 심상 변환, 여러 단계에 걸친 다중 턴 도구 사용, 그리고 VLA·체화 인공지능에 맞추기 위한 공간 지각과 행동 가능성(affordance) 이해 및 계획이다.
공간 학습이 다루는 범위로는 좌우·상하·전후·가림·포함 관계와 상대 거리, 밀집 개수 세기와 세밀한 위치 지정(점·좌표·바운딩 박스), 이미지와 시점 사이의 연결, 카메라 움직임과 상대 자세·깊이 순서·방 규모의 배치, 자기중심과 타자중심 관점 전환, 2차원·3차원 회전과 종이접기·삼면도·단면·부품 움직임 추론, 체화 행동 가능성과 조작 의미·상위 수준 행동 계획을 들었다.
- 여러 이미지를 비교해 추론할 수 있고, 128K 토큰 컨텍스트 안에서 긴 영상의 사건 추적과 세부 내용 찾기를 포함한 영상 이해를 지원한다고 회사는 설명했다.
- 다만 도구 실행 자체는 모델이 하지 않으며, 도구 실행은 모델을 감싸는 응용 프로그램이 구현하고 검증하고 보안까지 책임져야 한다고 못 박았다.
규모와 구조
- 비전 인코더를 붙인 멀티모달 인과 언어 모델이다.
- 언어 백본은 Qwen3.5-9B LLM 디코더, 비전 백본은 C-RADIOv4-H다.
- 컨텍스트 길이는 최대 128K 토큰이고, 시각 입력은 해상도 제약이 없다.
- 입력 형태는 글, 단일 이미지, 여러 이미지, 영상이다.
- 특징 기술로는 Entropy-Gated Adaptive Recurrent Reasoning을 들었다.
- 더 어려운 토큰에 잠재 공간에서의 반복 정제 단계를 동적으로 더 배정해, 필요한 곳에 계산 깊이를 더 주고 복잡한 과제의 추론 성능을 높이는 방식이라고 회사는 설명했다.
가중치는 NVIDIA Open Model License Agreement로 공개되며, Qwen3.5의 Apache-2.0 라이선스와 그 밖의 제3자 고지가 함께 유지된다.
회사가 밝힌 수치
- 회사는 이번 공개 글에서 비교한 10B 규모 범용 비전-언어 모델들 가운데, 보고된 평가 조건에서 이 모델이 일반 시각 이해를 앞선 수준으로 유지하면서 공간 추론과 상위 수준 체화 추론, 에이전트 과제까지 함께 지원한다고 밝혔다.
- 특정 분야에 맞추려고 폭넓은 시각 능력을 포기한 것이 아니라, 일반 시각 능력 위에 공간·체화·에이전트 능력을 더 얹었다는 설명이다.
- 공간 능력에서는 SparBench, ViewSpatial, MMSI-Bench, MindCube-tiny 결과를 근거로 비교 대상 중 앞선다고 밝혔고, 체화 상호작용 쪽으로는 ERQA 48점, RoboSpatial 56점을 들었다.
- 에이전트 쪽에서는 TAU2-Bench 87.7, Claw-Eval 71.4로 비교 대상을 앞섰고 IFEval은 93.7에 이른다고 밝혔다.
벤치마크
| 벤치마크 | 무엇을 재나 | ZDTaichu5.0-9B (9B) | Qwen3.5-9B (9B) | GPT-5.2 (—) |
|---|---|---|---|---|
| CV-Bench | 기초 시각 공간 인식 | 86.82 | 87.19 | 86.84 |
| 3DSRBench | 3차원 공간 추론 | 60.96 | 56.78 | 60.20 |
| SparBench | 공간 인식·추론 | 51.82 | 50.79 | 55.07 |
| ViewSpatial | 시점 기반 공간 추론 | 62.50 | 48.20 | 47.30 |
| MMSI-Bench | 여러 이미지 공간 추론 | 47.20 | 38.70 | 41.30 |
| MindCube-tiny | 공간 심상 추론 | 78.27 | 57.60 | 60.38 |
| ERQA | 체화 추론 질의응답 | 48.00 | 41.50 | 59.80 |
| RoboSpatial | 로봇 상호작용 공간 이해 | 56.00 | 54.10 | 43.78 |
| VSI-Bench | 영상 기반 공간 지능 | 59.69 | 55.68 | 54.49 |
| MathVista Mini | 시각 자료 수학 | 84.50 | 85.70 | 83.10 |
| WeMath | 시각 수학 추론 | 75.90 | 75.20 | 79.00 |
| MathVerse Mini Vision Only | 그림만 보고 푸는 수학 | 76.40 | 84.14 | — |
| MMStar | 종합 시각 질의응답 | 76.80 | 79.70 | 77.10 |
| AI2D | 과학 도해 이해 | 91.48 | 90.20 | 92.20 |
| RealWorldQA | 실세계 이미지 질의응답 | 76.99 | 80.30 | 83.30 |
| OCRBench | 이미지 속 문자 인식 | 85.50 | 89.20 | 80.70 |
| MMLU-Pro | 폭넓은 지식 추론 | 77.20 | 82.50 | 87.40 |
| MMLU-Redux | 지식 정확도 | 88.40 | 91.10 | 95.00 |
| IFEval | 지시 따르기 | 93.70 | 88.72 | 94.80 |
| IFBench | 지시 따르기 | 69.00 | 64.50 | 75.40 |
| AIME 2025 | 수학 경시 문제 | 86.70 | 83.75 | 100.00 |
| AIME 2026 | 수학 경시 문제 | 89.20 | 87.92 | 96.70 |
| HMMT Feb 2025 | 수학 경시 문제 | 84.20 | 83.20 | 99.40 |
| HMMT Feb 2026 | 수학 경시 문제 | 72.70 | 73.48 | 96.97 |
| LiveCodeBench v6 | 코드 작성 | 73.40 | 65.60 | 87.70 |
| TAU2-Bench† | 도구 사용 에이전트 | 87.70 | 79.10 | 87.10 |
| Claw-Eval general Avg† | 에이전트 종합 | 71.40 | 66.50 | — |
- † 표시한 TAU2-Bench와 Claw-Eval general 측정은 DeepSeek-V4-Flash-0731을 모의 사용자 또는 채점자로 썼고, 외부에 보고된 점수는 인용한 출처의 평가 설정을 따랐다고 회사는 밝혔다.
- ViewSpatial·MMSI-Bench·MindCube-tiny·VSI-Bench 같은 여러 이미지 공간 추론 측정에는 생각 과정을 태그 안에 넣고 최종 답을 상자 안에 넣게 하는 출력 형식 요구가 평가 프롬프트에 추가됐다.