modellog

LLM 새 모델·변경 소식을 회사 공식 발표에서 모아 한국어로 정리한다

마이크로소프트 모델 출시 오픈형

마이크로소프트, 코덱 네이티브 능동 스트리밍 멀티모달 모델 Mage-VL 공개

마이크로소프트가 4B 규모 멀티모달 모델 Mage-VL을 공개했다. 비디오 코덱 구조를 활용해 비주얼 토큰을 75% 이상 줄이고 추론 속도를 최대 3.5배 높였으며, 단일 체크포인트로 이미지·비디오 이해와 능동 스트리밍을 동시에 지원한다.

Mage-VL Mage-VL microsoft/Mage-VL
라이선스 apache-2.0

Mage-VL은 이미지와 비디오 이해를 위한 코덱 네이티브, 능동적 스트리밍 멀티모달 파운데이션 모델이며, 비주얼 인코더는 완전히 처음부터 훈련되어 컴팩트한 4B 규모로 구성된다. 비디오를 균일하게 샘플링한 프레임으로 디코딩하고 고정된 웹 사전학습 ViT를 통해 밀집된 패치 토큰 격자를 전달하는 대신, Mage-VL은 현대 비디오 코덱의 구조를 따라 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하고, 모든 앵커 패치를 유지하며, 코덱이 비트를 소비하는 예측 프레임 패치 즉 실제 움직임과 새로운 세부 정보를 담고 있는 영역만을 보존한다. 이러한 코덱 정렬 희소성은 시공간 맥락을 보존하면서 비주얼 토큰을 75% 이상 줄이며, 균일 프레임 샘플링 대비 최대 3.5배의 실제 소요 시간 기준 추론 속도 향상을 가져온다. 유일한 사전학습된 구성 요소인 Qwen3-4B-Instruct-2507 언어 백본은 Qwen3-4B causal decoder로서 경량 2계층 MLP 프로젝터를 통해 Mage-ViT의 가변 길이 토큰 스트림을 입력받으며, 이미지, 짧은/긴/초장편 비디오, 스트리밍을 위한 통합 인터페이스를 제공한다. 이 쌍 위에 System 1 & System 2 이중 프로세스 설계가 추가되어 단일 모델 내에서 능동적 스트리밍을 구현하는데, 경량 cognition gate(System 1)가 각 순환 코덱 윈도우를 감시하며 일상적인 콘텐츠에는 침묵하고, 응답할 가치가 있는 이벤트가 완료될 때만 전체 VLM(System 2)을 호출하여 다중 에이전트 파이프라인이 필요 없다. 단일 체크포인트인 microsoft/Mage-VL은 이미지 및 비디오 이해와 능동적 스트리밍 게이트를 동시에 제공하는 하나의 통합 모델이며, 동일한 가중치가 오프라인 이미지/비디오 질문에 답하고 이벤트 기반 코멘터리를 구동한다.

벤치마크

회사가 자기 발표에 실은 값이다. 비교 대상과 측정 조건은 회사가 정했다.

📊 Performance

Benchmark Mage-VL-4B Qwen3-VL-4B Phi-4-MM-5.6B Phi-4-R-V-15B
Document understanding
DocVQA-val 95.14 94.69 92.79 76.20
InfoVQA-val 80.33 79.50 71.84 55.41
AI2D w/ Mask 83.16 81.54 81.83 82.87
ChartQA 84.88 83.96 83.76 83.40
OCRBench 81.80 81.60 81.70 73.90
MultiDocVQA-val 87.46 87.21 46.84 58.35
ChartQAPro 32.57 26.79 0.13 25.38
TextVQA-val 77.28 80.55 39.93 76.06
CC-OCR Doc 32.25 39.69 4.99 17.65
General VQA
MMBench-EN-dev 84.02 83.25 65.81 84.19
MMBench-CN-dev 82.04 80.58 75.17 79.47
MMStar 67.32 62.04 61.24 59.63
MME-Perception 1709.54 1703.50 1409.66 1590.21
SeedBench (All) 76.78 75.65 68.28 73.70
CV-Bench 87.79 85.37 57.09 81.31
MME-RealWorld 66.52 63.20 32.45 57.80
Spatial intelligence
CV-Bench-2D 82.13 81.00 56.12 80.11
CV-Bench-3D 94.75 92.30 56.92 82.50
BLINK 65.11 65.10 35.24 57.80
EmbSpatial 82.67 77.50 41.51 72.67
CrossPoint 80.00 26.90 12.20 47.73
CRPE-Relation 76.12 77.70 34.60 74.46
SAT 67.33 69.30 55.33 66.67

📊 Performance

Benchmark Mage-VL-4B Qwen3-VL-4B Phi-4-MM-5.6B Phi-4-R-V-15B
Video QA
MV-Bench 65.1 66.7 44.9 49.2
NextQA 83.1 79.8 54.1 69.0
VideoMME 64.0 59.7 44.7 55.3
LongVideoBench 61.3 57.7 41.14 51.2
LVBench 41.8 39.2 25.31 34.4
MLVU-dev 68.7 61.5 44.18 51.8
VideoEval-Pro 45.2 20.7 14.35 16.8
Temporal grounding
Timelens-Charades 50.7 43.1 4.09 20.6
Timelens-ActivityNet 45.4 28.4 2.03 23.0
Timelens-QVHighlight 57.4 34.9 2.47 11.6
Spatial reasoning
VSI-Bench 64.3 53.3 24.09 25.5
Tracking (J&F)
Ref-DAVIS17 25.83 7.48 3.14 2.15
MeViS-ValidU 22.55 3.16 10.28 1.53
ReasonVOS 17.76 9.66 9.50 9.77
Ref-YT-VOS 25.57 5.28 8.64 3.85

📊 Performance

Method TriggerAcc TimVal F1 ROC-AUC PR-AUC
StreamMind 52.18 47.36
JoyAI-VL-Interaction-9B 97.98 19.25 3.55 56.26 1.68
Mage-VL-4B 79.21 55.54 16.35 83.14 9.30

📊 Performance

Model #Frames RT-Avg BT-Avg Overall
Human 93.2 92.3 92.77
Offline video LLMs
Qwen2.5-VL-7B 1 fps 59.9 44.7 52.28
LLaVA-Video-7B 64 63.5 40.4 51.95
Qwen3-VL-4B 64 72.8 53.1 63.00
Online / streaming video LLMs
VideoLLM-online-8B 2 fps 20.8 17.7 19.26
Flash-VStream-7B 1 fps 28.4 27.4 27.90
Dispider-7B 1 fps 54.6 36.1 45.35
TimeChat-Online-7B 1 fps 61.9 41.7 51.80
StreamForest-7B 1 fps 61.2 52.0 56.60
Streamo-7B 1 fps 66.0 46.1 56.05
HERMES-7B 1 fps 69.0 49.4 59.20
JoyAI-VL-Interaction-9B 1 fps 68.4 48.6 58.50
Mage-VL-4B 1 fps 79.84 48.15 64.00

원문