Mage-VL은 이미지와 비디오 이해를 위한 코덱 네이티브, 능동적 스트리밍 멀티모달 파운데이션 모델이며, 비주얼 인코더는 완전히 처음부터 훈련되어 컴팩트한 4B 규모로 구성된다.
비디오를 균일하게 샘플링한 프레임으로 디코딩하고 고정된 웹 사전학습 ViT를 통해 밀집된 패치 토큰 격자를 전달하는 대신, Mage-VL은 현대 비디오 코덱의 구조를 따라 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하고, 모든 앵커 패치를 유지하며, 코덱이 비트를 소비하는 예측 프레임 패치 즉 실제 움직임과 새로운 세부 정보를 담고 있는 영역만을 보존한다.
이러한 코덱 정렬 희소성은 시공간 맥락을 보존하면서 비주얼 토큰을 75% 이상 줄이며, 균일 프레임 샘플링 대비 최대 3.5배의 실제 소요 시간 기준 추론 속도 향상을 가져온다.
유일한 사전학습된 구성 요소인 Qwen3-4B-Instruct-2507 언어 백본은 Qwen3-4B causal decoder로서 경량 2계층 MLP 프로젝터를 통해 Mage-ViT의 가변 길이 토큰 스트림을 입력받으며, 이미지, 짧은/긴/초장편 비디오, 스트리밍을 위한 통합 인터페이스를 제공한다.
이 쌍 위에 System 1 & System 2 이중 프로세스 설계가 추가되어 단일 모델 내에서 능동적 스트리밍을 구현하는데, 경량 cognition gate(System 1)가 각 순환 코덱 윈도우를 감시하며 일상적인 콘텐츠에는 침묵하고, 응답할 가치가 있는 이벤트가 완료될 때만 전체 VLM(System 2)을 호출하여 다중 에이전트 파이프라인이 필요 없다.
단일 체크포인트인 microsoft/Mage-VL은 이미지 및 비디오 이해와 능동적 스트리밍 게이트를 동시에 제공하는 하나의 통합 모델이며, 동일한 가중치가 오프라인 이미지/비디오 질문에 답하고 이벤트 기반 코멘터리를 구동한다.