llmfeed

LFM2.5-VL-3B, LFM2-VL-3B 대비 화면 이해·그라운딩·도구 사용 크게 향상

리퀴드 AI
  • LFM2.5-VL-3B가 공개됐다.
  • 온디바이스용 LFM2.5 계열의 멀티모달 변형으로, 화면 이해·그라운딩·다중 이미지·도구 사용에서 이전 모델보다 크게 향상됐다.
모델LFM2.5-VL-3B
저장소LiquidAI/LFM2.5-VL-3B
개방성오픈형
라이선스 lfm1.0
  • LFM2.5-VL-3B는 온디바이스 배포를 위해 설계된 하이브리드 모델 계열인 LFM2.5의 멀티모달 변형이다.
  • 이는 LFM2-VL-3B를 기반으로 추가적인 중간 학습과 사후 학습을 거쳐 구축되었다.
  • LFM2.5-VL-3B는 텍스트와 이미지를 모두 처리할 수 있으며, LFM2.5-2.6B 언어 모델을 백본으로 사용하고 SigLIP2 NaFlex 비전 인코더와 결합한다.
  • LFM2.5-VL-3B는 화면 이해, 그라운딩, 다중 이미지 입력, 도구 사용에서 LFM2-VL-3B보다 크게 향상되었다.
  • LFM2.5-VL-3B는 Apple M5 Max에서 초당 228 토큰, AMD Ryzen AI Max+ 395에서 초당 116 토큰을 디코딩하며, 약 3 GB의 메모리에 들어간다.
  • 단일 NVIDIA H100에서 vLLM을 사용할 때, LFM2.5-VL-3B는 테스트한 모델 중 가장 높은 출력 처리량을 기록하며, 높은 동시성에서 초당 약 11K 토큰, 즉 하루에 거의 1B 토큰에 달한다.

회사가 밝힌 수치

Model Description
LFM2.5‑VL‑3B Original checkpoint in native format. Best for fine-tuning and inference with HF Transformers, vLLM and SGLang
LFM2.5‑VL‑3B‑GGUF Quantized GGUF exports of the original checkpoint. Best for CPU inference with reduced memory usage with llama.cpp
LFM2.5‑VL‑3B‑ONNX Quantized ONNX exports for cross-platform deployment. Enables hardware-accelerated inference across diverse environments (cloud, edge, mobile). See the demo.
LFM2.5-VL-3B-MLX Quantized MLX exports for Apple Silicon. Optimized for fast inference on Mac devices using the mlx-vlm framework.

벤치마크

  • 회사가 자기 발표에 실은 값이다.
  • 비교 대상과 측정 조건은 회사가 정했다.

Benchmarks

Benchmark LFM2.5‑VL‑3B (3.1B) LFM2‑VL‑3B (3.1B) Gemma4 E2B (5.1B) Gemma4 E4B (8B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
ScreenSpot-v2 (avg) 80.7 - 31.1 50.9 84.2 66.5 78.5
RefCOCO (Macro Prec@1) 87.9 57.1 (-30.8) 67.3 72.1 88.9 78.5 86.6
BLINK 61.5 50.2 (-11.3) 51.8 56.4 57.4 59.3 65.0
MuirBench 58.3 34.9 (-23.4) 40.7 48.9 53.4 49.0 67.0
ToolSandBox 59.5 26.4 (-33.1) 56.5 61.6 n/a1 47.7 65.0
BFCLv4 32.5 20.5 (-12.0) 33.2 40.0 n/a1 33.9 53.6

Benchmarks

Benchmark LFM2.5‑VL‑3B (3.1B) LFM2‑VL‑3B (3.1B) Gemma4 E2B (5.1B) Gemma4 E4B (8B) InternVL 3.5 2B (2.4B) InternVL 3.5 4B (4.7B) Qwen3.5-2B (2.3B) Qwen3.5-4B (4.7B)
MME 73.1 73.0 54.9 68.1 73.3 80.8 76.4 79.5
MMStar 63.3 57.7 57.9 61.9 57.5 65.3 67.9 73.3
RealWorldQA 73.1 71.1 56.2 61.8 61.4 68.6 71.4 76.2
CountBenchQA 87.3 92.2 70.8 80.1 70.6 82.5 83.2 86.9
MMMB 83.0 81.9 75.7 80.5 76.4 81.5 73.6 83.4
MM-IF Eval 60.6 51.4 64.5 66.7 48.4 54.6 52.1 63.8
MathVista 68.5 68.5 62.1 52.9 56.6 59.1 68.8 69.7
MMMU Pro 30.5 28.7 34.5 39.1 27.4 31.6 43.5 60.9
ChartQA 81.3 80.4 43.5 41.9 81.8 86.5 78.3 84.2
OCRBenchv22 47.5 43.9 44.7 48.7 45.5 49.2 48.0 58.8
POPE 88.7 89.2 84.0 86.9 87.3 88.9 88.7 86.0

원문