llmfeed

NVIDIA, 하이브리드 MoE 아키텍처 기반 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 공개

엔비디아
  • NVIDIA가 활성 파라미터 3B, 총 파라미터 30B의 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 모델을 공개했다.
  • 20T개 이상의 토큰으로 사전 훈련되었으며 최대 1M 컨텍스트 길이를 지원한다.
모델NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
저장소nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
개방성오픈형
라이선스 openmdw-1.1
  • NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4는 NVIDIA가 훈련한 대규모 언어 모델(LLM)이다.
  • 이 모델은 인터리브된 Mamba-2와 MoE 레이어에 더해 선택된 어텐션 레이어를 활용하는 하이브리드 Mixture-of-Experts 아키텍처를 채택한다.
  • Lightning 3.5 모델은 더 빠른 텍스트 생성을 위한 여러 추측 디코딩 방법과 함께 공개된다.
  • 이 모델은 활성 파라미터 3B와 총 파라미터 30B를 갖는다.
  • 이 모델은 20T개가 넘는 토큰으로 사전 훈련되었으며 최대 1M 컨텍스트 길이를 지원한다.
  • 이 모델은 여러 미래 토큰을 예측하여 더 풍부한 훈련 신호를 제공하는 Multi-Token Prediction(MTP) 레이어를 포함한다.

벤치마크

  • 회사가 자기 발표에 실은 값이다.
  • 비교 대상과 측정 조건은 회사가 정했다.

Reasoning Benchmark Evaluations

Task Nemotron-3.5-Lightning-30B-A3B-BF16 Nemotron-3.5-Lightning-30B-A3B-NVFP4
General Knowledge
MMLU Pro 81.94 81.62
AA-Omniscience 17.50 16.63
Reasoning
GPQA Diamond (no tools) 75.44 75.57
HLE (text-only, no tools) 11.72 10.47
SciCode 32.60 31.38
Coding & Agentic
SWE-bench Verified 51.56 52.80
SWE-bench Multilingual 39.33 36.47
Terminal-Bench 2.1 24.58 23.46
PinchBench 85.37 83.43
BrowseComp 36.97 36.81
τ³-bench (Banking) 9.28 9.48
GDPval-AA-V2 832 865
Instruction Following
IFBench (loose) 71.88 72.88
Long Context
AA-LCR 52.00 49.19

같은 발표의 다른 판

원문