모델 출시
NVIDIA, 하이브리드 MoE 아키텍처 기반 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 공개
- NVIDIA가 활성 파라미터 3B, 총 파라미터 30B의 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 모델을 공개했다.
- 20T개 이상의 토큰으로 사전 훈련되었으며 최대 1M 컨텍스트 길이를 지원한다.
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4는 NVIDIA가 훈련한 대규모 언어 모델(LLM)이다.
- 이 모델은 인터리브된 Mamba-2와 MoE 레이어에 더해 선택된 어텐션 레이어를 활용하는 하이브리드 Mixture-of-Experts 아키텍처를 채택한다.
- Lightning 3.5 모델은 더 빠른 텍스트 생성을 위한 여러 추측 디코딩 방법과 함께 공개된다.
- 이 모델은 활성 파라미터 3B와 총 파라미터 30B를 갖는다.
- 이 모델은 20T개가 넘는 토큰으로 사전 훈련되었으며 최대 1M 컨텍스트 길이를 지원한다.
- 이 모델은 여러 미래 토큰을 예측하여 더 풍부한 훈련 신호를 제공하는 Multi-Token Prediction(MTP) 레이어를 포함한다.
벤치마크
- 회사가 자기 발표에 실은 값이다.
- 비교 대상과 측정 조건은 회사가 정했다.
Reasoning Benchmark Evaluations
| Task |
Nemotron-3.5-Lightning-30B-A3B-BF16 |
Nemotron-3.5-Lightning-30B-A3B-NVFP4 |
| General Knowledge |
|
|
| MMLU Pro |
81.94 |
81.62 |
| AA-Omniscience |
17.50 |
16.63 |
| Reasoning |
|
|
| GPQA Diamond (no tools) |
75.44 |
75.57 |
| HLE (text-only, no tools) |
11.72 |
10.47 |
| SciCode |
32.60 |
31.38 |
| Coding & Agentic |
|
|
| SWE-bench Verified |
51.56 |
52.80 |
| SWE-bench Multilingual |
39.33 |
36.47 |
| Terminal-Bench 2.1 |
24.58 |
23.46 |
| PinchBench |
85.37 |
83.43 |
| BrowseComp |
36.97 |
36.81 |
| τ³-bench (Banking) |
9.28 |
9.48 |
| GDPval-AA-V2 |
832 |
865 |
| Instruction Following |
|
|
| IFBench (loose) |
71.88 |
72.88 |
| Long Context |
|
|
| AA-LCR |
52.00 |
49.19 |
같은 발표의 다른 판