모델 출시
딥시크, 이미지·텍스트를 함께 받는 MoE 모델 DeepSeek-V4.1-Flash 공개
- 딥시크가 이미지와 텍스트를 함께 받는 MoE 모델 DeepSeek-V4.1-Flash를 MIT 라이선스로 공개했다.
- 백본 552B 가운데 토큰당 8B(프리필)·16B(디코드)만 활성화하고, 최대 100만 토큰 컨텍스트를 지원한다.
| 모델 | DeepSeek-V4.1-Flash |
|---|---|
| 저장소 | deepseek-ai/DeepSeek-V4.1-Flash |
| 개방성 | 오픈형 |
| 컨텍스트 | 1M |
| 파라미터 | 552B |
| 라이선스 | MIT |
무엇이 나왔나
- 딥시크가 DeepSeek-V4.1-Flash를 공개했다.
- 이미지와 텍스트를 바로 입력으로 받고 텍스트를 자기회귀 방식으로 생성하는 멀티모달 Mixture-of-Experts(MoE) 모델이다.
- 저장소와 모델 가중치는 MIT 라이선스로 배포된다.
이 모델은 1부터 100까지 정수로 지정하는 reasoning effort 설정을 지원하며, 값에 따라 추론 비용과 정확도가 맞바뀐다고 회사는 밝혔다.
- 이번 공개에는 Jinja 형식의 채팅 템플릿이 포함되지 않는다.
- 대신 다중 턴 대화, 도구 호출, 사고 모드, 숫자형 reasoning effort, 대화 중간의 시스템 메시지, 이미지가 섞인 입력에 대한 테스트 케이스를 갖춘 파이썬 참조 구현이 함께 들어 있다.
- 또한 회사는 실제 서비스용으로 deepseek-recipe도 함께 공개했다.
- 파이썬 바인딩을 갖춘 러스트 라이브러리 묶음으로, Messages·Chat Completions·Responses API 요청을 Conversation 형식으로 바꾼 뒤 DeepSeek V4 및 V4.1 프롬프트나 토큰 ID로 인코딩하고, 모델 출력을 완성형 또는 스트리밍 응답으로 되돌려 파싱한다.
- 모델 추론, 도구 실행, HTTP 전송은 호출하는 쪽이 맡는다.
규모와 구조
백본 파라미터는 552B이고, 컨텍스트는 최대 100만 토큰까지 지원한다.
- 구조는 Causal Encoder-Decoder(CED)다.
- 40층 트랜스포머를 20층 causal encoder와 그 뒤의 20층 decoder로 나눈 형태로, 디코더의 글로벌 KV 캐시를 각 디코더 층의 히든 상태에서 뽑지 않고 마지막 인코더 히든 상태에서 투영해 만든다.
- 그 덕에 토큰당 활성 파라미터가 프리필에서 8B, 디코드에서 16B로 줄어, 입력이 많은 에이전트 작업의 비용 효율이 크게 좋아진다고 회사는 설명했다.
- SWA Bounded Replay는 빠진 SWA KV 상태를 가장 최근 n_win 토큰만 다시 돌려 복원하므로 SWA KV를 SSD에 남길 필요가 없고, 지속 KV 캐시 용량이 DeepSeek-V4-Flash의 약 8분의 1로 줄어든다.
- 어텐션에는 Compressed Sparse Attention 2(CSA2)를 쓴다.
- 각 어텐션 층에 Full·Reindex·Reuse 세 가지 정적 모드 가운데 하나를 배정해 메인 KV와 인덱서 K를 층끼리 공유하고 Top-K 희소 어텐션 인덱스를 재사용하는 방식이다.
- 디코더에서는 Hierarchical Sparse Indexer가 뒤쪽 인덱싱 층의 탐색 범위를 첫 Full Mode 층이 만든 후보 풀로 제한해, 깊은 인덱서 비용이 컨텍스트 길이와 무관하게 묶인다.
- 여기에 FP4 메인 KV 캐싱(E2M1 형식, 16채널마다 E4M3 스케일 하나)을 합쳐 글로벌 KV 캐시를 토큰당 890바이트로 줄였고, 이는 DeepSeek-V4-Flash의 약 4분의 1이라고 회사는 밝혔다.
- 이 밖에 Single-Pass mHC(Mega-mHC 커널을 쓰는 잔차 스트림 혼합 개편), Engram 조건부 메모리(196B 파라미터, 토큰 기반 조회로 희소하게 접근), DSpark 추측 디코딩(반자기회귀 초안 생성과 신뢰도 스케줄 검증)이 들어간다.
- MoE 층마다 공유 전문가 1개와 라우팅 전문가 384개를 두고, 토큰당 라우팅 전문가 6개를 활성화한다.
멀티모달 쪽은 처음부터 새로 학습한 비전 인코더 DeepSeek-ViT(2D-RoPE와 3×3 픽셀 언셔플 다운샘플링)와 2층 MLP 프로젝터가 이미지를 시각 임베딩으로 바꾸며, 언어 모델 사전학습 시작 단계부터 텍스트 임베딩과 함께 처리된다.
회사가 밝힌 수치
- 사전학습은 45조 토큰 규모의 멀티모달 말뭉치로 처음부터 진행했다.
- 희소 어텐션은 시퀀스 길이 64K에서 학습했고, 34조 토큰 지점에서 컨텍스트를 100만 토큰까지 확장했다.
- 사후학습은 SFT → RL → 온폴리시 증류(OPD)라는 표준 흐름을 알고리즘 수정 없이 따랐고, 달라진 부분은 모두 데이터 파이프라인에 있다고 회사는 밝혔다.
- 에이전트 과제와 환경을 대규모로 자동 합성하고, 데이터·과제·롤아웃을 점진적으로 키웠다는 설명이다.
글로벌 KV 캐시의 토큰당 크기는 DeepSeek-V4-Flash 대비 약 4배, DeepSeek-V1 대비 약 437배 줄었다고 회사는 밝혔다.
벤치마크
| 벤치마크 | 무엇을 재나 | DeepSeek-V4.1-Flash (552B) | DeepSeek-V4-Flash (284B) | DeepSeek-V4-Pro (1.6T) |
|---|---|---|---|---|
| AGIEval | 종합 학업 지식 | 83.4 | 83.9 | 84.4 |
| MMLU-Pro | 다분야 전문 지식 | 74.1 | 68.3 | 73.5 |
| C-Eval | 중국어 학업 지식 | 92.1 | 92.1 | 93.1 |
| MultiLoKo | 다국어 지식 | 45.5 | 42.6 | 50.9 |
| SimpleQA-Verified | 사실 질의 정확도 | 42.3 | 30.1 | 55.2 |
| SuperGPQA | 대학원 수준 지식 | 53.1 | 46.5 | 53.9 |
| BBH | 어려운 추론 과제 | 86.1 | 86.9 | 87.5 |
| BBEH | 확장된 난이도 추론 | 27.2 | 25.4 | 29.8 |
| DROP | 독해 기반 수치 추론 | 87.9 | 88.6 | 88.7 |
| HellaSwag | 상식 문맥 추론 | 87.2 | 85.7 | 88.0 |
| BigCodeBench | 실무형 코드 작성 | 60.6 | 56.8 | 59.2 |
| HumanEval | 기초 코드 생성 | 79.4 | 69.5 | 76.8 |
| GSM8K | 초등 수준 문장제 수학 | 93.0 | 90.8 | 92.6 |
| MATH | 경쟁 수학 문제 | 61.1 | 57.4 | 64.5 |
| MGSM | 다국어 문장제 수학 | 80.2 | 85.7 | 84.4 |
| LongBench-V2 | 긴 문맥 이해 | 45.2 | 44.7 | 51.5 |
| MMMU-Pro | 이미지 포함 전문 지식 | 56.5 | — | — |
| CVBench | 시각 이해 | 77.9 | — | — |
| DocVQA | 문서 이미지 질의응답 | 95.6 | — | — |
| RefCOCO-avg | 이미지 영역 지시 이해 | 86.0 | — | — |
| GPQA Diamond | 대학원 수준 과학 추론 | 90.9 | 89.9 | 92.4 |
| HLE | 고난도 종합 시험 | 36.8 (39.1†) | 37.8† | 42.7† |
| Codeforces | 경쟁 프로그래밍 레이팅 | 3471 | 3289 | 3348 |
| MathArena Apex | 고난도 수학 경시 | 65.6 | 58.6 | 65.3 |
| Terminal-Bench 2.1 | 터미널 작업 수행 | 90.6 | 82.7 | 87.9 |
| Terminal-Bench 3.0 | 터미널 작업 수행 | 30.0 | 7.6 | 11.8 |
| Terminal-Bench 4.0 | 터미널 작업 수행 | 31.2 | 7.0 | 12.4 |
| DeepSWE v1.1 | 실제 이슈 해결 | 74.2 | 54.4 | 62.7 |
| ProgramBench | — | 20.3 | — | 15.5 |
| NL2Repo-Bench | 설명에서 저장소 구현 | 64.0 | 54.2 | 61.5 |
| CyberGym | 보안 과제 수행 | 88.1 | 76.7 | 83.3 |
| SEC-Bench Pro | 보안 과제 수행 | 62.8 | 30.9 | 56.4 |
| ExploitGym | 취약점 공격 실습 | 15.3 | 1.8 | 5.4 |
| HLE w/ tools | 도구 사용 종합 시험 | 63.9 | 51.5 | 60.0 |
| AutomationBench | 업무 자동화 수행 | 54.8 | 37.7 | 43.2 |
| Agent's Last Exam | 고난도 에이전트 과제 | 31.8 | 25.2 | 25.7 |
| Chartography w/ tools | 도구 사용 도표 이해 | 78.9 | — | — |
| BabyVision w/ tools | 도구 사용 시각 추론 | 89.6 | — | — |
| ZeroBench-main w/ tools | 도구 사용 시각 난문 | 49.0 | — | — |
- 세계지식부터 멀티모달까지의 항목은 회사 내부 평가 체계에서 같은 설정으로 측정한 베이스 모델 점수이고(0.3 이내 차이는 동등으로 본다), GPQA Diamond 이하 항목은 instruct 모델을 최대 reasoning effort(reasoning_effort=100), temperature=1.0, top_p=0.95로 측정한 값이다.
- †는 HLE의 텍스트 전용 부분집합이다.
- 회사는 이와 별도로 여러 에이전트 스캐폴드별 측정 결과도 함께 공개했다.