llmfeed

딥시크, 이미지·텍스트를 함께 받는 MoE 모델 DeepSeek-V4.1-Flash 공개

딥시크
  • 딥시크가 이미지와 텍스트를 함께 받는 MoE 모델 DeepSeek-V4.1-Flash를 MIT 라이선스로 공개했다.
  • 백본 552B 가운데 토큰당 8B(프리필)·16B(디코드)만 활성화하고, 최대 100만 토큰 컨텍스트를 지원한다.
모델DeepSeek-V4.1-Flash
저장소deepseek-ai/DeepSeek-V4.1-Flash
개방성오픈형
컨텍스트 1M
파라미터 552B
라이선스 MIT

무엇이 나왔나

  • 딥시크가 DeepSeek-V4.1-Flash를 공개했다.
  • 이미지와 텍스트를 바로 입력으로 받고 텍스트를 자기회귀 방식으로 생성하는 멀티모달 Mixture-of-Experts(MoE) 모델이다.
  • 저장소와 모델 가중치는 MIT 라이선스로 배포된다.

이 모델은 1부터 100까지 정수로 지정하는 reasoning effort 설정을 지원하며, 값에 따라 추론 비용과 정확도가 맞바뀐다고 회사는 밝혔다.

  • 이번 공개에는 Jinja 형식의 채팅 템플릿이 포함되지 않는다.
  • 대신 다중 턴 대화, 도구 호출, 사고 모드, 숫자형 reasoning effort, 대화 중간의 시스템 메시지, 이미지가 섞인 입력에 대한 테스트 케이스를 갖춘 파이썬 참조 구현이 함께 들어 있다.
  • 또한 회사는 실제 서비스용으로 deepseek-recipe도 함께 공개했다.
  • 파이썬 바인딩을 갖춘 러스트 라이브러리 묶음으로, Messages·Chat Completions·Responses API 요청을 Conversation 형식으로 바꾼 뒤 DeepSeek V4 및 V4.1 프롬프트나 토큰 ID로 인코딩하고, 모델 출력을 완성형 또는 스트리밍 응답으로 되돌려 파싱한다.
  • 모델 추론, 도구 실행, HTTP 전송은 호출하는 쪽이 맡는다.

규모와 구조

백본 파라미터는 552B이고, 컨텍스트는 최대 100만 토큰까지 지원한다.

  • 구조는 Causal Encoder-Decoder(CED)다.
  • 40층 트랜스포머를 20층 causal encoder와 그 뒤의 20층 decoder로 나눈 형태로, 디코더의 글로벌 KV 캐시를 각 디코더 층의 히든 상태에서 뽑지 않고 마지막 인코더 히든 상태에서 투영해 만든다.
  • 그 덕에 토큰당 활성 파라미터가 프리필에서 8B, 디코드에서 16B로 줄어, 입력이 많은 에이전트 작업의 비용 효율이 크게 좋아진다고 회사는 설명했다.
  • SWA Bounded Replay는 빠진 SWA KV 상태를 가장 최근 n_win 토큰만 다시 돌려 복원하므로 SWA KV를 SSD에 남길 필요가 없고, 지속 KV 캐시 용량이 DeepSeek-V4-Flash의 약 8분의 1로 줄어든다.
  • 어텐션에는 Compressed Sparse Attention 2(CSA2)를 쓴다.
  • 각 어텐션 층에 Full·Reindex·Reuse 세 가지 정적 모드 가운데 하나를 배정해 메인 KV와 인덱서 K를 층끼리 공유하고 Top-K 희소 어텐션 인덱스를 재사용하는 방식이다.
  • 디코더에서는 Hierarchical Sparse Indexer가 뒤쪽 인덱싱 층의 탐색 범위를 첫 Full Mode 층이 만든 후보 풀로 제한해, 깊은 인덱서 비용이 컨텍스트 길이와 무관하게 묶인다.
  • 여기에 FP4 메인 KV 캐싱(E2M1 형식, 16채널마다 E4M3 스케일 하나)을 합쳐 글로벌 KV 캐시를 토큰당 890바이트로 줄였고, 이는 DeepSeek-V4-Flash의 약 4분의 1이라고 회사는 밝혔다.
  • 이 밖에 Single-Pass mHC(Mega-mHC 커널을 쓰는 잔차 스트림 혼합 개편), Engram 조건부 메모리(196B 파라미터, 토큰 기반 조회로 희소하게 접근), DSpark 추측 디코딩(반자기회귀 초안 생성과 신뢰도 스케줄 검증)이 들어간다.
  • MoE 층마다 공유 전문가 1개와 라우팅 전문가 384개를 두고, 토큰당 라우팅 전문가 6개를 활성화한다.

멀티모달 쪽은 처음부터 새로 학습한 비전 인코더 DeepSeek-ViT(2D-RoPE와 3×3 픽셀 언셔플 다운샘플링)와 2층 MLP 프로젝터가 이미지를 시각 임베딩으로 바꾸며, 언어 모델 사전학습 시작 단계부터 텍스트 임베딩과 함께 처리된다.

회사가 밝힌 수치

  • 사전학습은 45조 토큰 규모의 멀티모달 말뭉치로 처음부터 진행했다.
  • 희소 어텐션은 시퀀스 길이 64K에서 학습했고, 34조 토큰 지점에서 컨텍스트를 100만 토큰까지 확장했다.
  • 사후학습은 SFT → RL → 온폴리시 증류(OPD)라는 표준 흐름을 알고리즘 수정 없이 따랐고, 달라진 부분은 모두 데이터 파이프라인에 있다고 회사는 밝혔다.
  • 에이전트 과제와 환경을 대규모로 자동 합성하고, 데이터·과제·롤아웃을 점진적으로 키웠다는 설명이다.

글로벌 KV 캐시의 토큰당 크기는 DeepSeek-V4-Flash 대비 약 4배, DeepSeek-V1 대비 약 437배 줄었다고 회사는 밝혔다.

벤치마크

벤치마크 무엇을 재나 DeepSeek-V4.1-Flash (552B) DeepSeek-V4-Flash (284B) DeepSeek-V4-Pro (1.6T)
AGIEval 종합 학업 지식 83.4 83.9 84.4
MMLU-Pro 다분야 전문 지식 74.1 68.3 73.5
C-Eval 중국어 학업 지식 92.1 92.1 93.1
MultiLoKo 다국어 지식 45.5 42.6 50.9
SimpleQA-Verified 사실 질의 정확도 42.3 30.1 55.2
SuperGPQA 대학원 수준 지식 53.1 46.5 53.9
BBH 어려운 추론 과제 86.1 86.9 87.5
BBEH 확장된 난이도 추론 27.2 25.4 29.8
DROP 독해 기반 수치 추론 87.9 88.6 88.7
HellaSwag 상식 문맥 추론 87.2 85.7 88.0
BigCodeBench 실무형 코드 작성 60.6 56.8 59.2
HumanEval 기초 코드 생성 79.4 69.5 76.8
GSM8K 초등 수준 문장제 수학 93.0 90.8 92.6
MATH 경쟁 수학 문제 61.1 57.4 64.5
MGSM 다국어 문장제 수학 80.2 85.7 84.4
LongBench-V2 긴 문맥 이해 45.2 44.7 51.5
MMMU-Pro 이미지 포함 전문 지식 56.5 — —
CVBench 시각 이해 77.9 — —
DocVQA 문서 이미지 질의응답 95.6 — —
RefCOCO-avg 이미지 영역 지시 이해 86.0 — —
GPQA Diamond 대학원 수준 과학 추론 90.9 89.9 92.4
HLE 고난도 종합 시험 36.8 (39.1†) 37.8† 42.7†
Codeforces 경쟁 프로그래밍 레이팅 3471 3289 3348
MathArena Apex 고난도 수학 경시 65.6 58.6 65.3
Terminal-Bench 2.1 터미널 작업 수행 90.6 82.7 87.9
Terminal-Bench 3.0 터미널 작업 수행 30.0 7.6 11.8
Terminal-Bench 4.0 터미널 작업 수행 31.2 7.0 12.4
DeepSWE v1.1 실제 이슈 해결 74.2 54.4 62.7
ProgramBench — 20.3 — 15.5
NL2Repo-Bench 설명에서 저장소 구현 64.0 54.2 61.5
CyberGym 보안 과제 수행 88.1 76.7 83.3
SEC-Bench Pro 보안 과제 수행 62.8 30.9 56.4
ExploitGym 취약점 공격 실습 15.3 1.8 5.4
HLE w/ tools 도구 사용 종합 시험 63.9 51.5 60.0
AutomationBench 업무 자동화 수행 54.8 37.7 43.2
Agent's Last Exam 고난도 에이전트 과제 31.8 25.2 25.7
Chartography w/ tools 도구 사용 도표 이해 78.9 — —
BabyVision w/ tools 도구 사용 시각 추론 89.6 — —
ZeroBench-main w/ tools 도구 사용 시각 난문 49.0 — —
  • 세계지식부터 멀티모달까지의 항목은 회사 내부 평가 체계에서 같은 설정으로 측정한 베이스 모델 점수이고(0.3 이내 차이는 동등으로 본다), GPQA Diamond 이하 항목은 instruct 모델을 최대 reasoning effort(reasoning_effort=100), temperature=1.0, top_p=0.95로 측정한 값이다.
  • †는 HLE의 텍스트 전용 부분집합이다.
  • 회사는 이와 별도로 여러 에이전트 스캐폴드별 측정 결과도 함께 공개했다.

원문