모델 출시
딥시크, DeepSeek-V4-Pro 정식판 DeepSeek-V4-Pro-0813 공개
- 딥시크가 프리뷰를 대체하는 DeepSeek-V4-Pro-0813을 내놓았다.
- 프리뷰 구조에 DSpark 추측 디코딩 모듈을 붙였고, 가중치와 저장소는 MIT 라이선스로 공개됐다.
| 모델 | DeepSeek-V4-Pro-0813 |
|---|---|
| 저장소 | deepseek-ai/DeepSeek-V4-Pro-0813 |
| 개방성 | 오픈형 |
| 라이선스 | MIT |
무엇이 나왔나
- 딥시크가 DeepSeek-V4-Pro의 정식 공개판인 DeepSeek-V4-Pro-0813을 내놓았다.
- 회사는 이 판이 기존 프리뷰판(DeepSeek-V4-Pro (Preview))을 대체하며, 에이전트 능력과 성능이 크게 향상되었고 특히 실제 운영 환경에서 그 차이가 두드러진다고 밝혔다.
- 구조는 DeepSeek-V4-Pro (Preview) 모델 구조를 그대로 쓰면서 DSpark 추측 디코딩(speculative decoding) 모듈을 붙인 형태다.
- DSpark는 대상 모델과 초안 모델의 가중치가 같은 체크포인트에서 나오므로, 별도의 초안 모델 경로를 지정하지 않는다고 회사는 설명했다.
회사는 아래 벤치마크에서 DeepSeek-V4-Pro-0813이 프리뷰판을 앞서며, 공개된 최상위 상용 모델들과 폭넓게 견줄 만하다고 밝혔다.
입출력 방식이 바뀐 점
- 이번 판에는 Jinja 형식의 채팅 템플릿이 들어 있지 않다.
- 대신 OpenAI 호환 형식의 메시지를 모델 입력 문자열로 바꾸고 모델의 텍스트 출력을 해석하는 파이썬 스크립트와 테스트 사례가 담긴
encoding폴더가 함께 제공된다. - 즉 기존 채팅 템플릿에 의존해 쓰던 쪽은 이 인코딩 방식으로 옮겨야 한다.
- 또한
reasoning_effort값이low,high,max의 세 단계를 지원한다. - 이 값은 모델이 답하기 전에 얼마나 오래 숙고할지를 조절한다.
배포와 라이선스
- 모델은 vLLM과 SGLang에서 서빙할 수 있고, 두 곳 모두 옵션 하나로 DSpark 추측 디코딩을 켤 수 있다.
- 로컬 실행용 안내도 함께 제공된다.
- 저장소와 모델 가중치는 모두 MIT 라이선스를 따른다.
벤치마크
| 벤치마크 | 무엇을 재나 | DeepSeek-V4-Pro-0813 (—) | DeepSeek-V4-Pro (Preview) (—) | Kimi K3 (—) | Opus-4.8 (—) |
|---|---|---|---|---|---|
| HLE (wo / w tools) | 고난도 학술 지식 | 42.7 / 60.0 | 37.7 / 48.2 | 43.5 / 56.0 | 49.8 / 57.9 |
| Terminal Bench 2.1 | 터미널 작업 수행 | 87.9 | 72.1 | 88.3 | 85.0 |
| NL2Repo | — | 61.5 | 38.5 | - | 69.7 |
| Cybergym | — | 83.3 | 52.7 | 80.0 | 78.3 |
| DeepSWE | — | 62.7 | 12.8 | 67.5 | 58.0 |
| Toolathlon-Verified | 도구 사용 능력 | 74.1 | 55.9 | 76.5 | 76.2 |
| Agents' Last Exam | — | 25.7 | 16.5 | 27.6 | 25.7 |
| AutomationBench (Public) | — | 31.8 | 12.8 | 30.8 | 27.2 |
| DSBench-FullStack | 내부 풀스택 개발 시험 | 71.1 | 41.8 | 73.7 | 71.6 |
| DSBench-Hard | 내부 고난도 코딩 에이전트 시험 | 67.2 | 31.1 | 63.0 | 71.7 |
공개 벤치마크 중 코드 에이전트 과제는 DeepSeek Harness의 minimal 모드를 에이전트 프레임워크로 삼아 max 추론 강도, temperature 1.0, top_p 0.95 조건으로 측정했다고 회사는 밝혔다.