모델 출시
텐센트, MoE 방식 대형 모델 Hy4 preview와 FP8 양자화판 가중치 공개
- 텐센트 Hy 팀이 총 770B 파라미터에 토큰당 49B를 쓰는 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했다.
- 컨텍스트는 1M이며, FP8 양자화판도 함께 나왔다.
| 모델 | Hy4 preview |
|---|---|
| 저장소 | tencent/Hy4-preview |
| 모델 | Hy4 preview-FP8 |
| 저장소 | tencent/Hy4-preview-FP8 |
| 개방성 | 오픈형 |
| 컨텍스트 | 1M |
| 파라미터 | 770B |
| 라이선스 | Apache License 2.0 |
무엇이 나왔나
- 텐센트 Hy 팀이 새 세대 Mixture-of-Experts(MoE) 모델 Hy4 preview를 공개했다.
- 지시 학습 모델인 Hy4 preview와 FP8로 양자화한 Hy4 preview-FP8 두 가지 가중치가 함께 풀렸고, Hugging Face·ModelScope·GitCode·CNB에서 받을 수 있다.
- 라이선스는 Apache License 2.0이다.
- 회사는 모델 크기, 컨텍스트 길이, 학습 데이터 세 방향으로 규모를 키웠다고 밝혔다.
- 또한 이번 판은 Hy4의 초기 버전이며, 복잡한 과제에서 필요 이상으로 오래 추론하거나 자기 결과를 지나치게 검증하는 문제가 남아 있는 상태로 내놓는다고 스스로 적었다.
규모와 구조
- 총 파라미터 770B, 토큰당 활성 파라미터 49B
- 백본 78개 층 가운데 첫 층은 일반 dense FFN이고 나머지 77개 층은 MoE로 대체됐다
- 각 MoE 층에는 라우팅 전문가 256개와 공유 전문가 1개가 있고, 토큰마다 상위 8개 라우팅 전문가와 공유 전문가가 활성화된다
- 백본과 별도로 추측 디코딩(speculative decoding)용 네이티브 MTP 층 1개가 들어 있다(총 10B 파라미터, 활성 0.7B)
- 어텐션은 Gated DeepSeek Sparse Attention(Gated DSA)을 쓰고, 층 사이에서 희소 인덱스를 재사용하는 IndexCache를 함께 쓴다. 잔차 경로에는 iHC(identity Hyper-Connections)를 적용했다. 회사는 이 설계가 DeepSeek과 GLM에서 영향을 받았다고 밝혔다
- 히든 크기 6144, 어텐션 헤드 64개, 쿼리 압축 차원 2048, 키·밸류 압축 차원 512, 인덱서 헤드 32개(헤드 차원 128), 인덱서 top-k 2048, 잔차 스트림 4개
- MoE 중간 차원 2048, FFN 중간 차원 18432, 어휘 크기 120832
- 컨텍스트 길이 1M (위 수치는 MTP 층을 뺀 백본 기준이다)
회사가 권한 용도
- 텐센트는 사내 소프트웨어 엔지니어, 게임 개발자, 금융 분석가, 보안 전문가와 함께 이들이 실제로 하는 업무를 바탕으로 학습 데이터를 만들었다고 밝혔다.
- 회사가 든 쓰임새는 네 가지다.
- 장기 개발 과제의 이해·계획·디버깅·검증과 프런트엔드 작업, 여러 파일에 흩어진 맥락을 문서·스프레드시트·발표자료로 정리하는 사무 및 데이터 분석 작업, 프롬프트 하나로 플레이 가능한 시제품을 만들고 게임 엔진과 연동하는 게임 개발, 그리고 AI 연구·분자동역학·응집물질물리·순수수학 같은 연구 과제다.
- 또 사내 제품인 CodeBuddy, WorkBuddy와 함께 설계를 맞춰 나가고 있다고 밝혔다.
회사가 밝힌 수치
- 회사는 사내 전문가 163명이 엔지니어링 과제 203개에 대한 모델 출력을 블라인드로 비교 평가했다고 밝혔다.
- 그 결과 Hy4 preview는 GLM 5.3을 상대로 평균 2.99 대 2.92(승 46.8%, 무 12.8%, 패 40.4%), Kimi K3을 상대로 평균 2.99 대 2.94(승 51.2%, 무 7.9%, 패 40.9%)를 기록했다고 한다.
- 모델 카드에 실린 그 밖의 벤치마크 결과는 이미지로만 제시돼 수치를 옮길 수 없다.