모델 출시
Agnes AI, 오픈 웨이트 멀티모달 모델 Agnes-3.0-Flash Preview 공개
- Agnes AI가 오픈 웨이트 멀티모달 프리뷰 모델 Agnes-3.0-Flash Preview를 공개했다.
- 33B 파라미터에 26만 2,144토큰 컨텍스트를 지원하고 텍스트·이미지·영상을 입력으로 받는다.
- 라이선스는 Apache 2.0이다.
| 모델 | Agnes-3.0-Flash Preview |
|---|---|
| 저장소 | Agnes-AI/Agnes-3.0-Flash |
| 개방성 | 오픈형 |
| 컨텍스트 | 262,144 |
| 파라미터 | 33B |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- Agnes AI가 오픈 웨이트 멀티모달 프리뷰 모델 Agnes-3.0-Flash Preview를 내놓았다.
- 회사는 플래그십 수준의 하드웨어 없이 플래그십급 추론을 쓰려는 사람들을 위해 만든 모델이라고 밝혔다.
- 주요 기능으로는 26만 2,144토큰 컨텍스트 창, 조절 가능한 추론 강도, 도구 호출, 그리고 텍스트·이미지·영상 이해가 있다.
- 추론 강도는
high(기본),medium,low세 단계가 있고 사고를 끄는 설정도 따로 있다. - 도구 호출은 모델이
<tool_call>형식으로 호출을 내보내고 결과를tool역할 메시지로 되돌려주는 방식이다. - 스트리밍과 sglang을 통한 Chat Completions 방식의 OpenAI 호환 API도 지원한다고 회사는 밝혔다.
- 추론, 코딩과 디버깅, 긴 문맥 분석, 이미지·영상 이해를 지원 기능으로 적었다.
라이선스는 Apache License 2.0이다.
프리뷰 체크포인트와 API 모델의 구분
- 회사는 이 저장소에 담긴 것이 Agnes 3.0 Flash의 이전 오픈 웨이트 프리뷰 체크포인트이며, Artificial Analysis에 올라 있는 최신 프로덕션·API 체크포인트와는 다른 것이라고 밝혔다.
- 프리뷰는 33B 파라미터에 26만 2,144토큰 컨텍스트이고, 프로덕션·API 모델은 다른 체크포인트와 설정을 쓰며 컨텍스트가 100만 토큰이다.
- 회사는 프로덕션·API 모델의 벤치마크 결과를 여기 공개된 프리뷰 가중치의 것으로 보면 안 된다고 못 박았다.
이 저장소는 처음에 Preview 접미사 없이 Agnes-3.0-Flash로 공개되었고, 모델 카드가 이번에 이 공개판을 Agnes-3.0-Flash Preview로 명시해 구분하게 됐다.
규모와 구조
- 하이브리드 어텐션 디코더 구조다.
- 네 층 중 세 층은 게이트가 달린 델타 룰(시퀀스 길이와 무관한 층별 상태를 갖는 순환 방식)을 돌리고, 네 번째 층은 표준 전역 어텐션을 돌린다.
- 그래서 전체 72개 층 가운데 18개 층만 문맥에 따라 커지는 KV 캐시를 갖는다.
- 컨텍스트 길이: 26만 2,144토큰
- 디코더 층: 72개 = 델타 룰 순환 54개 + 전역 어텐션 18개, 3 대 1로 번갈아 배치
- 히든 크기: 5120
- 전역 어텐션: 쿼리 헤드 24개 / KV 헤드 4개(6 대 1 GQA), 헤드 차원 256, q와 k에 RMS 정규화, 시그모이드 게이트 출력
- 델타 룰 층: 키 헤드 16개 / 값 헤드 48개, 헤드 차원 128, 앞단에 인과 합성곱(커널 4), 게이트 RMS 정규화, 순환 상태는 fp32
- 피드포워드: SwiGLU, 중간 크기 17408, 모든 층에 병렬 SwiGLU 2048 분기 추가
- 위치 인코딩: 3축 로터리(텍스트/높이/너비), mrope 구간 11 대 11 대 10을 번갈아 배치, 베이스 1e7, 각 헤드 차원의 앞 25%(64차원)에 적용
- 어휘 크기: 24만 8,320
- 비전 타워: 27개 층, 히든 1152, 패치 16, 2×2 공간 병합 후 5120으로 투영
회사는 bf16 체크포인트의 디스크 용량이 약 66GB라고 밝혔다.
벤치마크
회사는 아래 수치가 이 저장소에 공개된 프리뷰 체크포인트의 것이며, Artificial Analysis에 실린 프로덕션·API 모델의 결과가 아니라고 밝혔다.
| 벤치마크 | 무엇을 재나 | Agnes-3.0-Flash Preview (33B) | Qwen3.6-35B-A3B (35B / 3B active) | Kimi K2.5 (1T / 32B active) |
|---|---|---|---|---|
| IFBench | 지시 따르기 | 74.20 | 64.4 | 43.7 |
| SciCode | 과학 코드 작성 | 38.08 | 35.8 | 39.6 |
| GPQA Diamond | 대학원 수준 과학 지식 | 85.05 | 84.1 | 78.9 |
| AA-LCR | 긴 문맥 추론 | 68.33 | 66.7 | 59.0 |
| AA-Omniscience Accuracy | 폭넓은 지식 정확도 | 23.00 | 18.8 | 22.9 |
- 모든 항목은 값이 높을수록 좋다.
- 회사는 이 수치들이 서로 다른 출처·평가 도구·모델 스냅샷에서 모아온 것이어서 통제된 일대일 비교가 아니라 참고값으로 봐야 한다고 밝혔다.