llmfeed

Agnes AI, 오픈 웨이트 멀티모달 모델 Agnes-3.0-Flash Preview 공개

Agnes
  • Agnes AI가 오픈 웨이트 멀티모달 프리뷰 모델 Agnes-3.0-Flash Preview를 공개했다.
  • 33B 파라미터에 26만 2,144토큰 컨텍스트를 지원하고 텍스트·이미지·영상을 입력으로 받는다.
  • 라이선스는 Apache 2.0이다.
모델Agnes-3.0-Flash Preview
저장소Agnes-AI/Agnes-3.0-Flash
개방성오픈형
컨텍스트 262,144
파라미터 33B
라이선스 Apache-2.0

무엇이 나왔나

  • Agnes AI가 오픈 웨이트 멀티모달 프리뷰 모델 Agnes-3.0-Flash Preview를 내놓았다.
  • 회사는 플래그십 수준의 하드웨어 없이 플래그십급 추론을 쓰려는 사람들을 위해 만든 모델이라고 밝혔다.
  • 주요 기능으로는 26만 2,144토큰 컨텍스트 창, 조절 가능한 추론 강도, 도구 호출, 그리고 텍스트·이미지·영상 이해가 있다.
  • 추론 강도는 high(기본), medium, low 세 단계가 있고 사고를 끄는 설정도 따로 있다.
  • 도구 호출은 모델이 <tool_call> 형식으로 호출을 내보내고 결과를 tool 역할 메시지로 되돌려주는 방식이다.
  • 스트리밍과 sglang을 통한 Chat Completions 방식의 OpenAI 호환 API도 지원한다고 회사는 밝혔다.
  • 추론, 코딩과 디버깅, 긴 문맥 분석, 이미지·영상 이해를 지원 기능으로 적었다.

라이선스는 Apache License 2.0이다.

프리뷰 체크포인트와 API 모델의 구분

  • 회사는 이 저장소에 담긴 것이 Agnes 3.0 Flash의 이전 오픈 웨이트 프리뷰 체크포인트이며, Artificial Analysis에 올라 있는 최신 프로덕션·API 체크포인트와는 다른 것이라고 밝혔다.
  • 프리뷰는 33B 파라미터에 26만 2,144토큰 컨텍스트이고, 프로덕션·API 모델은 다른 체크포인트와 설정을 쓰며 컨텍스트가 100만 토큰이다.
  • 회사는 프로덕션·API 모델의 벤치마크 결과를 여기 공개된 프리뷰 가중치의 것으로 보면 안 된다고 못 박았다.

이 저장소는 처음에 Preview 접미사 없이 Agnes-3.0-Flash로 공개되었고, 모델 카드가 이번에 이 공개판을 Agnes-3.0-Flash Preview로 명시해 구분하게 됐다.

규모와 구조

  • 하이브리드 어텐션 디코더 구조다.
  • 네 층 중 세 층은 게이트가 달린 델타 룰(시퀀스 길이와 무관한 층별 상태를 갖는 순환 방식)을 돌리고, 네 번째 층은 표준 전역 어텐션을 돌린다.
  • 그래서 전체 72개 층 가운데 18개 층만 문맥에 따라 커지는 KV 캐시를 갖는다.
  • 컨텍스트 길이: 26만 2,144토큰
  • 디코더 층: 72개 = 델타 룰 순환 54개 + 전역 어텐션 18개, 3 대 1로 번갈아 배치
  • 히든 크기: 5120
  • 전역 어텐션: 쿼리 헤드 24개 / KV 헤드 4개(6 대 1 GQA), 헤드 차원 256, q와 k에 RMS 정규화, 시그모이드 게이트 출력
  • 델타 룰 층: 키 헤드 16개 / 값 헤드 48개, 헤드 차원 128, 앞단에 인과 합성곱(커널 4), 게이트 RMS 정규화, 순환 상태는 fp32
  • 피드포워드: SwiGLU, 중간 크기 17408, 모든 층에 병렬 SwiGLU 2048 분기 추가
  • 위치 인코딩: 3축 로터리(텍스트/높이/너비), mrope 구간 11 대 11 대 10을 번갈아 배치, 베이스 1e7, 각 헤드 차원의 앞 25%(64차원)에 적용
  • 어휘 크기: 24만 8,320
  • 비전 타워: 27개 층, 히든 1152, 패치 16, 2×2 공간 병합 후 5120으로 투영

회사는 bf16 체크포인트의 디스크 용량이 약 66GB라고 밝혔다.

벤치마크

회사는 아래 수치가 이 저장소에 공개된 프리뷰 체크포인트의 것이며, Artificial Analysis에 실린 프로덕션·API 모델의 결과가 아니라고 밝혔다.

벤치마크 무엇을 재나 Agnes-3.0-Flash Preview (33B) Qwen3.6-35B-A3B (35B / 3B active) Kimi K2.5 (1T / 32B active)
IFBench 지시 따르기 74.20 64.4 43.7
SciCode 과학 코드 작성 38.08 35.8 39.6
GPQA Diamond 대학원 수준 과학 지식 85.05 84.1 78.9
AA-LCR 긴 문맥 추론 68.33 66.7 59.0
AA-Omniscience Accuracy 폭넓은 지식 정확도 23.00 18.8 22.9
  • 모든 항목은 값이 높을수록 좋다.
  • 회사는 이 수치들이 서로 다른 출처·평가 도구·모델 스냅샷에서 모아온 것이어서 통제된 일대일 비교가 아니라 참고값으로 봐야 한다고 밝혔다.

원문