모델 출시
Nex-AGI, 에이전트 모델 계열 Nex-N2.5 공개 — mini와 Pro는 멀티모달 기반
- Nex-AGI가 에이전트 모델 계열 Nex-N2.5를 내놓았다.
- 이 가운데 mini와 Pro는 Nex-N2의 멀티모달 기반을 이어받아 컴퓨터 조작과 웹 브라우징, 시각 기반 에이전트 능력을 개선했다.
- 가중치는 오픈소스로 공개될 예정이다.
| 모델 | Nex-N2.5-Pro |
|---|---|
| 저장소 | nex-agi/Nex-N2.5-Pro |
| 모델 | Nex-N2.5-mini |
| 저장소 | nex-agi/Nex-N2.5-mini |
| 개방성 | 오픈형 |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- Nex-AGI가 Nex-N2.5 계열을 공개했다.
- 계열은 mini, Pro, Max 세 크기로 나뉘며, 이 가운데 Nex-N2.5-mini와 Nex-N2.5-Pro는 이전 세대인 Nex-N2의 멀티모달 기반 위에 만들어졌다.
- 회사는 컴퓨터 사용, 웹 브라우징, 시각에 근거한 에이전트 능력을 중심으로 개선했다고 밝혔다.
- 회사는 이 모델들이 실제 환경에서 오래 이어지는 작업을 수행하도록 만들어졌다고 설명했다.
- 컴퓨터와 브라우저를 조작하고, 프로그램을 스스로 실행하고 시험할 수 있으며, 시각 피드백을 통해 결과를 확인하고 스스로 고쳐 나간다고 밝혔다.
- 회사는 시각이 더 이상 입력 방식에 그치지 않고 에이전트가 환경을 인식하고 작업을 진행시키는 통로가 되었다고 표현했다.
또한 에이전트 학습 환경과 작업 유형, 생산성 시나리오의 범위를 넓혔고, 그 결과 과학 연구와 지식 노동, 복잡한 생산성 작업에서 성능이 더 올랐다고 밝혔다.
생각 모드
reasoning_effort값으로 생각하는 방식을 고를 수 있다.none은 추론 흔적 없이 바로 답하고, 기본값인medium은 모델이 얼마나 생각할지 스스로 정하며,high는 답하기 전에 항상 생각을 켠다.
공개 형태
- Nex-N2.5 계열의 가중치는 오픈소스로 공개되며, 호스팅 서비스도 함께 제공된다.
- 다만 Nex-N2.5-Pro의 가중치는 아직 준비 중이라고 적혀 있다.
- Hugging Face와 ModelScope에 모델 저장소가 열려 있고, Nex-N2.5-Pro와 Nex-N2.5-mini는 OpenRouter를 통해 쓸 수 있다.
벤치마크
| 벤치마크 | 무엇을 재나 | Nex-N2.5-mini (—) | Nex-N2.5-Pro (—) | Claude Opus 5 (—) | GPT-5.6 Sol (—) |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 터미널 환경 작업 수행 | 73.4 | 82.7 | 89.1 | 88.8 |
| SWE-Bench Pro | 실제 소프트웨어 이슈 해결 | 43.8 | 61.2 | 79.2 | 64.6 |
| DeepSWE v1.1 | — | 36.1 | 55.8 | 73.7 | 72.7 |
| AutomationBench v1.0.6 | — | 32.3 | 44.2 | 50.3 | 45.8 |
| Toolathlon Verified | — | 54.6 | 68.5 | 76.5 | 74.9 |
| GDPval-AA v2 | — | 1446 | 1628 | 1831 | 1711 |
| Job Bench | — | 28.5 | 41.4 | 65.7 | 45.4 |
| BrowseComp | 웹 검색으로 정보 찾기 | 83.4 | 89.7 | 90.8 | 90.4 |
| OSWorld-Verified | 컴퓨터 조작 작업 수행 | 71.2 | 82.2 | 83.4 | 83.2 |
| OSWorld-2 | 컴퓨터 조작 작업 수행 | 30.5 | 56.4 | 68.3 | 62.7 |
| WebTest | — | 48.6 | 52.8 | — | 54.0 |
| WebArena-Verified | 웹 환경 작업 수행 | 63.4 | 67.6 | — | 69.7 |
| OSWorld-G | — | 82.9 | 87.4 | 76.8 | 77.7 |
| Vision2Web | — | 52.9 | 68.2 | — | 79.8 |
| SWE-MM | — | 25.5 | 38.2 | 59.4 | 40.2 |
| OmniDoc | — | 89.7 | 92.2 | — | 92.9 |
- 회사는 자체 평가에서 temperature 0.7, top_p 0.95, top_k 40을 썼고, 코딩 과제는 NexAU 하네스로, 컴퓨터·브라우저 사용 과제는 NexCUA 하네스로 평가했다고 밝혔다.
- 공개 자료가 있는 점수는 각 제공사의 발표 값을 가져왔다고 한다.