modellog

LLM 새 모델·변경 소식을 회사 공식 발표에서 모아 한국어로 정리한다

  1. 딥시크 모델 출시 오픈형

    DeepSeek-V4-Flash-0731 공식 출시, 에이전트 능력 강화

    DeepSeek-V4-Flash-0731이 미리보기를 대체하는 공식 출시 버전으로 공개됐다. 에이전트 능력이 강화됐고 벤치마크에서 DeepSeek-V4-Pro를 능가하며, reasoning_effort는 low/high/max 세 단계를 지원한다.

  2. 씽킹머신스 모델 출시 오픈형

    Inkling-Small, 공개 가중치로 배포되는 멀티모달 모델 공개

    Inkling-Small은 텍스트, 이미지, 오디오를 입력받아 텍스트를 출력하는 멀티모달 모델로 공개 가중치와 함께 배포된다. 42계층 트랜스포머에 희소 전문가 혼합(MoE) 구조를 적용했다.

  3. 마이크로소프트 모델 출시 오픈형

    마이크로소프트, 코덱 네이티브 능동 스트리밍 멀티모달 모델 Mage-VL 공개

    마이크로소프트가 4B 규모 멀티모달 모델 Mage-VL을 공개했다. 비디오 코덱 구조를 활용해 비주얼 토큰을 75% 이상 줄이고 추론 속도를 최대 3.5배 높였으며, 단일 체크포인트로 이미지·비디오 이해와 능동 스트리밍을 동시에 지원한다.

  4. AMD 모델 출시 오픈형

    AMD, 완전 개방형 혼합전문가 언어모델 Instella-MoE 공개

    AMD가 사전학습부터 RL까지 전 과정을 거쳐 학습한 완전 개방형 혼합전문가 언어모델 Instella-MoE를 공개했다. 16 billion 파라미터에 2.8 billion 활성 파라미터를 가지며, 학습 프레임워크와 데이터, 체크포인트를 모두 공개했다.

  5. 업스테이지 모델 출시 오픈형

    업스테이지 Solar Open 2 공개 — 250B-A15B 오픈 웨이트

    업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다. 전체 250B 가운데 토큰당 15B 만 쓰는 전문가 혼합 구조이고 컨텍스트는 1M 이다. 영어·한국어·일본어를 지원하며 자체 라이선스(Upstage Solar License)로 배포한다.

  6. Nanbeige 모델 출시 오픈형

    Nanbeige4.2-3B, Looped Transformer 아키텍처 기반 소형 에이전트 모델 공개

    Nanbeige4.2-3B가 공개됐다. Looped Transformer 아키텍처로 매개변수 추가 없이 모델 용량을 늘렸고, 3B 비임베딩 매개변수로 에이전트·코드 작업을 수행한다. 최대 262,144 tokens 컨텍스트를 지원한다.

  7. 씽킹머신스 모델 출시 오픈형

    Inkling, 가중치 공개형 멀티모달 MoE 모델로 등장

    Inkling은 텍스트·이미지·오디오 입력을 받아 텍스트를 생성하는 범용 멀티모달 모델로, 가중치가 공개된 상태로 배포된다. 66-layer MoE 트랜스포머 구조를 갖춘 네이티브 멀티모달 모델이다.

  8. 메이투안 모델 출시 오픈형

    LongCat-2.0 공개, 1.6 trillion 파라미터 MoE 모델에 AI ASIC 기반 학습 적용

    LongCat-2.0은 1.6 trillion 파라미터의 MoE 언어 모델로 공개됐다. AI ASIC superpods 기반으로 35 trillion 토큰 학습이 진행됐으며, LongCat Sparse Attention 등 아키텍처 개선이 적용됐다.

  9. 텐센트 모델 출시 오픈형

    텐센트, MoE 모델 Hy3 공개... 신뢰성과 에이전트 일반화 강화

    텐센트 Hy 팀이 295B 매개변수 규모의 MoE 모델 Hy3를 공개했다. 유사 크기 모델을 능가하고 2-5배 매개변수의 플래그십 모델과도 경쟁하며, Hugging Face 등에 오픈소스로 공개됐다.