new
new
-
GPT-6 Astra에 Ultrafast mode 추가
- OpenAI가 Responses API에서 GPT-6 Astra용 Ultrafast mode를 추가했다.
- service_tier를 "ultrafast"로 지정하면 출력 토큰이 생성되는 간격이 줄어든다.
- EU 등 지역 추론 데이터 레지던시는 지원하지 않는다.
폐쇄형
GPT-6 Astra
-
GPT-6.1 Sol 출시
- OpenAI가 복잡한 코딩과 전문 업무용 모델 GPT-6.1 Sol을 출시했다.
- 회사는 GPT-6 Astra보다 비용이 낮다고 밝혔다.
- 기본 가격은 100만 토큰당 입력 2달러, 출력 10달러이며 Multi-agent를 베타로 지원한다.
폐쇄형
GPT-6.1 Sol
-
Agents API에 computer use 기능 추가
- OpenAI가 Agents API에 computer use 기능을 추가했다.
- 에이전트가 OpenAI가 호스팅하는 브라우저에서 작업을 수행할 수 있다.
- 웹사이트 접근 승인과 로그인은 이용자의 애플리케이션이 처리한다.
new
-
요청에 최종 사용자 식별값 safety_identifier 필드 추가
- Chat Completions, Responses API, Batch API 등에서 최종 사용자 식별값 safety_identifier 를 보낼 수 있게 됐다.
- 정책 위반을 API 키가 아닌 개별 최종 사용자에게 돌릴 수 있다고 회사가 밝혔다.
-
Replit Agents 와 SpaceXAI 연동
- Replit 의 에이전트 기능인 Replit Agents 가 SpaceXAI 와 연동할 수 있게 됐다.
- 회사는 이 연동으로 Replit 에서 만드는 에이전트에 Grok 을 붙여 쓸 수 있다고 밝혔다.
-
SpaceXAI API 의 LangChain 지원
- SpaceXAI 의 API 를 LangChain 을 통해 쓸 수 있게 됐다.
- Python 과 JavaScript 두 쪽 모두 LangChain 문서에 연동 방법이 올라와 있어, LangChain 으로 앱을 만드는 개발자는 이 경로로 연결할 수 있다.
-
앤트로픽, Claude Sonnet 5.5 출시
- 앤트로픽이 Claude Sonnet 5.5 를 Claude API 와 주요 클라우드에 내놓았다.
- Claude Sonnet 5 용 코드는 다섯 가지 점에서 깨질 수 있어 요청을 고쳐야 한다.
- 새 모델의 사고 블록은 만든 계정에서만 쓰인다.
폐쇄형
Claude Sonnet 5.5
new
new
new
new
-
오픈AI, 추론 모델 GPT-6 Sol 공개
- 오픈AI가 추론 모델 GPT-6 Sol을 내놨다.
- 텍스트와 이미지를 입력받아 텍스트를 생성하며, Responses와 Chat Completions API로 쓸 수 있다.
- 100만 토큰당 입력 2달러, 출력 10달러다.
폐쇄형
GPT-6 Sol
-
오픈AI, 추론 모델 GPT-6 Luna 공개
- 오픈AI가 추론 모델 GPT-6 Luna를 내놨다.
- 텍스트와 이미지를 입력받아 텍스트를 생성하며, Responses와 Chat Completions API로 쓸 수 있다.
- 100만 토큰당 입력 0.10달러, 출력 0.50달러다.
폐쇄형
GPT-6 Luna
-
Gemini API에 Voices 엔드포인트와 목소리 제작·복제 기능 추가
- Gemini API에 목소리를 조회하는 /v1beta/voices 엔드포인트가 추가됐다.
- 함께 Voice design, Voice replication, Extended Voice Library가 공개돼 150개가 넘는 목소리를 쓸 수 있다.
-
대화 중간 시스템 메시지 안에서 도구를 정의하는 베타 기능 공개
- 대화 중간 시스템 메시지 안에서 도구를 정의할 수 있게 됐다.
- Claude API 베타이며 inline-tools-2026-09-15 헤더를 쓴다.
- tools를 고치거나 프롬프트 캐시를 무효화하지 않고 도구를 추가·변경할 수 있다.
-
앤스로픽, Claude Opus 5.5 공개 — 기본 컨텍스트 100만 토큰에 사고 기능 상시 작동
- 앤스로픽이 Claude Opus 5.5(claude-opus-5-5)를 공개했다.
- 기본 컨텍스트 100만 토큰, 최대 출력 12만 8,000토큰이고 백만 토큰당 입력 4달러·출력 20달러다.
- 사고 기능은 끌 수 없다.
폐쇄형
Claude Opus 5.5
new
-
샤오미, 옴니모달 MoE 모델 MiMo-V2.6-Pro-RL 공개
- 샤오미가 MiMo-V2.6 계열의 대표 모델 MiMo-V2.6-Pro-RL을 MIT 라이선스로 공개했다.
- 전체 1.02T·활성 42B의 희소 MoE 구조로 텍스트·이미지·영상·음성을 함께 받고, 컨텍스트 길이는 100만 토큰이다.
오픈형
MiMo-V2.6-Pro-RL
-
샤오미, MiMo-V2.6-Flash-RL 공개 — 텍스트·이미지·영상·음성을 함께 받는 309B MoE 모델
- 샤오미 MiMo 팀이 MiMo-V2.6 계열의 효율 균형 체크포인트 MiMo-V2.6-Flash-RL을 MIT 라이선스로 공개했다.
- 총 309B 중 15B만 활성화하는 Sparse MoE 구조이고, 컨텍스트는 1M 토큰이다.
오픈형
MiMo-V2.6-Flash-RL
-
Grok 4.7 Fast는 Cursor와 Grok Build에서만 제공
- 같은 모델을 토큰 단가 2배로 쓰는 Grok 4.7 Fast가 있다.
- 다만 공개된 xAI API에서는 쓸 수 없고, Cursor와 Grok Build를 통해서만 이용할 수 있다고 회사가 밝혔다.
폐쇄형
Grok 4.7 Fast
-
xAI, Grok 4.7을 API에 공개 — 컨텍스트 500k에 출력 길이 제한 없음
- xAI가 Grok 4.7을 API에서 grok-4.7로 제공한다.
- 컨텍스트 창은 500k이고 텍스트와 이미지를 입력받아 텍스트만 내놓으며, 출력 토큰 제한은 없다.
- 추론 강도는 네 단계를 고를 수 있다.
폐쇄형
Grok 4.7
new
-
구글, Gemini 2.5 모델 접근을 기존 사용자로 제한
- 구글이 Gemini 2.5 모델의 접근 권한을 과거에 실제로 사용한 사용자로 제한한다고 밝혔다.
- 해당 모델은 지원 중단이 아니며 API를 통해 계속 제공되고, 새 프로젝트에는 3.5 Flash-Lite 또는 3.8 Flash를 쓰라고 안내했다.
폐쇄형
Gemini 2.5
-
Compliance API 로컬 세션 엔드포인트, Claude in Chrome 세션 기록도 반환
- Compliance API의 로컬 세션 엔드포인트가 Claude in Chrome 세션의 기록까지 함께 반환한다.
- Claude Enterprise 조직을 대상으로 한 베타이며, 기존 Compliance Access Key와 read:compliance_user_data 스코프로 쓸 수 있다.
new
new
new
new
new
new
-
OpenAI, Agents API를 퍼블릭 베타로 공개
- OpenAI가 Agents API를 퍼블릭 베타로 내놨다.
- 관리형 Codex harness로 에이전트를 만들고, 세션 관리와 컨텍스트 압축·복구는 OpenAI가 맡는다.
- 자체 도구와 MCP 서버도 연결할 수 있다.
-
딥시크, 이미지·텍스트를 함께 받는 MoE 모델 DeepSeek-V4.1-Flash 공개
- 딥시크가 이미지와 텍스트를 함께 받는 MoE 모델 DeepSeek-V4.1-Flash를 MIT 라이선스로 공개했다.
- 백본 552B 가운데 토큰당 8B(프리필)·16B(디코드)만 활성화하고, 최대 100만 토큰 컨텍스트를 지원한다.
오픈형
DeepSeek-V4.1-Flash
-
Claude Managed Agents 권한 정책에 서버가 직접 판단하는 `auto` 추가
- Claude Managed Agents의 권한 정책에
auto가 추가됐다. - 서버가 도구 호출마다 판단해 실행하거나 거부하거나 승인을 기다린다.
- 판단 결과는 이벤트의
evaluation필드로 전달된다.
- Claude Managed Agents의 권한 정책에
-
`ant` CLI에 세션 접속 명령 `ant beta:sessions connect` 추가
antCLI에ant beta:sessions connect명령이 추가됐다.- 터미널을 Claude Managed Agents 세션에 붙여 실시간으로 따라가고, 메시지를 보내고, 승인 대기 중인 도구 호출을 허용하거나 거부할 수 있다.
new
new
-
Nex-AGI, 에이전트 모델 계열 Nex-N2.5 공개 — mini와 Pro는 멀티모달 기반
- Nex-AGI가 에이전트 모델 계열 Nex-N2.5를 내놓았다.
- 이 가운데 mini와 Pro는 Nex-N2의 멀티모달 기반을 이어받아 컴퓨터 조작과 웹 브라우징, 시각 기반 에이전트 능력을 개선했다.
- 가중치는 오픈소스로 공개될 예정이다.
오픈형
Nex-N2.5-Pro 및 1개
-
Nex-N2.5-Max 공개 — 1.6조 파라미터 텍스트 전용 MoE 기반
- Nex-N2.5 계열의 최상위 모델 Nex-N2.5-Max가 나왔다.
- 1.6조 파라미터 규모의 텍스트 전용 MoE 기반 모델로, 회사는 조 단위 규모에서 처음으로 사후학습을 마쳤다고 밝혔다.
- 가중치는 오픈소스로 공개된다.
오픈형
Nex-N2.5-Max
new
new
new
-
Responses API에 장시간 작업용 제어 세 가지 추가
- 오픈AI가 Responses API에 장시간 작업용 제어를 추가했다.
- 비동기 도구 호출, 응답 진행 중 추가 지시 보내기, 대화 도중 추론 강도 변경 세 가지다.
-
오픈AI, GPT-6 Astra 공개
- 오픈AI가 GPT-6 Astra를 공개했다.
- 추론·코딩·컴퓨터 사용·리서치·문서 작성에 쓰는 모델이다.
- none 추론 강도와 temperature·top_p·logprobs는 지원하지 않고, 도구 호출은 Responses API가 필요하다.
폐쇄형
GPT-6 Astra
-
ant CLI 1.30.0, 저장소 파일로 리소스를 관리하는 ant apply 명령 추가
- ant CLI 1.30.0에 ant apply 명령이 추가됐다.
- 저장소의 파일 설명을 바탕으로 에이전트, 환경, 스킬, 메모리 저장소, 배포를 만들고 갱신한다.
- 함께 생성되는 claude-lock.json 잠금 파일을 커밋해야 한다.
new
-
OpenAI, 급격한 트래픽 증가와 모델 과부하를 구분하는 API 오류 코드 도입
- OpenAI가 API 오류를 갱신해 트래픽이 너무 빨리 늘어난 경우와 일시적 모델 과부하를 구분할 수 있게 했다.
- 각각 429 slow_down, 503 server_is_overloaded로 응답하며 Retry-After 헤더가 함께 올 수 있다.
-
구글, Gemini 3.8 Flash 정식 출시
- 구글이 Flash 계열 신모델
gemini-3.8-flash를 정식(GA)으로 공개했다. - 긴 흐름의 소프트웨어 개발, 자율 에이전트, 복잡한 기업 업무 흐름을 겨냥해 만들었다고 회사가 밝혔다.
폐쇄형
Gemini 3.8 Flash
- 구글이 Flash 계열 신모델
new
-
OpenAI, api.openai.com 연결에 IPv6 지원
- OpenAI가 변경 기록을 통해 api.openai.com 으로의 연결에 이제 IPv6 를 쓸 수 있다고 밝혔다.
- 기존 연결 방식 외에 IPv6 주소로도 API 엔드포인트에 접속할 수 있게 된 것이다.
-
제미나이 API에 에이전트형 영상 이해 기능 추가, Gemini 3.7 Flash 등 3개 모델 지원
- 구글이 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 에이전트형 영상 이해 기능을 공개했다.
- 모델이 영상 타임라인을 스스로 오가며 자막·프레임·음성을 필요할 때만 요청한다.
- 긴 영상에서 토큰을 최대 88% 덜 쓴다고 회사는 밝혔다.
폐쇄형
Gemini 3.7 Flash
-
턴 단위 시스템 메시지 베타 공개
- 대화 중간 system 메시지에 clear_at을 next_user_message로 두면 그 턴에만 반영되고, 이후에는 토큰 비용 없이 기록에만 남는다.
- 프롬프트 캐시도 무효화하지 않는다.
-
새 두 모델에서 tool_choice의 any·tool 유형 사용 불가
- Claude Fable 5.1과 Claude Mythos 5.1에서는 tool_choice의 any와 tool 유형을 쓸 수 없고 400 오류가 돌아온다.
- auto와 none은 그대로다.
폐쇄형
Claude Fable 5.1 및 1개
-
thinking.display에 세 번째 값 updates 추가
- thinking.display에 updates 값이 베타로 더해졌다.
- 추론 내용은 비어서 오고, 모델이 도구 호출 사이에 쓰는 짧은 진행 상황이 텍스트로 돌아온다.
- Claude Fable 5.1·Mythos 5.1·Fable 5가 대상이다.
폐쇄형
Claude Fable 5 및 2개
-
새 두 모델의 텍스트에 워터마크, 생성 파일에 C2PA 자격 증명 부여
- Claude Fable 5.1과 Claude Mythos 5.1이 만든 텍스트에는 앤트로픽의 텍스트 워터마크가 들어간다.
- 코드 실행 도구로 만든 이미지·영상 파일에는 C2PA Content Credentials가 붙는다.
폐쇄형
Claude Fable 5.1 및 1개
-
Claude Fable 5.1·Mythos 5.1의 프롬프트 캐시 읽기 값 100만 토큰당 0.25달러
- Claude Fable 5.1과 Claude Mythos 5.1의 프롬프트 캐시 읽기 값이 100만 토큰당 0.25달러로 매겨졌다.
- 기본 입력 가격의 0.025배로, 다른 모델의 0.1배보다 낮다.
- 캐시 쓰기 값은 그대로다.
폐쇄형
Claude Fable 5.1 및 1개
-
대화 도중 effort를 바꾸는 기능 베타 공개
- Claude API의 Claude Fable 5.1, Claude Mythos 5.1, Claude Opus 5에서 메시지 단위로 effort를 바꾸는 기능이 베타로 열렸다.
- 프롬프트 캐시를 지키면서 이후 턴의 effort를 조정할 수 있다.
폐쇄형
Claude Fable 5.1 및 2개
-
앤트로픽, Claude Fable 5.1과 Claude Mythos 5.1 공개
- 앤트로픽이 Claude Fable 5.1과 Claude Mythos 5.1을 내놓았다.
- 두 모델 모두 1M 토큰 컨텍스트와 최대 출력 128k 토큰을 지원하며, 값은 100만 토큰당 입력 10달러·출력 50달러다.
폐쇄형
Claude Fable 5.1 및 1개
new
new
-
텐센트, MoE 방식 대형 모델 Hy4 preview와 FP8 양자화판 가중치 공개
- 텐센트 Hy 팀이 총 770B 파라미터에 토큰당 49B를 쓰는 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했다.
- 컨텍스트는 1M이며, FP8 양자화판도 함께 나왔다.
오픈형
Hy4 preview 및 1개
-
각 SDK 새 버전, client.beta.files·client.beta.skills 의 베타 헤더 전송 중단
- 각 SDK 새 버전에서 client.beta.files 와 client.beta.skills 가 베타 헤더를 보내지 않고 정식과 같은 형태를 돌려준다.
- 베타 헤더를 계속 보내는 요청은 기존 형태를 그대로 받는다.
-
Claude Console 개인 키·서비스 계정 키 생성 지원
- Claude Console 에서 개인 키와 서비스 계정 키를 만들 수 있게 됐다.
- 두 키는 연결된 계정과 같은 권한으로 동작하고, 계정이 조직에서 빠지면 작동을 멈춘다.
- 기존 워크스페이스 API 키도 계속 쓸 수 있다.
new
-
Assistants API, 2026년 8월 26일 종료
- OpenAI의 Assistants API가 2026년 8월 26일에 종료됐다.
- 이 API를 쓰던 곳은 Responses API와 Conversations API로 옮겨야 한다.
-
Compliance API 세션 엔드포인트, Cowork·Claude Code 대상 정식 제공
- Compliance API의 세션 엔드포인트가 Cowork와 Claude Code 세션에 대해 베타를 벗어났다.
- 이제 두 제품의 세션 기록 조회를 정식 기능으로 쓸 수 있다.
-
Compliance API 로컬 세션 엔드포인트, Claude Science와 Microsoft 365 세션 기록도 반환
- Compliance API의 로컬 세션 엔드포인트가 Claude Science와 Claude for Microsoft 365 세션 기록도 반환한다.
- Claude Enterprise 조직 대상 베타이며 기존 접근 키와 스코프를 그대로 쓴다.
-
Admin API, ant CLI와 7개 언어 SDK에서 사용 가능
- Admin API를 ant CLI와 Python·TypeScript·C#·Go·Java·PHP·Ruby SDK에서 client.beta.organization으로 쓸 수 있게 됐다.
- 사용량·비용 리포트 등 일부는 여전히 curl만 지원한다.
new
-
Z.ai, GLM-5 계열 첫 멀티모달 모델 GLM-5.3-Flash 공개
- Z.ai가 GLM-5 계열 첫 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했다.
- 전체 파라미터 320B에 활성 파라미터는 18B이며, 희소 어텐션과 선형 어텐션을 섞은 구조를 처음 적용했다.
- MIT 라이선스로 공개됐다.
오픈형
GLM-5.3-Flash
-
Z.ai, 사후 학습만 새로 한 GLM-5.3 공개
- Z.ai가 GLM-5.3을 공개했다.
- 베이스 모델은 GLM-5.2와 같고 사후 학습만으로 복잡한 코딩과 장기 과제 성능을 끌어올렸다고 밝혔다.
- 사내 코드 벤치마크에서는 GLM-5.2 대비 50% 향상됐다고 한다.
오픈형
GLM-5.3 및 1개
new
-
XHToken, 소형 범용 모델 Spark-X2.5-4B 공개
- XHToken이 범용 소형 모델 Spark-X2.5-4B를 아파치 2.0 라이선스로 공개했다.
- 전체 어텐션 1개 층과 슬라이딩 윈도 어텐션 3개 층을 섞은 구조로 1M 토큰 컨텍스트를 기본 지원하고, 200개가 넘는 언어를 다룬다.
오픈형
Spark-X2.5-4B
-
XHToken, 더 작은 범용 모델 Spark-X2.5-1.7B도 함께 공개
- XHToken이 Spark-X2.5 계열의 작은 판인 Spark-X2.5-1.7B를 아파치 2.0으로 공개했다.
- 하이브리드 어텐션 구조와 1M 토큰 컨텍스트, 200개 넘는 언어 지원을 같은 계열에서 그대로 이어받았다.
폐쇄형
Spark-X2.5-1.7B
-
Qwen 팀, 새 구조를 적용한 Qwen3.8-Flash-Next 공개 가중치로 출시
- Qwen 팀이 Qwen3.8-Flash-Next를 공개 가중치로 내놨다.
- 총 125B 가운데 6B만 활성되는 구조에 Gated DeltaNet과 QSA를 섞었고, 컨텍스트는 262,144토큰을 기본으로 최대 100만 토큰까지 늘릴 수 있다.
오픈형
Qwen3.8-Flash-Next 및 1개
new
new
-
OpenAI, API 플랫폼에 Prompt Caching 대시보드 공개
- OpenAI가 API 플랫폼에 Prompt Caching 대시보드를 공개했다.
- 캐시 적중률과 쓰기당 읽기 횟수, 캐시 읽기·쓰기·미캐시 토큰 구성을 볼 수 있고 모델과 서비스 티어로 걸러 볼 수 있다.
-
Anthropic, Python SDK 1.0 공개 — HTTP 계층을 httpx2로 옮기고 구식 기능 제거
- Anthropic이 Python SDK 1.0을 공개했다.
- HTTP 계층이 httpx에서 httpx2로 바뀌고 Python 3.10 이상이 필요하다.
- 레거시 Text Completions API와 일부 파라미터 등 오래된 기능도 함께 제거됐다.
new
new
-
Ornith AI, 9B 규모 추론 모델 Ornith-1.5-9B 공개
- Ornith AI가 Ornith-1.5 계열 중 가장 작은 9B 밀집 모델 Ornith-1.5-9B를 MIT 라이선스로 공개했다.
- 단일 GPU 구동을 목표로 만들었고, 기본으로 생각 과정을 먼저 출력하는 추론 모델이다.
오픈형
Ornith-1.5-9B
-
Ornith, MoE 모델 Ornith-1.5-35B-A3B 공개
- Ornith 팀이 Ornith-1.5-35B-A3B를 MIT 라이선스로 공개했다.
- 전체 약 35B 중 토큰당 약 3B만 활성화하는 전문가 혼합 구조이며, 과제 생성과 해법 탐색까지 함께 최적화하는 자기개선 학습을 적용했다고 밝혔다.
오픈형
Ornith-1.5-35B-A3B
-
Claude Console의 Workbench, Playground로 이름 변경
- 앤트로픽이 Claude Console의 Workbench를 Playground로 바꿨다.
- Messages API의 모든 파라미터를 지원하고, 코드 실행이나 웹 검색 같은 기능을 보여주는 템플릿을 담았다.
new
-
오픈AI, GPT-5.6 Sol용 새 API 서비스 등급 Ultrafast mode 예고
- 오픈AI가 GPT-5.6 Sol에 쓰는 새 API 서비스 등급 Ultrafast mode를 알렸다.
- Standard 처리보다 최대 14배 빠르다고 회사는 밝혔으며, 우선 일부 고객에게만 제한 프리뷰로 제공된다.
폐쇄형
GPT-5.6 Sol
-
구글, 코딩과 에이전트를 위한 주력 모델 Gemini 3.7 Flash 정식 출시
- 구글이 코딩과 에이전트를 위한 지금까지 가장 지능적인 주력 모델이라고 밝힌 Gemini 3.7 Flash를 정식 출시(GA)했다.
폐쇄형
Gemini 3.7 Flash
-
딥시크, DeepSeek-V4-Pro 정식판 DeepSeek-V4-Pro-0813 공개
- 딥시크가 프리뷰를 대체하는 DeepSeek-V4-Pro-0813을 내놓았다.
- 프리뷰 구조에 DSpark 추측 디코딩 모듈을 붙였고, 가중치와 저장소는 MIT 라이선스로 공개됐다.
오픈형
DeepSeek-V4-Pro-0813
new
-
LFM2.5-VL-3B, LFM2-VL-3B 대비 화면 이해·그라운딩·도구 사용 크게 향상
- LFM2.5-VL-3B가 공개됐다.
- 온디바이스용 LFM2.5 계열의 멀티모달 변형으로, 화면 이해·그라운딩·다중 이미지·도구 사용에서 이전 모델보다 크게 향상됐다.
오픈형
LFM2.5-VL-3B
-
Anthropic, Compliance API로 Cowork·Claude Code 로컬 세션 트랜스크립트 조회 지원
- Anthropic이 Compliance API를 확장해 Claude Enterprise 조직 대상 베타로 Cowork·Claude Code 로컬 세션 트랜스크립트 조회 기능을 제공한다.
new
-
Ling-3.0-tiny, 7.9B 파라미터의 경량 하이브리드 추론 MoE 모델로 공개
- Ling-3.0-tiny는 총 7.9B 파라미터, 토큰당 활성화 1.3B 파라미터를 가진 경량 하이브리드 추론 MoE 모델로 공개됐다.
- NVIDIA DGX Spark, Apple Silicon 등에서 검증됐다.
오픈형
Ling-3.0-tiny
-
Claude Sonnet 5, 도입 가격 $2/$10 per MTok가 표준 가격으로 확정
- Claude Sonnet 5의 도입 가격인 $2 / $10 per MTok가 표준 가격으로 확정됐다.
- 2026년 9월 1일 $3 / $15 per MTok로 인상하려던 계획은 시행되지 않는다.
new
-
Muse Glimmer, 소비자용 하드웨어에서 자율 에이전트 작업 수행하는 30-billion 파라미터 모델로 공개
- Muse Glimmer는 Muse Spark에서 증류된 30-billion 파라미터 모델로 클라우드 없이 로컬 실행이 가능하다.
- 4-bit 양자화로 20 GB 미만 크기이며 DFlash 기반 드래프터로 빠른 텍스트 생성을 지원한다.
오픈형
Muse-Glimmer-30B
-
dots studio, 오픈 웨이트 멀티모달 MoE 모델 dots3-note preview 공개
- dots studio가 dots3 계열의 첫 오픈 웨이트 모델 dots3-note preview를 공개했다.
- 전체 280B·활성 16B 파라미터의 MoE 구조로 최대 512K 토큰 컨텍스트를 지원하며, 텍스트·이미지·영상·음성을 입력받아 텍스트를 낸다.
- 라이선스는 Apache 2.0이다.
오픈형
dots3-note-prev 및 1개
new
new
-
오픈AI, 데이브레이크에 블루·레드 두 가지 접근 등급 도입
- 오픈AI가 승인된 방어자를 위해 데이브레이크 블루와 데이브레이크 레드 두 가지 접근 등급을 도입했다.
- 블루는 GPT-5.6 Sol 등 범용 모델을, 레드는 GPT-5.6 Cyber 등 목적 훈련 모델을 별도 승인 하에 제공한다.
폐쇄형
GPT-5.6 Cyber 및 1개
-
Motif Technologies, 314B 규모 MoE 모델 Motif 3 공개
- Motif Technologies가 총 314B 파라미터 중 토큰당 13.2B만 쓰는 MoE 모델 Motif 3를 냈다.
- 256K 컨텍스트를 지원하고, 가중치는 MIT 라이선스로 신청 없이 누구나 받을 수 있다.
오픈형
Motif 3 및 1개
-
IBM 소형 추론 모델 Granite-4.2-3B 공개
- IBM이 Granite 4.2 계열의 소형 추론 모델 Granite-4.2-3B를 공개했다.
- 파라미터 3B 밀집 구조로 답하기 전에 생각하는 과정을 내장했고, 생각의 깊이를 세 가지 모드로 고를 수 있다.
- 라이선스는 Apache 2.0이다.
오픈형
Granite-4.2-3B
-
IBM, 추론 기능을 내장한 오픈소스 모델 Granite-4.2-30B 공개
- IBM이 Granite 4.2 계열의 300억 파라미터 추론 모델 Granite-4.2-30B를 아파치 2.0 라이선스로 공개했다.
- 생각 모드를 세 가지로 전환할 수 있고 도구 호출과 긴 문맥을 지원한다.
오픈형
Granite-4.2-30B
-
Claude Managed Agents, 세션 예산 설정 기능 추가
- Claude Managed Agents 세션에 공개 정가 기준 지출 예산을 설정할 수 있게 됐다.
- 예산 도달 시 세션이 일시 중지되며 예산 변경이나 제거 시 재개된다.
-
Claude Managed Agents, 세션에 어드바이저 모델 지정 기능 추가
- Claude Managed Agents 세션에 어드바이저를 부여할 수 있게 됐다.
- 멀티에이전트 로스터에서 advisor 타입 항목을 구성하고 상담할 모델을 지정하면 된다.
-
Claude Managed Agents, 모델 추론 실행 위치 제어 기능 추가
- Claude Managed Agents 에이전트에서 모델 추론이 실행되는 위치를 제어할 수 있는 기능이 추가됐다.
-
Claude Managed Agents, GitHub 저장소에서 스킬 불러오기 지원
- Claude Managed Agents 세션이 GitHub 저장소에서 스킬을 불러올 수 있게 됐다.
- 저장소 마운트 시 루트 .claude/skills 디렉터리 스킬이 세션 시작 때 자동 발견돼 에이전트가 사용할 수 있다.
new
new
-
Qwen 팀, 이미지·영상을 이해하는 27B 모델 Qwen3.8-27B 공개
- Qwen 팀이 27B 규모 비전·언어 모델 Qwen3.8-27B를 Apache 2.0 라이선스로 공개했다.
- 이미지와 영상을 이해하고, 기본으로 켜진 사고 모드를 요청마다 끄거나 reasoning_effort로 깊이를 조절할 수 있다.
오픈형
Qwen3.8-27B
-
Fast mode, GPT-5.6 Sol·Terra·Luna의 긴 컨텍스트 요청 지원 시작
- Fast mode가 GPT-5.6 Sol, Terra, Luna의 긴 컨텍스트 요청을 지원하기 시작했다.
- 272K 토큰을 초과하는 프롬프트도 실행할 수 있으며 Standard 티어보다 최대 2.5배 빠르다.
폐쇄형
GPT-5.6 Luna 및 2개
-
Claude Enterprise, Inference Hooks 베타 출시
- Claude Enterprise 조직 대상으로 Inference Hooks가 베타로 제공되며, 프롬프트가 추론 전 서버의 허용·거부 판정을 거치게 된다.
- 요청은 서명되고 거부 내역은 컴플라이언스 Activity Feed에 기록된다.
-
Claude Opus 4.1 모델 폐기, Claude Opus 5로 업그레이드 권장
- Claude Opus 4.1 모델이 폐기되어 해당 모델에 대한 모든 요청이 오류를 반환한다.
- 회사는 Claude Opus 5로의 업그레이드를 권장했으며, 연구자는 외부 연구자 접근 프로그램을 통해 접근을 요청할 수 있다.
폐쇄형
Claude Opus 4.1
new
-
OpenAI, Usage and Costs 대시보드에 API key 기준 필터링 기능 추가
- OpenAI가 Usage and Costs dashboards에서 API key 기준으로 데이터를 필터링하고 그룹화할 수 있는 기능을 추가했다.
- Usage API와 Costs API도 API key 차원의 프로그래밍 방식 보고 및 분석을 지원한다.
-
NVIDIA, 하이브리드 MoE 아키텍처 기반 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 공개
- NVIDIA가 활성 파라미터 3B, 총 파라미터 30B의 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 모델을 공개했다.
- 20T개 이상의 토큰으로 사전 훈련되었으며 최대 1M 컨텍스트 길이를 지원한다.
오픈형
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
-
오픈소스 삼진법 가중치 추론 모델 Maple-Preview 공개
- 20B-A1B 삼진법 가중치 추론 대규모 언어 모델 Maple-Preview가 공개됐다.
- IMO 수준 문제를 풀고 Mac mini M4에서 200+ tokens/sec로 동작하며 Gemma 4, Qwen3.5, gpt-oss보다 5–16× 빠르다.
오픈형
Maple-Preview
new
new
new
new
new
-
GPT-5.6 Luna·Terra, 7월 30일부터 가격 인하
- 7월 30일부터 GPT-5.6 Luna의 가격이 80% 저렴해지고, GPT-5.6 Terra의 가격은 20% 저렴해진다.
폐쇄형
GPT-5.6 Luna 및 1개
-
API에 Fast 모드 도입, 기존 Priority Processing 대체
- API에 Fast 모드가 도입되어 기존 Priority Processing을 대체한다.
- GPT-5.6 Sol에서는 표준 처리 대비 최대 2.5배 빠른 속도를 두 배 가격에 제공하며, priority 태그 요청은 자동으로 Fast 모드로 전환된다.
폐쇄형
GPT-5.6 Sol
new
-
OpenAI, API Platform 리소스 관리용 공식 Terraform provider 출시
- OpenAI가 API Platform 리소스를 코드형 인프라로 관리하는 공식 Terraform provider를 출시했다.
- 표준 워크플로우로 변경 사항을 검토·적용하고 구성 드리프트를 감지·조정할 수 있다.
-
LG AI Research, 다국어 언어 모델 K-EXAONE 2.0 공개
- LG AI Research가 프론티어급 다국어 언어 모델 K-EXAONE 2.0을 공개했다.
- 이전 모델보다 세 배 이상 규모로 확장되었으며 다국어 지원을 열 개 언어로 늘렸고 Apache license 2.0으로 공개된다.
오픈형
K-EXAONE-2.0-750B-A37B
-
Cactus Compute, 45M 파라미터 도구 호출 모델 Needle 2 공개
- Cactus Compute가 45M 파라미터 도구 호출 모델 Needle 2를 아파치 2.0 라이선스로 공개했다.
- 모델 전체가 14MB 단일 바이너리에 들어가고, 한 세션이 28MB 램에서 돌아간다고 회사는 밝혔다.
오픈형
Needle 2
new
-
SK텔레콤, 688B 규모 MoE 모델 A.X K2를 아파치 2.0으로 공개
- SK텔레콤이 A.X K1의 후속인 MoE 언어 모델 A.X K2를 아파치 2.0 라이선스로 공개했다.
- 총 688B 파라미터 중 토큰당 33B만 활성화되며, 생각 모드와 비생각 모드를 한 모델에서 고를 수 있고 컨텍스트는 256K다.
오픈형
A.X K2 및 1개
-
LFM2.5-2.6B, 128K 컨텍스트와 에이전틱 사후학습 갖춘 온디바이스 모델 공개
- LFM2.5-2.6B는 128K 컨텍스트와 에이전틱 사후학습을 갖춘 온디바이스 텍스트 전용 모델로, 약 34T 토큰으로 사전학습되고 네 단계 사후학습을 거쳤다.
오픈형
LFM2.5-2.6B
new
new
new
-
Claude, 대화 중간 도구 변경 기능 베타로 출시
- Claude 여러 모델에서 대화 중간 도구 변경 기능이 베타로 제공된다.
- 프롬프트 캐시를 유지하면서 턴 사이에 도구를 추가하거나 제거할 수 있다.
-
Anthropic, fallbacks 매개변수에 거부 범주별 권장 모델 적용하는 "default" 모드 추가
- Anthropic이 fallbacks 매개변수에 "default" 모드를 추가해 거부 범주별 권장 폴백 모델을 적용한다.
- 서버 사이드 폴백은 베타 기능으로, 이 모드 사용 시 별도 베타 헤더가 필요하다.
-
Claude Opus 5 출시, 1M token context window와 effort 전체 단계 지원
- Claude Opus 5가 출시됐다.
- 1M token context window와 128k max output tokens를 지원하며 thinking이 기본 활성화됐다.
- 가격은 Claude Opus 4.8과 동일한 $5 / $25 per MTok이다.
폐쇄형
Claude Opus 5
-
Claude Opus 4.7의 fast mode 제거, speed: "fast" 요청 시 오류 반환
- Claude Opus 4.7의 fast mode가 제거되어 speed: "fast" 요청은 오류를 반환하며 표준 속도로 대체되지 않는다.
- fast mode를 쓰려면 Claude Opus 5나 4.8로 마이그레이션해야 한다.
new
new
-
업스테이지 Solar Open 2 공개 — 250B-A15B 오픈 웨이트
- 업스테이지가 Solar Open 2 를 Hugging Face 에 올렸다.
- 전체 250B 가운데 토큰당 15B 만 쓰는 전문가 혼합 구조이고 컨텍스트는 1M 이다.
- 영어·한국어·일본어를 지원하며 자체 라이선스(Upstage Solar License)로 배포한다.
오픈형
Solar Open 2
-
OpenAI, API 플랫폼에 하드 지출 한도 기능 추가
- OpenAI가 API 플랫폼에서 조직과 프로젝트에 하드 지출 한도를 추가했다.
- 월간 한도 도달 시 429 오류가 반환되며, 지출 알림 기능도 제공된다.
-
Claude Managed Agents, Webhooks에 environment 및 memory store 생명주기 이벤트 추가
- Claude Managed Agents용 Webhooks가 environment 및 memory store 생명주기를 다루게 되면서 네 가지 environment. 이벤트와 세 가지 memory_store. 이벤트가 추가됐다.
- 이를 통해 폴링 없이 생명주기 변경에 반응할 수 있다.
-
Claude Managed Agents, 에이전트 업데이트 시 version 필드 선택 사항으로 변경
- Claude Managed Agents 에이전트 업데이트 시 version 필드가 선택 사항으로 바뀌었다.
- 제공하면 낙관적 동시성 제어가 적용되어 불일치 시 409 오류가 반환되고, 생략하면 무조건 업데이트가 적용된다.
-
Claude Managed Agents, 세션 생성 시 initial_events로 시드 지정 가능해져
- Claude Managed Agents 세션 생성 API에 initial_events 파라미터가 추가돼 최대 50개의 이벤트로 초기 시드를 지정할 수 있게 됐다.
- 이를 통해 별도의 send-events 요청 없이 같은 호출에서 에이전트 루프를 바로 시작할 수 있다.
-
Claude Managed Agents, 세션 스레드 이벤트 스트림에 event deltas 지원 추가
- Claude Managed Agents의 세션 스레드 이벤트 스트림이 event deltas를 지원하게 되면서 모델 생성 중 서브에이전트의 텍스트를 미리 볼 수 있게 됐다.
- 연결은 자신이 읽는 스레드만 미리 본다.
-
Claude Managed Agents, 모델 구성에서 effort 레벨 설정 가능해져
- Claude Managed Agents 에이전트의 모델 구성에서 effort 레벨을 설정할 수 있게 됐다.
new
-
Nanbeige4.2-3B, Looped Transformer 아키텍처 기반 소형 에이전트 모델 공개
- Nanbeige4.2-3B가 공개됐다.
- Looped Transformer 아키텍처로 매개변수 추가 없이 모델 용량을 늘렸고, 3B 비임베딩 매개변수로 에이전트·코드 작업을 수행한다.
- 최대 262,144 tokens 컨텍스트를 지원한다.
오픈형
Nanbeige4.2-3B
-
구글 Gemini API, temperature·top_p·top_k 폐기
- 구글이 샘플링 파라미터
temperature·top_p·top_k를 폐기했다고 알렸다. - 종료 날짜는 이 changelog 에 적혀 있지 않다.
- 구글이 샘플링 파라미터
-
구글 Gemini 3.6 Flash·3.5 Flash-Lite 정식 출시
- 구글이 Gemini 3.6 Flash(
gemini-3.6-flash)와 Gemini 3.5 Flash-Lite(gemini-3.5-flash-lite)를 정식(GA)으로 올렸다. - 구글은 3.6 Flash 가 3.5 Flash 보다 토큰 효율과 코딩·계획 능력이 나아졌고 가격도 더 낮다고 밝혔다.
- 다만 changelog 에 금액은 적혀 있지 않다.
폐쇄형
Gemini 3.5 Flash-Lite 및 1개
- 구글이 Gemini 3.6 Flash(
new
new
new
-
Inkling, 가중치 공개형 멀티모달 MoE 모델로 등장
- Inkling은 텍스트·이미지·오디오 입력을 받아 텍스트를 생성하는 범용 멀티모달 모델로, 가중치가 공개된 상태로 배포된다.
- 66-layer MoE 트랜스포머 구조를 갖춘 네이티브 멀티모달 모델이다.
오픈형
Inkling
-
Anthropic, Admin API에 Claude Enterprise 조직 구성원 관리 기능 베타로 추가
- Anthropic이 Admin API를 통해 Claude Enterprise 조직의 구성원 관리 기능을 베타로 공개했다.
- 구성원 조회, 역할 변경, 초대 관리, 그룹 관리 등이 가능해졌으며 일부 요청에는 베타 헤더가 필요하다.
new
-
Dreams 리서치 프리뷰, Claude Fable 5와 Claude Sonnet 5 지원 추가
- Dreams(research preview)가 Claude Fable 5와 Claude Sonnet 5 지원을 추가했다.
-
Anthropic, Access Transparency 문서에 cmek_preserve 이벤트 관련 내용 추가
- Access Transparency 문서에 cmek_preserve 이벤트의 필터·페이로드 예시와 policy_violation_investigation, csae_report 보존 사유 코드가 추가됐다.
- 보존 이벤트가 사람 검토자 또는 자동화된 안전 파이프라인 중 무엇에 의해 시작됐는지도 기록됨이 명확해졌다.
new
new
new
new
new
-
텐센트, MoE 모델 Hy3 공개... 신뢰성과 에이전트 일반화 강화
- 텐센트 Hy 팀이 295B 매개변수 규모의 MoE 모델 Hy3를 공개했다.
- 유사 크기 모델을 능가하고 2-5배 매개변수의 플래그십 모델과도 경쟁하며, Hugging Face 등에 오픈소스로 공개됐다.
오픈형
Hy3
-
Anthropic, 메모리 스토어 목록 조회에 `agent-memory-2026-07-22` 베타 헤더 도입
- Anthropic이 메모리 목록 조회 동작을 바꾸는
agent-memory-2026-07-22헤더를 추가했다. - 이 헤더는
managed-agents-2026-04-01을 대체하며, 여러 SDK가 자동으로 이를 적용하도록 업데이트됐다.
- Anthropic이 메모리 목록 조회 동작을 바꾸는
new
new
아직 올라온 소식이 없다.