API 변경
제미나이 API에 에이전트형 영상 이해 기능 추가, Gemini 3.7 Flash 등 3개 모델 지원
- 구글이 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 에이전트형 영상 이해 기능을 공개했다.
- 모델이 영상 타임라인을 스스로 오가며 자막·프레임·음성을 필요할 때만 요청한다.
- 긴 영상에서 토큰을 최대 88% 덜 쓴다고 회사는 밝혔다.
| 모델 | Gemini 3.7 Flash |
|---|---|
| 개방성 | 폐쇄형 |
무엇이 바뀌었나
- 구글이 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite에서 에이전트형 영상 이해(Agentic video understanding) 기능을 공개했다.
- 이 기능은 Interactions API와 GenerateContent API 양쪽에서 쓸 수 있다.
기존 방식이 영상을 한 번에 정해진 대로 처리하는 것과 달리, 이 방식에서는 모델이 영상 타임라인을 스스로 옮겨 다니며 필요한 시점에 자막(transcript), 프레임, 오디오 트랙을 그때그때 요청한다.
회사가 밝힌 수치
구글은 긴 영상을 다룰 때 정적인 처리 방식과 견주어 토큰을 최대 88%까지 덜 쓴다고 밝혔다.
쓰려면 영상 이해 문서의 에이전트형 영상 이해 안내를 따라 설정해야 한다.