llmfeed

제미나이 API에 에이전트형 영상 이해 기능 추가, Gemini 3.7 Flash 등 3개 모델 지원

구글
  • 구글이 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 에이전트형 영상 이해 기능을 공개했다.
  • 모델이 영상 타임라인을 스스로 오가며 자막·프레임·음성을 필요할 때만 요청한다.
  • 긴 영상에서 토큰을 최대 88% 덜 쓴다고 회사는 밝혔다.
모델Gemini 3.7 Flash
개방성폐쇄형

무엇이 바뀌었나

  • 구글이 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite에서 에이전트형 영상 이해(Agentic video understanding) 기능을 공개했다.
  • 이 기능은 Interactions API와 GenerateContent API 양쪽에서 쓸 수 있다.

기존 방식이 영상을 한 번에 정해진 대로 처리하는 것과 달리, 이 방식에서는 모델이 영상 타임라인을 스스로 옮겨 다니며 필요한 시점에 자막(transcript), 프레임, 오디오 트랙을 그때그때 요청한다.

회사가 밝힌 수치

구글은 긴 영상을 다룰 때 정적인 처리 방식과 견주어 토큰을 최대 88%까지 덜 쓴다고 밝혔다.

쓰려면 영상 이해 문서의 에이전트형 영상 이해 안내를 따라 설정해야 한다.

원문