고정 프레임 추출에서 목적형 탐색으로
Google은 Gemini 3.7 Flash, 3.6 Flash와 3.5 Flash-Lite에 agentic video understanding을 제공했습니다. 기존 방식은 영상을 기본 초당 1프레임 같은 고정 비율로 읽지만, 새 기능은 질문에 맞춰 어느 구간을 어떤 속도로 볼지 정하고 프레임·오디오·자막 가운데 필요한 신호를 내부 도구로 불러옵니다.
Google은 표준 영상 분석 평가에서 토큰을 최대 88%, 질의 비용을 최대 66% 줄이면서 정확도를 최대 7% 높였다고 보고했습니다. 10분 설명 영상부터 90분 강의와 더 긴 녹화물에서 순간 검색, 이상 탐지와 개수 세기 같은 작업을 겨냥합니다. 업로드 영상과 YouTube 영상에 대해 Gemini API, Google AI Studio와 Gemini Enterprise Agent Platform에서 사용할 수 있습니다.
‘최대’ 수치는 모든 영상의 할인율이 아니다
수치는 Google이 선정한 모델·벤치마크·질의 조건의 공급사 평가입니다. 질문이 모호하거나 사건이 영상 전체에 흩어져 있으면 더 많은 구간을 탐색할 수 있고, 빠른 컷·작은 문자·겹치는 음성에서 중요한 장면을 놓칠 수도 있습니다. 접근 권한이 있는 영상만 처리해야 하며 업로드·YouTube의 개인정보와 저작권 정책도 따릅니다.
도입 시에는 고정 프레임 방식과 같은 질의로 정확도·누락·토큰·지연을 함께 비교하고, 안전·감사 업무에서는 원본 타임코드와 사람이 확인할 근거 구간을 결과에 남겨야 합니다.