長時間動画を全部読まない:Geminiのエージェント型動画理解

必要な区間・映像・音声・字幕を動的に探索し、トークン最大88%、費用最大66%削減とGoogleが報告しました。

固定フレームから目的に沿う探索へ

GoogleはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteにagentic video understandingを追加しました。従来の固定フレーム処理と違い、質問に応じて区間と速度を決め、フレーム、音声、字幕から必要な信号だけを内部ツールで取得します。

自社評価ではトークン最大88%、費用最大66%削減、精度最大7%向上と報告しています。瞬間検索、異常検出、個数計測、10分の解説から90分の講義・長時間録画を対象とし、Gemini API、AI Studio、Enterprise Agent PlatformでアップロードとYouTubeを処理できます。

「最大」は全動画の割引率ではない

指定モデルと評価条件による供給側数値です。曖昧な質問、全体に分散する出来事では探索量が増え、速い編集、小さな文字、重なる音声を見逃す可能性があります。処理権限、個人情報、著作権も確認が必要です。同じ質問で固定方式と精度、欠落、トークン、遅延を比較し、監査用途では元タイムコードと根拠区間を保存すべきです。

公式情報