最新のGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteに、エージェント型ビデオ理解が追加されました。新機能は動画解析の精度向上に加え、トークン消費を最大88%削減し、コストを最大66%削減し、品質を最大7%向上すると説明されています。従来の固定フレーム取り込みによる静的処理と異なり、視覚フレームや音声、トランスクリプトを横断し、目的のセグメントを動的に検索し再スキャンする仕組みです。これにより、長尺動画でも重要な瞬間へ集中的にアクセスでき、無駄な処理を抑えます。利用はGoogle AI StudioのGemini APIとGemini Enterprise Agent Platformで、動画アップロードとYouTube動画の両方に対応します。
このアプローチは、サブ秒単位の一瞬の変化捕捉や、数時間に及ぶコンテンツからの情報抽出、異常検出、動作や物体の精密なカウントに効果を発揮します。例えば、必要に応じてフレーム/秒を動的に上げ下げして再視聴し、速い動きを正確に数えることが可能です。長尺向けベンチマークのLongVideoBenchでは、エージェント機能の有無でトークン数削減と精度向上が確認されたとされています。Gemini 3.7 Flashは品質とコスト効率のバランスで優位性を示し、動画解析における精度対コストのパレートフロントに位置づけられます。標準のGemini APIトークン料金が適用され、追加料金は不要です。
導入はAPI設定で処理をagenticに切り替えるだけです。コードスニペットでは、動画URIとテキスト指示を入力し、モデルとしてgemini 3.7 flashを指定する例が示されています。さらに、この効率化はGoogleの製品群にも展開され、今後、FlashおよびFlash LiteモデルのGeminiアプリで広く利用可能になります。数か月以内にYouTubeのAsk YouTubeにも組み込まれ、動画内容に基づく高品質な回答提供が予定されています。実務では、長尺解析や編集、監視、教育動画のインデキシングなどでコスト対効果の高い運用が期待できます。
詳しくは「Google」の公式ページまで。レポート/DXマガジン編集部





















