Gemini、エージェント型ビデオ理解を導入:トークン最大88%減、コスト最大66%減

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMindは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite向けにエージェント型ビデオ理解を発表しました。固定フレームレートで動画を取り込む代わりに、モデルが映像、音声、文字起こしから必要な区間を検索、走査、精査します。標準ベンチマークで、トークンは最大88%、コストは最大66%減り、精度は最大7%向上するとされます。Google AI StudioやGemini Enterprise Agent PlatformでAPI設定をagenticにすると使えます。

Google DeepMindは、Geminiの「エージェント型ビデオ理解」(agentic video understanding)を発表しました。対象はGemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteの3モデルです。記事の執筆者は、シニアプロダクトマネージャーのRohan Doshi氏と、リサーチディレクターのMario Lučić氏です。公式が示す主な数字は3つあります。標準的な動画分析ベンチマークで、トークン消費を最大88%、分析コストを最大66%削減し、精度を最大7%向上させるというものです。いずれも「最大値」であり、実際の効果は動画の長さやタスクの種類によって変わります。 まず従来の方式を整理します。「静的」処理では、モデルが固定のフレームレートで動画全体を取り込みます。既定値は1 FPSで、APIから調整できます。仕組みは単純ですが、問題が2つあります。1つ目は、動画が長くなるほどトークン消費が増える点です。90分の講義や数時間の録画は、大きなコストになります。2つ目は、開発者が選択を迫られる点です。高いトークン費用を払うか、フレーム間引き、切り詰め、要約といった圧縮に頼るかの二択になり、後者では重要な詳細が失われがちです。公式は、10分のハウツー動画から90分の講義、数時間の録画に至る長尺動画で、この矛盾が最も大きいと述べています。新機能の効果が特に大きいのも、この領域です。 新しい仕組みの核心は、モデルの役割が受け身から能動に変わる点にあります。Geminiは、中核の推論能力とネイティブの動画ツールを組み合わせます。そして、映像フレーム、音声、文字起こしの3種類の情報にわたって、対象の区間を検索、走査、精査します。何を見るか、どの速度で見るか、どのモダリティを使うかは、モデル自身が決めます。必要な瞬間と信号だけを取得します。公式はこれを「エージェンティックなループ」と説明しています。Geminiが内部ツールを呼び出して動画ファイルの該当部分を読み込み、結果を確認し、次の動作を決めます。以前も、開発者が自前で切り出し、文字起こし、検索のコードを書けば似たことはできました。今回はそのループがモデルの内部で動くため、開発の負担が減ります。

この考え方は、先に公開された「エージェント型ビジョン」(agentic vision)の延長にあります。こちらはコード実行とGeminiのネイティブな画像理解を組み合わせた機能でした。今回は同じ発想を動画に適用しています。公式が挙げる新しい能力は、1秒未満の精度での場面検索、より正確な異常検知、正確なカウントなどです。これらのタスクには共通点があります。答えが、ごく短い数瞬にしか現れないことが多いのです。1 FPSの均等なサンプリングでは見落としやすく、戻ってゆっくり見直せるモデルのほうが有利です。 性能面では、公式は3モデルすべてで改善があるとしています。その中でも、エージェント型理解を有効にしたGemini 3.7 Flashが、総合品質で最良であり、品質とコストの組み合わせでも最良だと説明しています。公式のグラフでは、テストしたモデルの中で「精度対コスト」のパレートフロンティア上に位置します。つまり、テストした範囲では、より低いコストでより高い精度を出す別の構成はありませんでした。ただし注意点があります。この結果はGoogleが選んだ標準ベンチマークによるものです。確認できた原文の抜粋には、各ベンチマークの名称や個別の表はありません。見出しの数字を信じる前に、自社の動画で検証する必要があります。

利用方法は簡単です。動画のアップロードとYouTube動画に対応し、Google AI Studioと Gemini Enterprise Agent Platform のGemini API から使えます。公式の要約によれば、API設定を「agentic」にするだけで有効になります。切り替えのコストは小さく、既存の動画分析パイプラインを作り直す必要は少ないはずです。 開発者と企業への影響は3点あります。1つ目はコスト構造です。長尺動画の分析は、トークン費用のために拡大が難しい場面が多くありました。たとえば、防犯映像の確認、会議や講座の振り返り、メディア資産の検索、コンプライアンスの抜き取り検査です。最大66%のコスト削減は、こうした用途の一部を現実的にします。2つ目はエンジニアリングの負担です。フレーム選択、分割、文字起こしの同期、検索のロジックを、モデル内部のツールループに任せられます。3つ目は、品質とコストの二者択一が弱まることです。精度が上がりながらコストが下がるので、本番運用に魅力があります。

未解決の点もあります。エージェントのループは、1回の依頼で複数のモデルステップを伴います。公式の抜粋には遅延のデータがないため、応答時間と実行ごとのばらつきは自分で測る必要があります。また、どこを見るかをモデルが決めるため、まれに重要な区間を飛ばす可能性があります。安全監視や医療画像のような重要度の高い用途では、人による確認と抜き取り検査が引き続き必要です。対応モデルや入力ソースが今後広がるかどうかも、公式は述べていません。 今後の見通しとして、この発表はマルチモーダル競争の方向を示しています。争点は、どれだけ長い動画を保持できるかから、どれだけ賢く見るかへ移っています。コンテキストウィンドウが大きくなっても、全フレームを入力するやり方が安くなるわけではありません。まず見渡し、場所を特定し、次に詳しく見る。この流れは、人が映像を扱う方法に近いものです。他のモデル提供者も、同様の能動的な検索機能を出してくると考えられます。開発者の関心は、前処理パイプラインから、評価とコスト監視へ移っていくでしょう。 導入を検討するチームには、次の進め方をすすめます。代表的な動画を選び、短い動画と長い動画に分け、静的設定とエージェント設定の両方で実行します。タスクごとにトークン数、総コスト、精度を記録します。公式は長尺動画で効果が大きいとしているため、短い動画では差が小さいと見込んでください。この比較を終えてから、移行を判断するのが現実的です。

Sources