この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 動画を固定FPSでなくモデルが動的に走査する新機能
  • トークン最大88%、コスト最大66%削減、精度は最大7%向上
  • Gemini 3.7 Flashなど3モデルでAPIから即日利用可能

発表の概要

Google DeepMindは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteを対象に、動画解析の新機能「エージェンティック動画理解」を公開した。動画ファイルのアップロードとYouTube動画をGemini API経由で解析でき、Google AI StudioやGemini Enterprise Agent Platformで利用を開始できる。

利用方法はAPI設定で処理モードを「agentic」に指定するだけで、標準のトークン価格に追加の機能料金はないとされている。コード例も公開されており、動画のURLと質問文を渡すだけで解析結果が得られる。

従来の静的処理との違い

従来の動画解析は、動画を毎秒1フレームなど固定のフレームレートで取り込み、処理していた。この方式では、長時間動画を扱う際にトークン消費が膨らむか、重要な瞬間を取りこぼすかの二択になりやすかった。

新機能では、モデルが動画のどの部分を、どの速度で、どのモダリティ(映像・音声・字幕)で調べるかを自ら判断する。必要な瞬間だけを内部ツールで読み込む「エージェンティックループ」により、開発者が手動で処理を実装する手間も減るとされる。

性能とコストの改善

Google DeepMindのベンチマークでは、静的処理と比べてトークン消費を最大88%、コストを最大66%削減し、精度を最大7%向上するとされている。特に10分のハウツーから90分の講義、数時間の録画といった長尺動画で効果が大きいという。

サポート対象の3モデルの中で、Gemini 3.7 Flashは精度とコスト効率のバランスが最も良く、動画理解における精度対コストのパレートフロンティアに位置すると説明されている。ただし、これらの数字は特定のベンチマークに基づく最大値であり、実際の削減率はタスクや動画の種類によって異なる可能性がある。

活用例と今後の展開

具体的なユースケースとして、1秒未満の瞬間的な状態変化を捉える「サブ秒モーメント検索」や、数時間の動画から特定のシーンを探す「干し草の山から針を探す検索」、異常検知、動作や物体の正確なカウントが挙げられている。

エージェンティック動画理解は、今後GeminiアプリのFlash系モデルにも展開される予定で、数カ月以内にはYouTubeの「Ask YouTube」機能にも活用される見込みだ。早期アクセスパートナーからは好評とされているが、具体的な社名や数値は公表されていない。

従来の静的処理とエージェンティック動画理解の比較
項目静的処理エージェンティック動画理解
フレームレート固定(既定1 FPS、APIで調整可)モデルが動的に決定
トークン消費基準最大88%削減
コスト基準最大66%削減
精度基準最大7%向上

今後の見通し

今後、GeminiアプリやYouTubeのAsk YouTubeへの展開により、エージェンティック動画理解は一般ユーザーにも届くようになる。企業の開発者が実際の動画解析パイプラインでどの程度の削減効果を再現できるか、また多言語の動画やさまざまなドメインで精度が維持されるかが次の判断材料になる。ベンチマーク上の「最大」値が実務環境でどの程度となるか、追加の検証が待たれる。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、動画解析のコストとトークン消費が大幅に下がる点は実務に直結する。これまで長時間の監視動画やWebinar、講義動画を解析するには大量のトークンが必要で、コスト面から導入をためらうケースもあった。今回の機能により、APIの設定変更だけで既存のアプリケーションに組み込め、開発工数も削減できる可能性がある。一方で、ベンチマークは英語中心のデータセットによるとみられ、日本語動画での効果は現時点で未知数だ。自社のデータで検証することが重要になる。

気になる点

追加の機能料金はかかりますか?
標準のGemini APIトークン価格のみで、追加の機能料金はかからないと発表されている。API設定で「agentic」を指定すれば利用できる。
どのモデルで使えますか?
Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3モデルで利用できる。このうちGemini 3.7 Flashが精度とコスト効率のバランスで最も良いとされる。
日本語の動画にも対応しますか?
現時点では言語別の対応状況は明らかにされていない。動画アップロードとYouTube動画が対象で、音声・字幕も解析に使われるが、特定言語の保証は記載がない。

用語解説

エージェンティック
モデルが推論に基づいて自らツールを呼び出し、処理の流れを動的に決める性質を指す。
トークン
テキストやコードを処理する際の基本単位。モデルへの入力・出力のコストに直結する。
フレームレート
動画を構成する静止画(フレーム)を1秒あたり何枚使って解析するかを示す値。FPSと表記される。
パレートフロンティア
複数の目的(ここでは精度とコスト)を同時に改善できる限界線。これより良い組み合わせが存在しない点の集合。

出典

Introducing agentic video understanding with Gemini

Google DeepMind / 2026年9月2日

https://deepmind.google/blog/introducing-agentic-video-in-gemini

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する