最新LLM・モデル
Geminiが動画を自律的に分析する「Agentic Video Understanding」登場、文字起こしや再確認を繰り返して長時間動画を詳しく分析しつつ安価に回答を生成
GIGAZINE公開: 2026年9月2日
出典:GIGAZINE
この記事のポイント
- 1Geminiが自律的に動画の重要箇所を探索・再確認するエージェント機能を搭載
- 2トークン消費を最大88%削減し、長時間の動画分析も圧倒的に低コストで実現
- 31秒未満の動作確認や動作回数のカウントなど、高精度な視覚理解が可能に
要約
Google DeepMindが、Geminiの動画分析を劇的に効率化する新機能「Agentic Video Understanding」を発表しました。従来の動画処理は1秒間に1フレームを固定で読み込む「静的処理」でしたが、新機能ではGeminiが自律的なエージェントとして振る舞い、質問内容に応じて「動画のどの区間を、どの程度の解像度やフレームレートで再確認すべきか」を判断します。これにより、1秒未満の瞬間的な動きの特定や、数時間に及ぶ長時間動画の検索・分析が可能になりました。Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteで利用可能で、従来の処理と比較してトークン消費量を最大88%、分析コストを最大66%削減しつつ、回答の精度を向上させています。
出典:GIGAZINE の情報をもとにAIが要約
当サイトの考察
“
ヒナキラです!動画分析の「コスパ革命」がGeminiからやってきました!これまで数時間の動画をAIに読み込ませるのは、トークン消費が激しすぎて個人では現実的ではありませんでした。しかし、この「エージェント型」の処理なら、AIが必要な部分だけをピンポイントで「見直して」くれるので、圧倒的に安く済みます。先週ご紹介した、テラバイト級の動画を検索できる「Clipto」のような仕組みが、LLMの標準機能として組み込まれたイメージですね。YouTube動画の分析にも対応しているので、副業で大量の講義動画から情報を抽出したい人や、動画編集のカット位置をAIに探させたいクリエイターにとって、最強の武器になるでしょう。「まずは安価なFlashモデルで賢く動かす」という流れは、先週のコスト効率に関する記事(ROIの指標)とも完全に合致する進化です!
よくある質問
Q利用するのに追加料金はかかりますか?
A
いいえ、この機能自体に追加料金はなく、通常のGemini APIのトークン料金が適用されます。むしろ消費トークンが大幅に減るため、実質的なコストダウンになります。
Q個人でもすぐに使えますか?
A
はい、Google AI StudioやGemini APIを通じて、開発者や個人ユーザーも利用可能です。アップロードした動画だけでなく、YouTube動画のURL指定でも使えます。
Q短い動画でもメリットはありますか?
A
5分未満の短い動画の場合、従来の静的処理の方が応答速度が速い場合があります。用途に応じて「agentic」か「static」かを選択するのがベストです。
用語解説
Agentic(エージェント型)
AIが与えられた目的のために、自ら手順を考え、必要な道具や情報を選択して実行する振る舞いのこと。
トークン
AIがテキストや画像を処理する際の最小単位。消費量が多いほどAPIの利用料金が高くなる。
パレート最前線
コストと精度のバランスにおいて、これ以上片方を良くしようとするともう片方が悪化する、最も効率的な状態。
※ この記事の要約・考察・FAQ・用語解説はAIによって生成されています。正確な情報は元記事をご確認ください。

ヒナキラ
Hinakira AI News 編集長
AIツール・LLM・プロンプト活用術を中心に、個人クリエイター・副業者向けのAI最新情報を毎日お届けしています。AI歴3年以上、いろんな用途に実際に使って試してきた知見をもとに、読者が「自分ごと」として活用できる考察を心がけています。
