Gemini 3.7の動画理解は既存動画を分析する機能で、新しい動画を生成する機能ではありません。エージェントモードは、どの区間と証拠経路を詳しく確認するかを計画します。長時間の録画や特定瞬間の質問に役立ちます。本稿では、使い分けと検証可能な依頼方法を説明します。
01
Gemini 3.7の動画理解とは
Gemini 3.7は動画・音声・文字起こしを一つの依頼で扱えます。Googleの動画理解ドキュメントでは、標準処理の視覚サンプリングは既定で毎秒1フレームです。安定した動画には効率的ですが、短いUI表示や速い動作を逃す可能性があります。
公式発表によると、エージェント処理は確認方法を計画し、重要な瞬間を選び、文字起こし・音声・フレームレート・解像度を組み合わせます。選択した証拠に基づくため、正解を保証するものではありません。
02
エージェントモードで変わること
静的処理は均一な確認で分かることを答えます。エージェント処理は、この質問に必要な証拠を次に何から集めるかを決めます。長い動画から区間を絞り、必要な箇所を詳しく見られます。
LensWalkのような研究も、動画の見方を計画する方向を扱います。エージェント型は自動的に正確という意味ではありません。狭い質問、明確な証拠、証拠がない場合の拒否ルールが必要です。
03
エージェントモードと静的サンプリングの選び方
見逃しの影響でモードを選びます。Googleは長時間動画や特定瞬間の質問にエージェント処理を勧め、5分未満で遅延を重視する動画や全体のフレーム精度には静的処理も有効としています。
| 状況 | 最初に使うモード | 理由 |
|---|---|---|
| 短く安定した動画の概要 | 静的 | 一定の処理速度を優先。 |
| 長い会議から一つの決定を探す | エージェント | 発話と短い画面表示を組み合わせる。 |
| 一瞬だけエラーが出る製品デモ | エージェント | 短い視覚状態が答えになる。 |
| 速い動作の全フレームが重要 | 高フレームレートの静的処理または専用処理 | 動画全体の精度が目的。 |
| 短い動画の大まかな一括分類 | 静的 | コストと形式の予測性を優先。 |
実際の動画で両方を試してください。短い表示、音声だけの証拠、答えられない質問を含め、時刻の正確さ、未確認の主張、遅延、出力形式を比較します。
04
プロンプトの前に入力条件を決める
入力条件には、動画の場所、処理モード、質問、出力形式、検証ルールを含めます。動画をテキストより前に置き、対応APIでagenticを指定し、時間はMM:SSで求めます。
{
"input": [
{
"type": "video",
"uri": "YOUR_VIDEO_URI",
"processing": "agentic"
},
{
"type": "text",
"text": "最初のチェックアウト失敗を探し、MM:SS、表示されたエラー、直前の操作、不確実性を返してください。"
}
]
}以下はGoogleの資料を簡略化した形で、TapVidによる実行比較ではありません。SDKとモデルの最新仕様を確認してください。File API、Cloud Storage、対応YouTube URL、文書化された100MB未満の短いインライン入力を利用できます。
05
根拠のある回答には証拠契約を使う
弱いプロンプトは答えだけを求めます。強いプロンプトは、質問、証拠経路、時刻付き出力、不確実性、推論してはいけない内容を決めます。見えた事実と人の意図に関する推測を分離できます。
- 質問:判断またはイベントを限定する。
- 証拠経路:文字起こし、音声、画面文字、UI、動作。
- 出力:時刻と短い発見を求める。
- 不確実性:証拠不足を明記する。
- 除外:推論してはいけない結論を示す。
各発見には区間、観察、証拠経路、具体的な根拠、確信度を含めます。動画が答えを示さない場合は「確認できない」と不足する証拠を返します。
この動画を{{判断}}について分析してください。各発見にMM:SS、観察、証拠経路、具体的根拠、確信度を含めます。動画にない事実は推測せず、証拠がなければ「確認できない」と不足点を返します。06
分析作業別のコピープロンプト
次の例は既存動画の分析用です。プレースホルダーを置き換え、時刻と不確実性を残し、重要な結果を元動画で確認してください。
製品デモの失敗を探す
失敗または未完了の手順を探します。MM:SS、直前の操作、正確なUI証拠、説明者の言及を返します。根拠のない停止は失敗としません。長い会議から決定を抽出する
価格、公開日、範囲、担当を変える決定を探します。MM:SS、内容、担当、期限、発話根拠を返し、提案と決定を分けます。承認済み手順とチュートリアルを照合する
{{チェックリスト}}と比較し、正しい、誤り、未表示、不明で分類します。MM:SSと表示UI名を含め、音声だけで画面操作を証明しません。短い物理イベントを探す
{{イベント}}が目で見て完了した最初の瞬間を探します。最も早いMM:SS、完了の合図、遮蔽・ぼけ・編集による曖昧さを返します。イベント、証拠、拒否条件を定義する方が、「深く」「専門的に」と書くより検証しやすい結果になります。
07
複数ターンで動画の文脈を保つ
複数ターンの分析では、動画と処理状態を保つ必要があります。最初にイベントを探し、次に関連例を求める場合、最後の文章回答だけでは証拠が残りません。
Interactions APIは以前のインタラクションIDで継続できます。ステートレス実装では関連する処理呼び出しと結果を再送します。ソースID、モード、インタラクションID、プロンプト版、出力形式をまとめて保存します。
08
制約と失敗パターン
エージェント処理でも読めない文字は読めません。モデルカードには、ハルシネーション、遅さ、タイムアウトが制約として記載されています。再試行、期限、レビュー状態、処理権限が必要です。
- 作られた詳細:時刻と不確実性を要求。
- 時刻のずれ:境界が重要な結果を確認。
- 小さいUI:高品質な元動画を利用。
- 話者の誤認:重複音声を確認。
- 遅延・タイムアウト:再試行とレビューを用意。
- 権利・プライバシー:許可された動画だけを処理。
存在しないイベント、読めない文字、話者が不明な音声、動画から分からない動機も試します。自信を持って答えるなら失敗です。
09
動画理解は動画生成ではない
動画理解は既存動画から発見や時刻を取り出します。動画生成は新しい映像と音声を作り、編集は既存素材を変えます。三つは別の作業です。
作成・編集の例はGemini Omni動画プロンプトライブラリに分けています。分析は元動画へ戻れること、生成は素材・承認文・ブリーフと一致することを検査します。
一つのテンプレートで両方は検証できません。新しい動画を作らない分析にも価値があり、見栄えの良い生成動画でもラベルや素材が違えば失敗です。
10
確認済みの発見を解説動画に渡す
時刻付き観察を抽出し、人が承認し、承認済みだけを台本にし、正しい素材を各部分に割り当て、台本と画面の対応を確認します。
確認済みの発見を解説動画に渡す
- 1
時刻付き観察を抽出する。
- 2
正確で有用な観察を承認する。
- 3
承認済みだけを台本にする。
- 4
正しい素材を各台本部分に割り当てる。
- 5
生成後に台本と素材の対応を確認する。
TapVidはExplainer Video Engineです。AI解説動画ジェネレーターは支給素材と承認済み文案を確認可能な動画にしますが、上流の分析を正しいものに変えるわけではありません。
11
実務向け評価チェックリスト
実際のソースで小さな評価セットを作り、観察可能な基準で採点します。新しい名称ではなく、受け入れ条件を満たすモードを選びます。
- 正しい区間
- 証拠経路の明記
- 画面・発話の正確な引用
- 未表示と偽の区別
- 証拠不足時の拒否
- レビューの速さ
- 複数ターンの証拠継続
- 許容できる遅延
モデルやAPIが変わったら再評価します。プロンプトと期待出力をバージョン管理し、時刻、拒否、遅延、構造の変化を検出します。
12
よくある質問
Gemini 3.7は動画を生成しますか?
Gemini 3.7 Flashは動画を含む入力を分析できますが、理解と生成は別です。新しい動画が必要なら生成・編集工程を使います。
エージェント型動画理解を有効にする方法は?
対応モデルとAPIで動画入力のprocessingをagenticにします。最新の構文と提供状況をGoogle資料で確認してください。
すべての動画で使うべきですか?
いいえ。長時間動画や特定瞬間の質問に向きます。短く遅延重視、または全体精度重視なら静的処理が適します。
正確な時刻を保証しますか?
保証しません。関連区間を詳しく見られても、重要な時刻と主張は検証が必要です。
最適なプロンプトは?
狭い質問、証拠経路、時刻付き形式、不確実性、除外条件を定義します。
プロンプトライブラリ向きですか?
分析テンプレートは役立ちますが、主な目的は機能の理解と実装です。分析はガイド、生成は別のライブラリに分けます。




