TapVid
    API & MCP料金公式ブログ会社概要
    ブログ›Gemini 3.7 の動画理解:エージェントモードガイド
    ブログに戻る

    Gemini 3.7 の動画理解:エージェントモードガイド

    Gemini 3.7のエージェント型動画分析を、モード選択、根拠付きプロンプト、生成との境界から実務的に解説します。

    AIツール
    Kenneth ChenKenneth Chen2026年9月4日 · 13分で読了2026年9月4日 · 13分で読了Discord
    Kenneth ChenKenneth ChenTapVid GTMマネージャー | 元Alibaba | SEO・GEO・グロースエンジニアリング

    著者や他の動画クリエイターと交流し、 実践チュートリアルを見よう。

    Discord に参加
    2026年9月4日13分で読了
    Gemini 3.7 の動画理解:エージェントモードガイド
    次のツールで要約6個のアシスタント
    ChatGPTPerplexityTapVidvideoClaudeGeminiGrok
    AIエージェントから動画を作成TapVid API & MCPを接続→

    この記事の内容

    1. 01Gemini 3.7の動画理解とは
    2. 02エージェントモードで変わること
    3. 03エージェントモードと静的サンプリングの選び方
    4. 04プロンプトの前に入力条件を決める
    5. 05根拠のある回答には証拠契約を使う
    6. 06分析作業別のコピープロンプト
    7. 07複数ターンで動画の文脈を保つ
    8. 08制約と失敗パターン
    9. 09動画理解は動画生成ではない
    10. 10確認済みの発見を解説動画に渡す
    11. 11実務向け評価チェックリスト
    12. 12よくある質問
    次のツールで要約API & MCP →
    ChatGPTPerplexityTapVidClaudeGeminiGrok

    Gemini 3.7の動画理解は既存動画を分析する機能で、新しい動画を生成する機能ではありません。エージェントモードは、どの区間と証拠経路を詳しく確認するかを計画します。長時間の録画や特定瞬間の質問に役立ちます。本稿では、使い分けと検証可能な依頼方法を説明します。

    01

    Gemini 3.7の動画理解とは

    Gemini 3.7は動画・音声・文字起こしを一つの依頼で扱えます。Googleの動画理解ドキュメントでは、標準処理の視覚サンプリングは既定で毎秒1フレームです。安定した動画には効率的ですが、短いUI表示や速い動作を逃す可能性があります。

    公式発表によると、エージェント処理は確認方法を計画し、重要な瞬間を選び、文字起こし・音声・フレームレート・解像度を組み合わせます。選択した証拠に基づくため、正解を保証するものではありません。

    02

    エージェントモードで変わること

    静的処理は均一な確認で分かることを答えます。エージェント処理は、この質問に必要な証拠を次に何から集めるかを決めます。長い動画から区間を絞り、必要な箇所を詳しく見られます。

    LensWalkのような研究も、動画の見方を計画する方向を扱います。エージェント型は自動的に正確という意味ではありません。狭い質問、明確な証拠、証拠がない場合の拒否ルールが必要です。

    03

    エージェントモードと静的サンプリングの選び方

    見逃しの影響でモードを選びます。Googleは長時間動画や特定瞬間の質問にエージェント処理を勧め、5分未満で遅延を重視する動画や全体のフレーム精度には静的処理も有効としています。

    状況最初に使うモード理由
    短く安定した動画の概要静的一定の処理速度を優先。
    長い会議から一つの決定を探すエージェント発話と短い画面表示を組み合わせる。
    一瞬だけエラーが出る製品デモエージェント短い視覚状態が答えになる。
    速い動作の全フレームが重要高フレームレートの静的処理または専用処理動画全体の精度が目的。
    短い動画の大まかな一括分類静的コストと形式の予測性を優先。
    証拠を見逃す影響で比較した静的処理とエージェント処理

    実際の動画で両方を試してください。短い表示、音声だけの証拠、答えられない質問を含め、時刻の正確さ、未確認の主張、遅延、出力形式を比較します。

    04

    プロンプトの前に入力条件を決める

    入力条件には、動画の場所、処理モード、質問、出力形式、検証ルールを含めます。動画をテキストより前に置き、対応APIでagenticを指定し、時間はMM:SSで求めます。

    {
      "input": [
        {
          "type": "video",
          "uri": "YOUR_VIDEO_URI",
          "processing": "agentic"
        },
        {
          "type": "text",
          "text": "最初のチェックアウト失敗を探し、MM:SS、表示されたエラー、直前の操作、不確実性を返してください。"
        }
      ]
    }

    以下はGoogleの資料を簡略化した形で、TapVidによる実行比較ではありません。SDKとモデルの最新仕様を確認してください。File API、Cloud Storage、対応YouTube URL、文書化された100MB未満の短いインライン入力を利用できます。

    05

    根拠のある回答には証拠契約を使う

    弱いプロンプトは答えだけを求めます。強いプロンプトは、質問、証拠経路、時刻付き出力、不確実性、推論してはいけない内容を決めます。見えた事実と人の意図に関する推測を分離できます。

    • 質問:判断またはイベントを限定する。
    • 証拠経路:文字起こし、音声、画面文字、UI、動作。
    • 出力:時刻と短い発見を求める。
    • 不確実性:証拠不足を明記する。
    • 除外:推論してはいけない結論を示す。
    根拠付き動画分析プロンプトの5要素

    各発見には区間、観察、証拠経路、具体的な根拠、確信度を含めます。動画が答えを示さない場合は「確認できない」と不足する証拠を返します。

    この動画を{{判断}}について分析してください。各発見にMM:SS、観察、証拠経路、具体的根拠、確信度を含めます。動画にない事実は推測せず、証拠がなければ「確認できない」と不足点を返します。

    06

    分析作業別のコピープロンプト

    次の例は既存動画の分析用です。プレースホルダーを置き換え、時刻と不確実性を残し、重要な結果を元動画で確認してください。

    製品デモの失敗を探す

    失敗または未完了の手順を探します。MM:SS、直前の操作、正確なUI証拠、説明者の言及を返します。根拠のない停止は失敗としません。

    長い会議から決定を抽出する

    価格、公開日、範囲、担当を変える決定を探します。MM:SS、内容、担当、期限、発話根拠を返し、提案と決定を分けます。

    承認済み手順とチュートリアルを照合する

    {{チェックリスト}}と比較し、正しい、誤り、未表示、不明で分類します。MM:SSと表示UI名を含め、音声だけで画面操作を証明しません。

    短い物理イベントを探す

    {{イベント}}が目で見て完了した最初の瞬間を探します。最も早いMM:SS、完了の合図、遮蔽・ぼけ・編集による曖昧さを返します。

    イベント、証拠、拒否条件を定義する方が、「深く」「専門的に」と書くより検証しやすい結果になります。

    07

    複数ターンで動画の文脈を保つ

    複数ターンの分析では、動画と処理状態を保つ必要があります。最初にイベントを探し、次に関連例を求める場合、最後の文章回答だけでは証拠が残りません。

    Interactions APIは以前のインタラクションIDで継続できます。ステートレス実装では関連する処理呼び出しと結果を再送します。ソースID、モード、インタラクションID、プロンプト版、出力形式をまとめて保存します。

    08

    制約と失敗パターン

    エージェント処理でも読めない文字は読めません。モデルカードには、ハルシネーション、遅さ、タイムアウトが制約として記載されています。再試行、期限、レビュー状態、処理権限が必要です。

    • 作られた詳細:時刻と不確実性を要求。
    • 時刻のずれ:境界が重要な結果を確認。
    • 小さいUI:高品質な元動画を利用。
    • 話者の誤認:重複音声を確認。
    • 遅延・タイムアウト:再試行とレビューを用意。
    • 権利・プライバシー:許可された動画だけを処理。

    存在しないイベント、読めない文字、話者が不明な音声、動画から分からない動機も試します。自信を持って答えるなら失敗です。

    09

    動画理解は動画生成ではない

    動画理解は既存動画から発見や時刻を取り出します。動画生成は新しい映像と音声を作り、編集は既存素材を変えます。三つは別の作業です。

    別々の証拠工程として比較した動画理解と動画生成

    作成・編集の例はGemini Omni動画プロンプトライブラリに分けています。分析は元動画へ戻れること、生成は素材・承認文・ブリーフと一致することを検査します。

    一つのテンプレートで両方は検証できません。新しい動画を作らない分析にも価値があり、見栄えの良い生成動画でもラベルや素材が違えば失敗です。

    10

    確認済みの発見を解説動画に渡す

    時刻付き観察を抽出し、人が承認し、承認済みだけを台本にし、正しい素材を各部分に割り当て、台本と画面の対応を確認します。

    確認済みの発見を解説動画に渡す

    1. 1

      時刻付き観察を抽出する。

    2. 2

      正確で有用な観察を承認する。

    3. 3

      承認済みだけを台本にする。

    4. 4

      正しい素材を各台本部分に割り当てる。

    5. 5

      生成後に台本と素材の対応を確認する。

    TapVidはExplainer Video Engineです。AI解説動画ジェネレーターは支給素材と承認済み文案を確認可能な動画にしますが、上流の分析を正しいものに変えるわけではありません。

    11

    実務向け評価チェックリスト

    実際のソースで小さな評価セットを作り、観察可能な基準で採点します。新しい名称ではなく、受け入れ条件を満たすモードを選びます。

    • 正しい区間
    • 証拠経路の明記
    • 画面・発話の正確な引用
    • 未表示と偽の区別
    • 証拠不足時の拒否
    • レビューの速さ
    • 複数ターンの証拠継続
    • 許容できる遅延

    モデルやAPIが変わったら再評価します。プロンプトと期待出力をバージョン管理し、時刻、拒否、遅延、構造の変化を検出します。

    12

    よくある質問

    Gemini 3.7は動画を生成しますか?

    Gemini 3.7 Flashは動画を含む入力を分析できますが、理解と生成は別です。新しい動画が必要なら生成・編集工程を使います。

    エージェント型動画理解を有効にする方法は?

    対応モデルとAPIで動画入力のprocessingをagenticにします。最新の構文と提供状況をGoogle資料で確認してください。

    すべての動画で使うべきですか?

    いいえ。長時間動画や特定瞬間の質問に向きます。短く遅延重視、または全体精度重視なら静的処理が適します。

    正確な時刻を保証しますか?

    保証しません。関連区間を詳しく見られても、重要な時刻と主張は検証が必要です。

    最適なプロンプトは?

    狭い質問、証拠経路、時刻付き形式、不確実性、除外条件を定義します。

    プロンプトライブラリ向きですか?

    分析テンプレートは役立ちますが、主な目的は機能の理解と実装です。分析はガイド、生成は別のライブラリに分けます。

    この記事の検証方法

    検証対象: この記事に関するTapVidの編集・公開記録証拠: 著者情報、公開履歴、および記事内で参照した情報源

    記事バージョン2026年9月4日

    著者についてKenneth Chen

    TapVid GTMマネージャー | 元Alibaba | SEO・GEO・グロースエンジニアリング

    Kenneth Chen は TapVid の市場開拓と SEO/GEO グロースエンジニアリングを担当しています。実際の製品素材を使って解説動画のワークフローを調査・検証し、成功した出力と失敗したレンダリングの両方を記録しながら、製品に関する記述を一次情報で確認しています。

    全66記事を見る →LinkedInプロフィール

    Kenneth Chen が、Discord で動画クリエイター仲間との会話にあなたを招待しています。

    Discord で Kenneth に参加 →
    承認済みの分析結果と素材を解説動画にする

    手元の素材をそのまま活用

    手元のファイルファイルから、そのまま公開できる動画へ

    WEB→ 動画PPT→ 動画PDF→ 動画素材→ 動画音声→ 動画動画→ 動画トーキングヘッド→ 動画WEB→ 動画PPT→ 動画PDF→ 動画素材→ 動画音声→ 動画動画→ 動画トーキングヘッド→ 動画

    続きを読む

    関連記事

    企画からMCP編集ツールと人の確認までを示すAI動画エージェントのワークフロー
    AIツール·12分で読了

    AI動画エージェントとは?Agentic編集とMCPを解説

    AI動画エージェント、Agentic動画編集、人による確認、公開中のTapVid MCPで解説動画を作る流れを実務視点で解説します。

    2026年7月30日

    Amazon 製品ビデオ要件 2026: 7 つの配置ルール 監査済みの調査カバー
    リサーチ·10分で読了

    Amazon 製品ビデオ要件 2026: 監査された 7 つの配置ルール

    7 つの Amazon プレースメント ルールの公式ソース監査により、リスティング動画、Sponsored Products 動画、ディスプレイ動画広告、ストア タイルに異なるエクスポート チェックが必要な理由がわかります。

    2026年9月3日

    ソーシャル メディア ビデオ仕様 2026: 10 の公式フォーマット 監査済みの調査の表紙
    リサーチ·12分で読了

    ソーシャルメディアビデオ仕様 2026: 10 の公式フォーマットが監査済み

    10 形式、6 プラットフォームの監査により、ハードなアップロード制限と推奨事項が分離され、再利用可能な 9:16 MP4 が機能する場所と機能しない場所が示されます。

    2026年9月3日

    最初の動画を作ってみませんか?

    AIで数分でプロ品質の動画を作る、何千もの製品チームに加わりましょう。

    5分で最初の動画を →デモを予約 →
    Tapvid

    TapVidは、企業がすでに持つ素材を、内容を明確に伝え、そのまま公開できる正確な動画に変えます。

    TikTokInstagramXDiscordYouTube

    TapVid

    機能

    AI解説動画ジェネレーターAIモーショングラフィックスジェネレーターAI製品デモ動画ジェネレーター製品デモ動画メーカー解説動画テンプレート動画制作計画テンプレート動画クリエイティブブリーフテンプレートコーポレート動画テンプレート動画セールスレターテンプレート動画制作提案テンプレートプロモ動画テンプレート動画制作テンプレートAI商品動画ジェネレーターAI Bロールジェネレータートーキングヘッド動画強化ツールAI動画クローンPrompt to Videoテキストから動画AIテキストからモーショングラフィックスアニメーション動画メーカーアニメーション解説動画メーカーキネティックタイポグラフィ生成ツールアニメーショングラフ作成ツールアニメーションコラージュメーカー無料AI動画ジェネレーター

    動画に変換

    スクリーンショットから動画へ画像を動画にAssets to VideoAudio to Video動画から動画AIPDFを動画にPPTを動画に記事を動画にブログを動画にURLを動画にスクリプトを動画にGoogleスライドを動画にWordを動画に

    活用シーン

    AI 学習動画メーカーSaaS解説動画AI動画自動化SaaS動画制作産業動画制作製品ローンチ動画メーカーAI広告動画ジェネレーターAIドキュメンタリー動画メーカーアニメーションSNS動画メーカーインフォグラフィック動画メーカーポッドキャストを動画にホワイトボードアニメーションメーカーホワイトボード解説動画EC動画広告スタートアップ解説動画教育動画チュートリアル動画顧客オンボーディングヘルプセンター動画APIドキュメント動画

    ソリューション

    解説動画製品デモ動画会議まとめ動画ウェビナークリップマーケティング動画新機能発表競合比較ニュースレター動画ランディングページ動画投資家向けピッチ動画

    注目のガイド

    動画プロンプトライブラリGemini Omni 1.1 FlashプロンプトライブラリMiniMax H3プロンプトライブラリ顔出しなしYouTubeのおすすめジャンルコラージュアニメーションガイド

    会社情報

    すべての機能概要ブログ料金プランお問い合わせ

    © 2026 TapVid. All rights reserved.

    プライバシーポリシー
    利用規約