Gemini 3.7 影片理解分析的是既有影片,不是生成一支新影片。代理模式會規劃哪些區間、哪些證據管道值得進一步檢查,適合長影片和精準時刻問題。本指南說清楚如何選模式、怎樣要求可覆核的結果,以及何時切換到獨立的影片生成流程。
01
什麼是 Gemini 3.7 影片理解?
Gemini 3.7 可以在一次請求裡綜合影片、音訊和轉錄資訊。Google 影片理解文件說明,標準處理預設按每秒 1 格進行視覺取樣。它適合穩定畫面,但可能漏掉短暫 UI 狀態或快速動作。
根據 Google 官方發布文章,代理處理會規劃檢查方式、選擇相關時刻,並按問題組合轉錄、音訊、影格率和解析度。它仍基於被選中的證據工作,因此不能保證答案一定正確。
02
代理模式改變了什麼
靜態取樣回答「從一次均勻檢查裡能看出什麼」;代理檢查回答「為了這個問題,下一步該收集什麼證據」。後者可以先在長影片裡縮小區間,再對關鍵位置做更細檢查。
LensWalk 等研究也在探索先規劃「怎麼看影片」的路線。但「代理」不等於自動正確。更可靠的目標是限定問題、明確證據,並規定證據缺失時必須拒答。
03
選擇代理模式還是靜態取樣
應按素材特徵和漏掉事件的代價選擇模式。Google 更推薦代理處理長影片和精準時刻問題;對 5 分鐘以內、重視低延遲的短片,或需要全片可預測影格精度的任務,靜態處理仍有價值。
| 場景 | 建議先用 | 原因 |
|---|---|---|
| 短且穩定的影片,只需要寬泛摘要 | 靜態 | 一致吞吐比自適應檢查更重要。 |
| 90 分鐘會議,只找一項稀疏決策 | 代理 | 證據可能同時存在於發言和短暫螢幕文件中。 |
| 產品示範裡錯誤提示一閃而過 | 代理 | 答案依賴短暫視覺狀態。 |
| 快速動作的每一格都重要 | 提高影格率的靜態處理或專用視覺管線 | 任務要求全域影格精度。 |
| 批次短片只做粗粒度分類 | 靜態 | 可預測成本和輸出結構更重要。 |
把這套判斷當作起點,而不是永久規則。用自己的素材同時測試兩種模式,加入短暫視覺事件、純音訊證據和故意無法回答的問題,比較時間戳、無依據陳述、延遲和輸出結構。
04
寫提示詞前先建立輸入契約
可靠請求先定義輸入契約:影片位置、處理模式、具體問題、輸出結構和核驗規則。影片輸入放在文字提示前,在支援的 API 中使用文件規定的 agentic 值,時間統一要求 MM:SS。
{
"input": [
{
"type": "video",
"uri": "YOUR_VIDEO_URI",
"processing": "agentic"
},
{
"type": "text",
"text": "找到第一次結帳失敗。返回 MM:SS 時間戳、可見錯誤文案、之前的使用者操作,以及不確定性。"
}
]
}下面只是根據 Google 文件簡化的請求結構,不是 TapVid 的實測基準。正式使用前應核對目前模型和 SDK 語法。輸入可來自 File API、Cloud Storage、支援的 YouTube URL,或文件限制內小於 100 MB 的短檔案。
05
用證據契約約束可核驗答案
弱提示詞只要求答案;強提示詞會定義問題、證據管道、帶時間戳的輸出、不確定性規則和禁止推斷的結論。這樣可以把「按鈕仍然不可用」這類觀察,與對使用者意圖的猜測分開。
- 問題:明確要識別的決策或事件。
- 證據管道:轉錄、音訊、螢幕文字、UI 狀態或可見動作。
- 輸出結構:要求時間戳和簡短發現。
- 不確定性:證據不足時必須明說。
- 排除項:明確不能推斷的結論。
每條發現都應包含時間區間、簡短觀察、證據管道、可見或可聽的具體依據和信心程度。如果素材無法建立答案,正確輸出應是「未能建立」並說明缺少什麼,而不是給一個聽起來合理的猜測。
分析這段影片中的 {{決策}}。每條發現返回 MM:SS 區間、簡短觀察、證據管道、具體依據和信心程度。不要推斷影片未支援的事實。證據缺失時返回「未能建立」,並解釋缺少什麼。06
常見分析任務的可複製提示詞
下面四個範本用於分析既有影片,不是生成或編輯影片。替換佔位符,保留時間戳和不確定性要求,並對有後果的發現重看原始影片。
定位產品示範失敗
檢查產品示範中的失敗或未完成步驟。每項返回 MM:SS、之前的操作、確切 UI 證據,以及講解者是否口頭承認。沒有證據時,不要把停頓標成失敗。從長會議中提取決策
找到改變價格、發布時間、功能範圍或負責人安排的決策。返回 MM:SS、決策內容、負責人、截止日期和口頭依據。把已確認決策與建議、待定問題分開。按批准步驟審核教學
把教學與 {{檢查清單}} 對照,每項標記為正確、錯誤、未展示或不清楚,並給出 MM:SS 和可見 UI 標籤。只有旁白不能證明螢幕步驟已經發生。定位短暫物理事件
找到 {{事件}} 第一次在畫面上明確完成的時刻。細查前後區間,返回最早可辯護的 MM:SS、完成線索,以及遮擋、動態模糊或剪輯造成的不確定性。把事件、證據和拒答條件寫清楚,比加入「深度」「專家級」等形容詞更有效,因為審核者可以判斷輸出是否符合契約。
07
在多輪分析中保留影片脈絡
影片分析經常會連續追問:第一輪定位事件,第二輪找相關例子,第三輪整理已批准發現。只有應用正確保留影片和處理狀態,這種多輪流程才可靠。
Google Interactions API 可以透過上一輪 interaction ID 延續狀態;無狀態實作則要重播相關處理呼叫和結果,不能只重播最後一段文字。應把來源 ID、模式、interaction ID、提示詞版本和輸出結構一起保存。
08
限制與常見失敗模式
代理檢查無法修復本來就不可讀的標籤。Gemini 3.7 Flash 模型卡也把幻覺、速度慢和逾時列為已知限制。正式流程需要重試、逾時、審核狀態,以及處理來源影片的合法權限。
- 捏造細節:強制要求時間戳和不確定性。
- 時間戳接近但不準確:人工覆核邊界敏感結論。
- 微小或短暫 UI:盡量提供更高品質來源檔案。
- 說話人歸屬錯誤:覆核重疊或畫外音。
- 處理慢或逾時:設定重試、逾時和審核狀態。
- 版權與隱私:只處理有權使用的素材。
評估裡必須加入負例:不存在的事件、故意模糊的文字、說話人不明確的音訊,以及影片無法證明的動機。如果系統仍然自信作答,即使正例看起來漂亮,也是不合格。
09
影片理解不等於影片生成
影片理解把既有影片轉換成結構化發現、時間戳、描述或決策;影片生成建立新的視聽內容;影片編輯改變既有內容。三者不是同一項工作。
如果目標是創作或編輯影片,應使用 Gemini Omni 影片提示詞庫。把它與本指南分開,可以保護真實搜尋意圖:分析結果必須指回來源影片,生成結果則要按素材、批准文案和創意 Brief 覆核。
一個範本不能取代兩種驗收。分析即使沒有生成新影片也可能有價值;生成影片即使很好看,只要改錯標籤或把錯誤素材配給某段文案,也仍然失敗。
10
把核驗後的發現交給解說影片流程
應把分析輸出設計成可控交接:先提取帶時間戳的觀察,讓人確認哪些準確、有用,再把已批准內容寫進腳本,為每段腳本綁定正確素材,最後覆核文案和畫面的對應關係。
把核驗後的發現交給解說影片流程
- 1
分析來源影片並返回帶時間戳觀察。
- 2
由人確認哪些觀察準確、有用。
- 3
只把已批准發現轉換成腳本文案。
- 4
為每段腳本綁定正確素材。
- 5
生成交付物並覆核文案與素材對應關係。
TapVid 的正式定位是 Explainer Video Engine。AI 解說影片生成器負責把使用者提供的素材和批准文案做成可覆核影片,但它不會讓上游分析裡的錯誤自動變成事實。人工批准仍是模型輸出和公開內容之間的橋樑。
11
一套實用評估清單
從真實素材裡選一小組測試樣本,用可觀察標準評分。真正合適的模式是能通過你的驗收條件,而不是名字更新的那個。
- 是否定位到正確區間
- 是否標出證據管道
- 螢幕或語音內容是否忠實
- 是否區分「沒展示」和「不是真的」
- 證據不足時是否拒答
- 審核者能否快速覆核
- 多輪之間是否保留影片證據
- 延遲是否符合實際任務
模型或 API 發生變化後要重新評估。把提示詞和預期輸出保存為帶版本的測試範例,才能發現時間戳、拒答、延遲或輸出結構是否改變。
12
常見問題
Gemini 3.7 會生成影片嗎?
Gemini 3.7 Flash 可以分析包括影片在內的多模態輸入,但影片理解不等於影片生成。需要新影片時應使用生成或編輯流程。
怎樣啟用代理影片理解?
在支援的模型和 API 中,把影片輸入的 processing 設為 agentic。預覽能力和支援範圍可能變化,務必查看 Google 最新文件。
所有影片都應該用代理模式嗎?
不應該。長影片、稀疏證據和精準時刻問題更適合代理模式;短影片、低延遲、全域影格精度任務往往更適合靜態處理。
代理模式能保證時間戳準確嗎?
不能。它可以更有針對性地檢查相關區間,但重要時間戳和主張仍然需要核驗。
影片理解的最佳提示詞是什麼?
應包含限定明確的問題、可接受的證據管道、帶時間戳的輸出結構、不確定性規則和明確排除項。
這個主題適合做提示詞庫嗎?
分析範本有價值,但主導搜尋任務是理解和實作功能。因此分析提示詞更適合放在指南裡,生成提示詞則保留在獨立庫中。




