Gemini 3.7 视频理解分析的是已有视频,不是生成一条新视频。智能体模式会规划哪些区间、哪些证据渠道值得进一步检查,适合长视频和精准时刻问题。本指南讲清该怎么选模式、怎样要求可复核的结果,以及什么时候应切换到独立的视频生成流程。
01
什么是 Gemini 3.7 视频理解?
Gemini 3.7 可以在一次请求里综合视频、音频和转录信息。Google 视频理解文档说明,标准处理默认按每秒 1 帧进行视觉采样。它适合稳定画面,但可能漏掉短暂 UI 状态或快速动作。
根据 Google 官方发布文章,智能体处理会规划检查方式、选择相关时刻,并按问题组合转录、音频、帧率和分辨率。它仍基于被选中的证据工作,因此不能保证答案一定正确。
02
智能体模式改变了什么
静态采样回答“从一次均匀检查里能看出什么”;智能体检查回答“为了这个问题,下一步该收集什么证据”。后者可以先在长视频里缩小区间,再对关键位置做更细检查。
LensWalk 等研究也在探索先规划“怎么看视频”的路线。但“智能体”不等于自动正确。更可靠的目标是限定问题、明确证据,并规定证据缺失时必须拒答。
03
选择智能体模式还是静态采样
应按素材特征和漏掉事件的代价选择模式。Google 更推荐智能体处理长视频和精准时刻问题;对 5 分钟以内、重视低延迟的短片,或需要全片可预测帧级精度的任务,静态处理仍有价值。
| 场景 | 建议先用 | 原因 |
|---|---|---|
| 短且稳定的视频,只需要宽泛总结 | 静态 | 一致吞吐比自适应检查更重要。 |
| 90 分钟会议,只找一项稀疏决策 | 智能体 | 证据可能同时存在于发言和短暂屏幕文件中。 |
| 产品演示里错误提示一闪而过 | 智能体 | 答案依赖短暂视觉状态。 |
| 快速动作的每一帧都重要 | 提高帧率的静态处理或专用视觉管线 | 任务要求全局帧精度。 |
| 批量短片只做粗粒度分类 | 静态 | 可预测成本和输出结构更重要。 |
把这套判断当作起点,而不是永久规则。用自己的素材同时测试两种模式,加入短暂视觉事件、纯音频证据和故意无法回答的问题,比较时间戳、无依据陈述、延迟和输出结构。
04
写提示词前先建立输入契约
可靠请求先定义输入契约:视频位置、处理模式、具体问题、输出结构和核验规则。视频输入放在文本提示前,在支持的 API 中使用文档规定的 agentic 值,时间统一要求 MM:SS。
{
"input": [
{
"type": "video",
"uri": "YOUR_VIDEO_URI",
"processing": "agentic"
},
{
"type": "text",
"text": "找到第一次结账失败。返回 MM:SS 时间戳、可见错误文案、之前的用户操作,以及不确定性。"
}
]
}下面只是根据 Google 文档简化的请求结构,不是 TapVid 的实测基准。生产前应核对当前模型和 SDK 语法。输入可来自 File API、Cloud Storage、支持的 YouTube URL,或文档限制内小于 100 MB 的短文件。
05
用证据契约约束可核验答案
弱提示词只要求答案;强提示词会定义问题、证据渠道、带时间戳的输出、不确定性规则和禁止推断的结论。这样可以把“按钮仍然不可用”这类观察,与对用户意图的猜测分开。
- 问题:明确要识别的决策或事件。
- 证据渠道:转录、音频、屏幕文字、UI 状态或可见动作。
- 输出结构:要求时间戳和简短发现。
- 不确定性:证据不足时必须明说。
- 排除项:明确不能推断的结论。
每条发现都应包含时间区间、简短观察、证据渠道、可见或可听的具体依据和置信度。如果素材无法建立答案,正确输出应是“未能建立”并说明缺少什么,而不是给一个听起来合理的猜测。
分析这段视频中的 {{决策}}。每条发现返回 MM:SS 区间、简短观察、证据渠道、具体依据和置信度。不要推断视频未支持的事实。证据缺失时返回“未能建立”,并解释缺少什么。06
常见分析任务的可复制提示词
下面四个模板用于分析已有视频,不是生成或编辑视频。替换占位符,保留时间戳和不确定性要求,并对有后果的发现回看原视频。
定位产品演示失败
检查产品演示中的失败或未完成步骤。每项返回 MM:SS、之前的操作、确切 UI 证据,以及讲解者是否口头承认。没有证据时,不要把停顿标成失败。从长会议中提取决策
找到改变价格、发布时间、功能范围或负责人安排的决策。返回 MM:SS、决策内容、负责人、截止日期和口头依据。把已确认决策与建议、待定问题分开。按批准步骤审核教程
把教程与 {{检查清单}} 对照,每项标记为正确、错误、未展示或不清楚,并给出 MM:SS 和可见 UI 标签。只有旁白不能证明屏幕步骤已经发生。定位短暂物理事件
找到 {{事件}} 第一次在画面上明确完成的时刻。细查前后区间,返回最早可辩护的 MM:SS、完成线索,以及遮挡、运动模糊或剪辑造成的不确定性。把事件、证据和拒答条件写清楚,比添加“深度”“专家级”等形容词更有效,因为审核者可以判断输出是否满足契约。
07
在多轮分析中保留视频上下文
视频分析经常会连续追问:第一轮定位事件,第二轮找相关例子,第三轮整理已批准发现。只有应用正确保留视频和处理状态,这种多轮流程才可靠。
Google Interactions API 可以通过上一轮 interaction ID 延续状态;无状态实现则要重放相关处理调用和结果,不能只重放最后一段文字。应把源 ID、模式、interaction ID、提示词版本和输出结构一起保存。
08
限制与常见失败模式
智能体检查无法修复本来就不可读的标签。Gemini 3.7 Flash 模型卡也把幻觉、速度慢和超时列为已知限制。生产流程需要重试、超时、审核状态,以及处理源视频的合法权限。
- 捏造细节:强制要求时间戳和不确定性。
- 时间戳接近但不准确:人工复核边界敏感结论。
- 微小或短暂 UI:尽量提供更高质量源文件。
- 说话人归属错误:复核重叠或画外音。
- 处理慢或超时:设置重试、超时和审核状态。
- 版权与隐私:只处理有权使用的素材。
评估里必须加入负例:不存在的事件、故意模糊的文字、说话人不明确的音频,以及视频无法证明的动机。如果系统仍然自信作答,即使正例看起来很漂亮,也是不合格。
09
视频理解不等于视频生成
视频理解把已有视频转换成结构化发现、时间戳、描述或决策;视频生成创建新的视听内容;视频编辑改变已有内容。三者不是同一项工作。
如果目标是创作或编辑视频,应使用 Gemini Omni 视频提示词库。把它与本指南分开,可以保护真实搜索意图:分析结果必须指回源视频,生成结果则要按素材、批准文案和创意 Brief 复核。
一个模板不能替代两种验收。分析即使没有生成新视频也可能有价值;生成视频即使很好看,只要改错标签或把错误素材配给某条文案,也仍然失败。
10
把核验后的发现交给解说视频流程
应把分析输出设计成可控交接:先提取带时间戳的观察,让人确认哪些准确、有用,再把已批准内容写进脚本,为每段脚本绑定正确素材,最后复核文案和画面的对应关系。
把核验后的发现交给解说视频流程
- 1
分析源视频并返回带时间戳观察。
- 2
由人确认哪些观察准确、有用。
- 3
只把已批准发现转换成脚本文案。
- 4
为每段脚本绑定正确素材。
- 5
生成交付物并复核文案与素材对应关系。
TapVid 的正式定位是 Explainer Video Engine。AI 解说视频生成器负责把用户提供的素材和批准文案做成可复核视频,但它不会让上游分析里的错误自动变成事实。人工批准仍是模型输出和公开内容之间的桥梁。
11
一套实用评估清单
从真实素材里选一小组测试样本,用可观察标准评分。真正合适的模式是能通过你的验收条件,而不是名字更新的那个。
- 是否定位到正确区间
- 是否标出证据渠道
- 屏幕或语音内容是否忠实
- 是否区分“没展示”和“不是真的”
- 证据不足时是否拒答
- 审核者能否快速复核
- 多轮之间是否保留视频证据
- 延迟是否符合实际任务
模型或 API 发生变化后要重新评估。把提示词和期望输出保存为带版本的测试样例,才能发现时间戳、拒答、延迟或输出结构是否发生变化。
12
常见问题
Gemini 3.7 会生成视频吗?
Gemini 3.7 Flash 可以分析包括视频在内的多模态输入,但视频理解不等于视频生成。需要新视频时应使用生成或编辑流程。
怎样启用智能体视频理解?
在支持的模型和 API 中,把视频输入的 processing 设为 agentic。预览能力和支持范围可能变化,务必查看 Google 最新文档。
所有视频都应该用智能体模式吗?
不应该。长视频、稀疏证据和精准时刻问题更适合智能体模式;短视频、低延迟、全局帧精度任务往往更适合静态处理。
智能体模式能保证时间戳准确吗?
不能。它可以更有针对性地检查相关区间,但重要时间戳和主张仍然需要核验。
视频理解的最佳提示词是什么?
应包含限定明确的问题、可接受的证据渠道、带时间戳的输出结构、不确定性规则和明确排除项。
这个主题适合做提示词库吗?
分析模板有价值,但主导搜索任务是理解和实现功能。因此分析提示词更适合放在指南里,生成提示词则保留在独立库中。




