La comprensión de video con Gemini 3.7 analiza un video existente; no genera uno nuevo. El modo agéntico permite planificar qué intervalos y canales de evidencia revisar con más detalle. Es útil en grabaciones largas y preguntas sobre un instante exacto. Esta guía explica cuándo usarlo y cómo pedir resultados auditables.
01
¿Qué es la comprensión de video con Gemini 3.7?
Gemini 3.7 razona sobre video, audio y transcripción en una solicitud. La documentación de Google describe un muestreo visual predeterminado de un fotograma por segundo. Funciona en clips estables, pero puede perder una interfaz fugaz o una acción rápida.
El anuncio oficial explica que el modo agéntico planifica la inspección, elige momentos relevantes y combina transcripción, audio, frecuencia y resolución. Sigue trabajando con evidencia seleccionada, por lo que no garantiza una respuesta correcta.
02
Qué cambia con el modo agéntico
El muestreo estático pregunta qué se deduce de una pasada uniforme. La inspección agéntica pregunta qué evidencia conviene reunir después para esta pregunta. Así puede acotar un video largo y revisar mejor el intervalo útil.
Sistemas como LensWalk exploran la misma idea: planificar cómo observar el video. Agéntico no significa infalible. Hace falta una pregunta estrecha, pruebas explícitas y una regla para negarse cuando falten datos.
03
Elegir modo agéntico o muestreo estático
Elige según la fuente y el coste de perder un evento. Google destaca el modo agéntico para video largo y preguntas de momentos concretos; el modo estático sigue siendo útil en clips cortos sensibles a la latencia y en precisión global predecible.
| Situación | Empieza con | Motivo |
|---|---|---|
| Clip corto y estable; resumen amplio | Estático | Importa más un rendimiento uniforme. |
| Reunión larga; una decisión escasa | Agéntico | La prueba puede unir voz y un documento breve. |
| Demo con un error que aparece un instante | Agéntico | Depende de un estado visual fugaz. |
| Importa cada fotograma de una acción rápida | Estático con mayor frecuencia o pipeline especializado | La tarea exige precisión global. |
| Lote de clips cortos con etiquetas generales | Estático | Importan coste y esquema predecibles. |
Prueba ambos modos con eventos fugaces, evidencia solo de audio y preguntas imposibles de responder. Evalúa tiempos, afirmaciones sin apoyo, latencia y estabilidad del esquema.
04
Definir el contrato de entrada antes del prompt
Una solicitud fiable define fuente, modo, pregunta, salida y validación. Coloca el video antes del texto, usa el valor agentic documentado y pide tiempos MM:SS.
{
"input": [
{
"type": "video",
"uri": "YOUR_VIDEO_URI",
"processing": "agentic"
},
{
"type": "text",
"text": "Encuentra el primer fallo de checkout. Devuelve MM:SS, texto visible del error, acción anterior e incertidumbre."
}
]
}El ejemplo está abreviado a partir de la documentación de Google; no es una prueba de TapVid. Confirma la sintaxis vigente. Las fuentes pueden usar File API, Cloud Storage, YouTube compatible o datos inline breves dentro del límite documentado de 100 MB.
05
Usar un contrato de evidencia para respuestas fundamentadas
Un buen prompt define pregunta, canales de evidencia, tiempos, incertidumbre y conclusiones prohibidas. Así separa una observación visible de una interpretación sobre la intención de una persona.
- Pregunta: define la decisión o evento exacto.
- Canales: transcripción, audio, texto en pantalla, interfaz o acción.
- Salida: exige tiempos y hallazgos breves.
- Incertidumbre: declara la evidencia insuficiente.
- Exclusiones: limita inferencias no permitidas.
Cada hallazgo debe incluir intervalo, observación, canal, apoyo exacto y confianza. Si el video no lo establece, la respuesta válida es “no establecido” y la explicación de lo que falta.
Analiza este video para {{DECISIÓN}}. Por hallazgo devuelve MM:SS, observación, canal, apoyo exacto y confianza. No inventes. Si falta evidencia, devuelve “no establecido” y explica la carencia.06
Prompts listos para análisis frecuentes
Las plantillas siguientes analizan material existente. Sustituye los marcadores, conserva tiempos e incertidumbre y comprueba los hallazgos importantes contra la fuente.
Encontrar un fallo en una demo
Encuentra pasos fallidos o incompletos. Devuelve MM:SS, acción anterior, prueba exacta de interfaz y reconocimiento verbal. Una pausa no es un fallo sin evidencia.Extraer decisiones de una reunión larga
Encuentra decisiones sobre precio, fecha, alcance o responsable. Devuelve MM:SS, decisión, dueño, fecha y prueba hablada. Separa decisiones de propuestas.Auditar un tutorial contra pasos aprobados
Compara el tutorial con {{LISTA}}. Marca correcto, incorrecto, ausente o incierto. Incluye MM:SS y etiqueta visible. La narración sola no prueba un paso.Localizar un evento físico breve
Encuentra el primer momento en que {{EVENTO}} termina visiblemente. Devuelve el tiempo más temprano defendible, la señal y la ambigüedad por oclusión, desenfoque o corte.Evento, prueba y condición de rechazo son más útiles que palabras vagas como “profundo” o “experto”, porque convierten la salida en algo comprobable.
07
Conservar el contexto en análisis de varios turnos
El análisis de varios turnos funciona solo si se conserva el video y el estado de procesamiento. Una primera pregunta ubica el evento y las siguientes buscan ejemplos relacionados.
Interactions API permite continuar desde una interacción previa. Sin estado hay que repetir llamadas y resultados relevantes, no solo la última respuesta. Guarda ID de fuente, modo, interacción, versión del prompt y esquema.
08
Límites y fallos habituales
La inspección agéntica no arregla una etiqueta ilegible. La ficha del modelo incluye alucinaciones, lentitud y tiempos de espera. Un flujo real necesita reintentos, límites, revisión y permiso para procesar la fuente.
- Detalle inventado: exige tiempo e incertidumbre.
- Tiempo cercano pero incorrecto: verifica los límites.
- Interfaz pequeña o fugaz: usa mejor fuente.
- Atribución de hablante: revisa voces superpuestas.
- Lentitud o timeout: añade reintentos y revisión.
- Derechos y privacidad: procesa solo fuentes autorizadas.
Incluye casos negativos: evento ausente, texto ilegible, hablante ambiguo y motivo no demostrable. Responder con seguridad en esos casos es un fallo.
09
Comprender video no es generar video
Comprender video produce hallazgos y tiempos desde un video existente. Generar crea contenido nuevo y editar transforma material existente. Son trabajos distintos.
Para ejemplos de creación y edición, consulta la biblioteca de prompts de Gemini Omni. Separarla de esta guía protege la intención: el análisis apunta a la fuente y la generación se revisa contra recursos, texto aprobado y brief.
Una sola plantilla no sustituye ambas revisiones. Un análisis puede ser útil sin crear video; un video atractivo puede fallar si cambia una etiqueta o usa el recurso equivocado.
10
Convertir hallazgos verificados en un explicativo
Diseña una entrega controlada: extrae observaciones con tiempo, apruébalas, convierte solo las confirmadas en guion, asigna los recursos correctos y revisa la correspondencia.
Convertir hallazgos verificados en un explicativo
- 1
Analizar y devolver observaciones con tiempo.
- 2
Aprobar hallazgos correctos y útiles.
- 3
Convertir solo hallazgos aprobados en guion.
- 4
Asignar el recurso correcto a cada sección.
- 5
Generar y revisar correspondencia entre texto y recursos.
TapVid es un Explainer Video Engine. El generador de videos explicativos con IA transforma recursos y texto aprobados en un entregable revisable; no convierte una afirmación previa en verdadera.
11
Lista práctica de evaluación
Evalúa fuentes reales con criterios observables. El mejor modo es el que cumple tus pruebas de aceptación, no el que tiene el nombre más nuevo.
- Intervalo correcto
- Canal de evidencia indicado
- Texto visible o hablado fiel
- Diferencia entre no mostrado y no verdadero
- Rechazo cuando falta evidencia
- Verificación rápida
- Continuidad de evidencia entre turnos
- Latencia aceptable
Repite las pruebas cuando cambie el modelo o la API. Conserva prompts y salidas esperadas como fixtures versionados para detectar cambios en tiempos, rechazo, latencia o estructura.
12
Preguntas frecuentes
¿Gemini 3.7 genera videos?
Gemini 3.7 Flash analiza entradas multimodales, pero comprender no es generar. Usa un flujo de creación o edición cuando necesites un video nuevo.
¿Cómo activo el modo agéntico?
En un modelo y API compatibles, establece el procesamiento del video en agentic. Confirma la sintaxis y disponibilidad actuales en Google.
¿Debo usarlo en todos los videos?
No. Es útil en videos largos y momentos escasos. El modo estático suele encajar mejor en clips cortos, sensibles a latencia o con precisión global.
¿Garantiza tiempos exactos?
No. Puede revisar mejor intervalos relevantes, pero los tiempos importantes todavía deben validarse.
¿Cuál es el mejor prompt?
Define pregunta estrecha, canales, salida con tiempos, regla de incertidumbre y exclusiones.
¿Conviene una biblioteca de prompts?
Las plantillas ayudan, pero la intención principal es comprender e implementar. Deja el análisis en una guía y la generación en una biblioteca aparte.




